TGI 推出 Multi-LoRA serving,一次部署可服务多个微调模型
Hugging Face 在 TGI 中推出 Multi-LoRA serving,只部署一次基座模型 mistralai/Mistral-7B-v0.1,即可按请求动态选择 LoRA 适配器,一次部署相当于服务多个微调模型。
推荐理由:原文给出部署步骤、显存开销和成本对比数据,读者可以据此评估一次部署服务多个微调模型是否适合自己的场景。
Hugging Face 在 TGI 中推出 Multi-LoRA serving,只部署一次基座模型 mistralai/Mistral-7B-v0.1,即可按请求动态选择 LoRA 适配器,一次部署相当于服务多个微调模型。
推荐理由:原文给出部署步骤、显存开销和成本对比数据,读者可以据此评估一次部署服务多个微调模型是否适合自己的场景。
Mistral AI 发布 Mamba 架构的 Codestral Mamba,在 Albert Gu 和 Tri Dao 协助下训练,具备线性时间推理和理论无限序列建模能力,已测试 256k token 的上下文检索,参数量 7,285,403,648。
推荐理由:官方介绍了 Mamba 架构在线性推理和长序列上的特点、部署方式与许可证差异,读者可据此评估本地编码助手的可行性。
Hugging Face 宣布 Transformers 与 KerasHub 采用共享模型保存格式,KerasHub 现可直接加载 Hub 上 346,268 个 Transformers 库模型。
推荐理由:官方宣布 Transformers 与 KerasHub 共享模型保存格式,KerasHub 用户可直接加载 Hub 上 300K+ 模型并切换 TensorFlow、JAX 或 PyTorch 后端。
Hugging Face 宣布用户可在 Inference Endpoints 和 Spaces 上使用 Google Cloud TPU v5e 加速 AI 应用。
推荐理由:Hugging Face 官方宣布接入 Google TPU,给出了实例配置和价格,读者可据此评估推理部署的成本选项。
Banque des Territoires(CDC 集团)、Polyconseil 与 Hugging Face 于今年 1 月启动合作,为支持法国学校生态改造计划 EduRénov 构建基于 RAG 的主权数据方案,第一阶段已完成。
Intel 与 MILA 重构了多模态蛋白质语言模型 ProtST,并发布在 Hugging Face Hub 上,演示如何用 Intel Gaudi 2 加速器和 Optimum for Intel Gaudi 库进行推理与微调。
Hugging Face 发布博客,解释通过 Accelerate 使用 DeepSpeed 与 PyTorch FSDP 训练 Mistral-7B 时结果不一致的原因:DeepSpeed 默认把主权重上转 fp32,而 FSDP 原生不强制上转。
Hugging Face 在 TRL 中推出 RLOO(REINFORCE Leave One-Out)在线 RLHF 训练器,作为 PPO 的替代方案。
Hugging Face 解释为何要重新设计 Transformers 文档:内容随文本之外的模态、LLM 与优化时代增量堆积,显得杂乱难导航。改版将面向开发者,转向 code-first 和解决方案导向,并以灵活有机的结构取代僵化的 Diátaxis 分类,通过整合而非追加内容来统一文档体验。
Hugging Face 宣布面向 Amazon SageMaker 的 Embedding Container 正式可用(GA),基于 Text Embedding Inference(TEI),支持在 SageMaker 上高效部署嵌入模型以构建 RAG 等生成式 AI 应用。
Mistral 在 la Plateforme 推出模型定制能力,提供三条路径:开源微调 SDK mistral-finetune(基于 LoRA,可在自有基础设施微调全部开源模型)、平台无服务器微调服务(兼容 Mistral 7B 和 Mistral Small,后续数周将新增模型)以及面向特定客户、支持持续预训练的定制训练服务。
推荐理由:官方同时开放自托管微调 SDK、平台托管服务与定制训练三条路径,读者可据此对比选择适合自己的模型定制方式。
Hugging Face 将 assisted generation(基于 Speculative Sampling)适配并优化到 Intel Gaudi 处理器,现已合入 Optimum Habana,通过 .generate() 的 assistant_model 参数指定 draft 模型即可使用。
Hugging Face 通报其 Spaces 平台遭未授权访问,部分 Spaces 秘钥可能被读取,官方已撤销相关 HF token 并邮件通知受影响用户。官方建议用户刷新密钥或改用细粒度访问 token,已移除 org token、为 Spaces 秘钥部署 KMS,并计划在功能对齐后弃用经典读写 token,同时已报警并向数据保护机构报告。
推荐理由:官方通报了 Spaces 秘钥未授权访问事件、已撤销的 token 范围和 KMS 等整改措施,受影响用户可据此排查自身密钥。
Hugging Face 介绍其 Text Generation Inference(TGI)附带的 TGI Benchmarking 工具,用于在吞吐之外同时测量延迟(含 TTFT),帮助用户根据场景权衡调优 LLM 部署。
Hugging Face 宣布 Inference Endpoints 新增 AWS Inferentia2(Inf2)实例支持,可将 Hub 上模型几步点击部署到 Inferentia2。
Hugging Face 与 AMD 合作,将 AMD Instinct MI300 GPU 深度集成到 Hugging Face 平台,用户在 Azure ND MI300x V5 上使用 transformers 和 text-generation-inference 无需改代码。
Hugging Face Spaces 推出 Dev Mode,用户可一键通过 VS Code 或 SSH 直连 Space 编辑代码,无需再用 git 推送本地更改,编辑后点“Refresh”即可测试。该功能目前处于 beta 阶段,仅面向 PRO 订阅用户开放,改动确认满意后可 commit 并 merge 持久保存。目前社区已创建超过 500,000 个 Spaces。
Hugging Face 宣布推出 Dell Enterprise Hub(dell.huggingface.co),用于在 Dell 平台上便捷地本地训练和部署开源模型。
Hugging Face 与 Microsoft 在 Microsoft Build 上深化合作,扩展 Azure Model Catalog 的 Hugging Face Collection,新增 Llama 3、Mistral 7B、Command R Plus、Qwen 1.5 110B 等,支持在 Azure AI Studio 一键部署。
Hugging Face 在 Transformers 中新增 KV Cache 量化功能,通过降低缓存精度显著减少长上下文生成的内存占用,同时保持生成质量。
Hugging Face 组织现在可通过 AWS Marketplace 使用 AWS 账户订阅升级到 Enterprise Hub,费用与公开定价一致,由 AWS 账户结算。
Hugging Face 与 Intel 在 OPEA 框架下演示企业 RAG 应用构建:嵌入模型 BAAI/bge-base-en-v1.5 跑在 Xeon CPU(AMX-FP16 带来 2-3x 性能提升),LLM 经 TGI 服务跑在 Gaudi 2 加速器上,示例为 Intel/neural-chat-7b-v3-3。
Artificial Analysis 与 Hugging Face 合作上线 LLM Performance Leaderboard,覆盖 100 多个 serverless LLM API 端点的质量、价格与速度指标。
Hugging Face 展示如何用自定义 inference handler 在 Inference Endpoints 上部署 Whisper ASR,并结合 Pyannote diarization pipeline 实现说话人分离,以及通过投机解码加速推理。
OpenAI 面向 API 客户端推出更多企业级功能,包括更多安全特性与管控能力、Assistants API 更新,以及更好管理成本的工具。此次更新旨在加强对企业客户的支持。
医疗与生命科学领域的生成式 AI 平台 Ryght 宣布正式发布 Ryght Preview,现已向所有用户公开。
Hugging Face 博客介绍 Gradio 的 reload 模式,用 gradio app.py 代替 python app.py 启动即可在不重启服务器的情况下载入最新代码改动。
Zama 团队将其基于全同态加密(FHE)的隐私保护机器学习框架 Concrete ML 的预编译模型上线 Hugging Face Endpoints,用户可一键部署 FHE 友好模型(如加密垃圾邮件检测的决策树)并在加密数据上直接推理。
Hugging Face 宣布在 Hub 上推出 Deploy on Google Cloud 集成,可将数千个基础模型通过 Vertex AI 或 GKE 部署到用户自己的 Google Cloud 账户中。
SetFit 是 Hugging Face 与 Intel Labs、UKP Lab 合作开发的少样本微调框架,在 Banking 77 数据集上,5-shot 表现优于 3-shot GPT-4,无需提示词且训练推理速度比 LLM 方法快一个数量级以上。
Hugging Face Hub 推出 Deploy on Cloudflare Workers AI 集成,将 Llama 2 7B、Gemma、Mistral 等热门开源模型以 serverless API 形式部署在 Cloudflare 边缘数据中心的 GPU 上,采用按请求付费模式。
Hugging Face 官方博客介绍 GaLore 如何利用梯度低秩结构降低训练内存,支持在 RTX 4090 等消费级 GPU 上预训练 Llama 架构 7B 模型。优化器状态内存可减少超过 82.5%,可与 8-bit 优化器结合,并支持通过 transformers>=4.39.0 和 galore-torch 使用 galore_adamw 等优化器及 _layerwise 逐层更新。
推荐理由:原文给出GaLore在消费级硬件上预训练7B模型的方法细节和Transformers接入方式,可迁移到实际训练工作流。
Hugging Face 教你在搭载 Intel Core Ultra 7 155H 的笔记本上本地运行 Microsoft Phi-2:用 Optimum Intel 集成的 OpenVINO 对模型权重做 4-bit 量化(80% 权重 4-bit、其余 8-bit),在 Meteor Lake 的 iGPU 上推理。
Hugging Face 推出 quanto,一个面向 Optimum 的 PyTorch 量化后端,支持 int2/int4/int8 和 float8 权重、int8 和 float8 激活,可在 CUDA、MPS 等任意设备上运行。
推荐理由:原文给出 Quanto 的量化能力边界、完整工作流和 transformers 集成方式,读者可直接照此把 float 模型转到低精度部署。
Hugging Face 面向 Enterprise Hub 组织推出 Train on DGX Cloud 服务,基于 Hugging Face AutoTrain 提供无代码微调,支持在 NVIDIA DGX Cloud 上使用 H100 GPU(1x 到 8x 实例)。
Hugging Face 博客介绍如何用 Optimum Intel、Intel Neural Compressor 和 IPEX 将 BGE small/base/large 嵌入模型量化为 int8 并在 Intel Xeon 上加速。
Hugging Face 展示如何在 Intel Gaudi 2 AI 加速器上,用 Optimum Habana 和自定义 pipeline 类运行 Llama 2 系列(7b、13b、70b)进行文本生成,几行代码即可完成。
AMD 与 Hugging Face 联合推出 Pervasive AI Developer Contest,向全球开发者免费提供 AMD 硬件用于构建 AI 应用。
Hugging Face 在 TGI 1.4.0 版本和 Inference Endpoints 中推出 Messages API,兼容 OpenAI Chat Completion API,用户可无缝从 OpenAI 模型切换到开源 LLM。
推荐理由:原文给出 TGI Messages API 的兼容范围、参数限制和从 OpenAI 迁移到开源模型的具体做法,方便评估改造成本。
Hugging Face 宣布 Text Generation Inference(TGI)在 AWS Inferentia2 和 Amazon SageMaker 上正式可用,用于大规模部署和提供 LLM 生产级服务。