Hugging Face 为 Intel Gaudi 优化 assisted generation 加速文本生成
Hugging Face 将 assisted generation(基于 Speculative Sampling)适配并优化到 Intel Gaudi 处理器,现已合入 Optimum Habana,通过 .generate() 的 assistant_model 参数指定 draft 模型即可使用。
Hugging Face 将 assisted generation(基于 Speculative Sampling)适配并优化到 Intel Gaudi 处理器,现已合入 Optimum Habana,通过 .generate() 的 assistant_model 参数指定 draft 模型即可使用。
Hugging Face 通报其 Spaces 平台遭未授权访问,部分 Spaces 秘钥可能被读取,官方已撤销相关 HF token 并邮件通知受影响用户。官方建议用户刷新密钥或改用细粒度访问 token,已移除 org token、为 Spaces 秘钥部署 KMS,并计划在功能对齐后弃用经典读写 token,同时已报警并向数据保护机构报告。
推荐理由:官方通报了 Spaces 秘钥未授权访问事件、已撤销的 token 范围和 KMS 等整改措施,受影响用户可据此排查自身密钥。
Hugging Face 介绍其 Text Generation Inference(TGI)附带的 TGI Benchmarking 工具,用于在吞吐之外同时测量延迟(含 TTFT),帮助用户根据场景权衡调优 LLM 部署。
Hugging Face 宣布 Inference Endpoints 新增 AWS Inferentia2(Inf2)实例支持,可将 Hub 上模型几步点击部署到 Inferentia2。
Hugging Face 与 AMD 合作,将 AMD Instinct MI300 GPU 深度集成到 Hugging Face 平台,用户在 Azure ND MI300x V5 上使用 transformers 和 text-generation-inference 无需改代码。
Hugging Face Spaces 推出 Dev Mode,用户可一键通过 VS Code 或 SSH 直连 Space 编辑代码,无需再用 git 推送本地更改,编辑后点“Refresh”即可测试。该功能目前处于 beta 阶段,仅面向 PRO 订阅用户开放,改动确认满意后可 commit 并 merge 持久保存。目前社区已创建超过 500,000 个 Spaces。
Hugging Face 宣布推出 Dell Enterprise Hub(dell.huggingface.co),用于在 Dell 平台上便捷地本地训练和部署开源模型。
Hugging Face 与 Microsoft 在 Microsoft Build 上深化合作,扩展 Azure Model Catalog 的 Hugging Face Collection,新增 Llama 3、Mistral 7B、Command R Plus、Qwen 1.5 110B 等,支持在 Azure AI Studio 一键部署。
Hugging Face 在 Transformers 中新增 KV Cache 量化功能,通过降低缓存精度显著减少长上下文生成的内存占用,同时保持生成质量。
Hugging Face 组织现在可通过 AWS Marketplace 使用 AWS 账户订阅升级到 Enterprise Hub,费用与公开定价一致,由 AWS 账户结算。
Hugging Face 与 Intel 在 OPEA 框架下演示企业 RAG 应用构建:嵌入模型 BAAI/bge-base-en-v1.5 跑在 Xeon CPU(AMX-FP16 带来 2-3x 性能提升),LLM 经 TGI 服务跑在 Gaudi 2 加速器上,示例为 Intel/neural-chat-7b-v3-3。
Artificial Analysis 与 Hugging Face 合作上线 LLM Performance Leaderboard,覆盖 100 多个 serverless LLM API 端点的质量、价格与速度指标。
Hugging Face 展示如何用自定义 inference handler 在 Inference Endpoints 上部署 Whisper ASR,并结合 Pyannote diarization pipeline 实现说话人分离,以及通过投机解码加速推理。
OpenAI 面向 API 客户端推出更多企业级功能,包括更多安全特性与管控能力、Assistants API 更新,以及更好管理成本的工具。此次更新旨在加强对企业客户的支持。
医疗与生命科学领域的生成式 AI 平台 Ryght 宣布正式发布 Ryght Preview,现已向所有用户公开。
Hugging Face 博客介绍 Gradio 的 reload 模式,用 gradio app.py 代替 python app.py 启动即可在不重启服务器的情况下载入最新代码改动。
Zama 团队将其基于全同态加密(FHE)的隐私保护机器学习框架 Concrete ML 的预编译模型上线 Hugging Face Endpoints,用户可一键部署 FHE 友好模型(如加密垃圾邮件检测的决策树)并在加密数据上直接推理。
Hugging Face 宣布在 Hub 上推出 Deploy on Google Cloud 集成,可将数千个基础模型通过 Vertex AI 或 GKE 部署到用户自己的 Google Cloud 账户中。
SetFit 是 Hugging Face 与 Intel Labs、UKP Lab 合作开发的少样本微调框架,在 Banking 77 数据集上,5-shot 表现优于 3-shot GPT-4,无需提示词且训练推理速度比 LLM 方法快一个数量级以上。
Hugging Face Hub 推出 Deploy on Cloudflare Workers AI 集成,将 Llama 2 7B、Gemma、Mistral 等热门开源模型以 serverless API 形式部署在 Cloudflare 边缘数据中心的 GPU 上,采用按请求付费模式。
Hugging Face 官方博客介绍 GaLore 如何利用梯度低秩结构降低训练内存,支持在 RTX 4090 等消费级 GPU 上预训练 Llama 架构 7B 模型。优化器状态内存可减少超过 82.5%,可与 8-bit 优化器结合,并支持通过 transformers>=4.39.0 和 galore-torch 使用 galore_adamw 等优化器及 _layerwise 逐层更新。
推荐理由:原文给出GaLore在消费级硬件上预训练7B模型的方法细节和Transformers接入方式,可迁移到实际训练工作流。
Hugging Face 教你在搭载 Intel Core Ultra 7 155H 的笔记本上本地运行 Microsoft Phi-2:用 Optimum Intel 集成的 OpenVINO 对模型权重做 4-bit 量化(80% 权重 4-bit、其余 8-bit),在 Meteor Lake 的 iGPU 上推理。
Hugging Face 推出 quanto,一个面向 Optimum 的 PyTorch 量化后端,支持 int2/int4/int8 和 float8 权重、int8 和 float8 激活,可在 CUDA、MPS 等任意设备上运行。
推荐理由:原文给出 Quanto 的量化能力边界、完整工作流和 transformers 集成方式,读者可直接照此把 float 模型转到低精度部署。
Hugging Face 面向 Enterprise Hub 组织推出 Train on DGX Cloud 服务,基于 Hugging Face AutoTrain 提供无代码微调,支持在 NVIDIA DGX Cloud 上使用 H100 GPU(1x 到 8x 实例)。
Hugging Face 博客介绍如何用 Optimum Intel、Intel Neural Compressor 和 IPEX 将 BGE small/base/large 嵌入模型量化为 int8 并在 Intel Xeon 上加速。
Hugging Face 展示如何在 Intel Gaudi 2 AI 加速器上,用 Optimum Habana 和自定义 pipeline 类运行 Llama 2 系列(7b、13b、70b)进行文本生成,几行代码即可完成。
AMD 与 Hugging Face 联合推出 Pervasive AI Developer Contest,向全球开发者免费提供 AMD 硬件用于构建 AI 应用。
Hugging Face 在 TGI 1.4.0 版本和 Inference Endpoints 中推出 Messages API,兼容 OpenAI Chat Completion API,用户可无缝从 OpenAI 模型切换到开源 LLM。
推荐理由:原文给出 TGI Messages API 的兼容范围、参数限制和从 OpenAI 迁移到开源模型的具体做法,方便评估改造成本。
Hugging Face 宣布 Text Generation Inference(TGI)在 AWS Inferentia2 和 Amazon SageMaker 上正式可用,用于大规模部署和提供 LLM 生产级服务。
Hugging Face 联合 Intel 展示了在第四代 Xeon(借助 AMX 加速)上优化 StarCoder-15B 推理的方法,通过 SmoothQuant 实现 Q8 量化,TTFT 加速约 2.19x、TPOT 加速约 2.20x 且精度无损失;再结合 4bit 权重唯一量化和 assisted generation,实现超过 7x 的推理加速。
Hugging Face 宣布与 Google Cloud 建立战略合作伙伴关系,围绕开放科学、开源和云硬件展开合作。
推荐理由:来自当事方官方公告,讲清了合作的四个方向和具体落地场景,读者可了解 Hugging Face 模型在 Google Cloud 上的可用路径。
Hugging Face 与 ONNX Runtime 团队介绍用 Olive 优化的 SD Turbo 和 SDXL Turbo 模型,在 NVIDIA GPU 上用 ONNX Runtime CUDA 和 TensorRT 执行提供者加速推理。
Hugging Face 发布教程,讲解如何把 ComfyUI 工作流转换成 Gradio 应用并部署到 Spaces 的 ZeroGPU 免费推理。
推荐理由:原文给出从导出 ComfyUI 工作流到在 Spaces ZeroGPU 免费部署的完整步骤,含模型映射和代码改动细节,可迁移到自己的工作流。
Hugging Face 博客介绍社区开发的轻量微调库 Unsloth,与 Hub、transformers、PEFT、TRL 完全兼容,可配合 SFTTrainer、DPOTrainer、PPOTrainer 使用。
推荐理由:原文给出 Unsloth 与 TRL 的完整用法和 59 组基准数据,微调提速与显存收益可直接迁移到自己的 QLoRA 工作流。
Hugging Face 博客演示如何用 speculative decoding 将 Whisper 语音转录推理时间降低约 2 倍,同时从数学上保证输出与原模型完全一致。
推荐理由:原文给出了完整的 speculative decoding 原理和实测代码,读者可以直接把它作为 Whisper 推理加速的替换方案。
Mistral AI 开放 La Plateforme 平台 Beta,任何人今日起可注册使用其 API。
推荐理由:官方首发公告给出各端点的模型、MT-Bench 与 MTEB 分数和定价权衡,读者可据此评估选型。
Mistral 发布 Mixtral 8x7B,一个采用 Mixture of Experts 架构的开放模型,在多数基准上超越 Llama 2 70B 并达到或超过 GPT-3.5,MT-Bench 得分 8.30。
推荐理由:Mixtral 8x7B 以 MoE 架构达到开放模型新高度,本文同时给出生态内的推理、量化、微调与部署路径,方法可直接照做。
Hugging Face 发布 Optimum-NVIDIA 推理库,改动一行代码即可在 NVIDIA 平台上获得最高 28 倍吞吐提升和 1200 tokens/second,首 token 延迟最高快 3.3 倍。
Hugging Face 与 AMD 宣布 Transformers 全部模型和任务无需改代码即可在 AMD Instinct GPU 上运行。
Hugging Face 在 Inference API 中实现 LoRA 适配器动态加载/卸载,保持基础模型常驻,使 Hub 上公开 Diffusion 模型的 LoRA 推理大幅提速。