Hugging Face TGI Benchmarking 工具:如何对 LLM 推理部署做吞吐与延迟基准测试
Hugging Face 介绍其 Text Generation Inference(TGI)附带的 TGI Benchmarking 工具,用于在吞吐之外同时测量延迟(含 TTFT),帮助用户根据场景权衡调优 LLM 部署。
Hugging Face 介绍其 Text Generation Inference(TGI)附带的 TGI Benchmarking 工具,用于在吞吐之外同时测量延迟(含 TTFT),帮助用户根据场景权衡调优 LLM 部署。
Hugging Face 发布教程,介绍如何使用 Sentence Transformers 库微调或从零训练嵌入模型,覆盖数据集、损失函数、训练参数、评估器和 Trainer 五个组件。
TII 发布开源模型系列 Falcon 2,包含 11B 基础 LLM 和具备图像理解能力的 11B VLM,训练数据超过 5000B token,支持英语及另外 10 种语言。
Hugging Face 宣布 Inference Endpoints 新增 AWS Inferentia2(Inf2)实例支持,可将 Hub 上模型几步点击部署到 Inferentia2。
Hugging Face 与 AMD 合作,将 AMD Instinct MI300 GPU 深度集成到 Hugging Face 平台,用户在 Azure ND MI300x V5 上使用 transformers 和 text-generation-inference 无需改代码。
Hugging Face Spaces 推出 Dev Mode,用户可一键通过 VS Code 或 SSH 直连 Space 编辑代码,无需再用 git 推送本地更改,编辑后点“Refresh”即可测试。该功能目前处于 beta 阶段,仅面向 PRO 订阅用户开放,改动确认满意后可 commit 并 merge 持久保存。目前社区已创建超过 500,000 个 Spaces。
Hugging Face 宣布推出 Dell Enterprise Hub(dell.huggingface.co),用于在 Dell 平台上便捷地本地训练和部署开源模型。
Hugging Face 与 Microsoft 在 Microsoft Build 上深化合作,扩展 Azure Model Catalog 的 Hugging Face Collection,新增 Llama 3、Mistral 7B、Command R Plus、Qwen 1.5 110B 等,支持在 Azure AI Studio 一键部署。
Hugging Face 在 Transformers 中新增 KV Cache 量化功能,通过降低缓存精度显著减少长上下文生成的内存占用,同时保持生成质量。
Google 发布 PaliGemma 视觉语言模型系列,采用 SigLIP-So400m 图像编码器加 Gemma-2B 文本解码器的架构,提供 pt、mix、ft 三类checkpoint,支持 224x224、448x448、896x896 三种分辨率和 bfloat16、float16、float32 三种精度。
推荐理由:原文由官方介绍模型架构、三种checkpoint类型、基准分数和transformers推理微调用法,可作为上手PaliGemma的实用参考。
Hugging Face 与 LangChain 联合发布合作伙伴包 langchain_huggingface,由双方共同维护,旨在让 LangChain 用户更快用上 Hugging Face 生态的新功能。
Hugging Face 与 TII 推出 Open Arabic LLM Leaderboard(OALL),为阿拉伯语大模型提供专门的评测与比较平台,服务全球超 3.8 亿阿拉伯语使用者。
Hugging Face 发布 Transformers Agents 2.0,新增可基于过往观察迭代的 ReactCodeAgent 与 ReactJsonAgent,并支持社区智能体分享。
推荐理由:官方详解新 Agent 框架的设计原则与多智能体用例,并给出基准结果,开源模型表现可作选型参考。
Hugging Face 组织现在可通过 AWS Marketplace 使用 AWS 账户订阅升级到 Enterprise Hub,费用与公开定价一致,由 AWS 账户结算。
Hugging Face 与 Intel 在 OPEA 框架下演示企业 RAG 应用构建:嵌入模型 BAAI/bge-base-en-v1.5 跑在 Xeon CPU(AMX-FP16 带来 2-3x 性能提升),LLM 经 TGI 服务跑在 Gaudi 2 加速器上,示例为 Intel/neural-chat-7b-v3-3。
Hugging Face 推出专门评估希伯来语大语言模型的开放排行榜,包含四个基准:希伯来语问答(HeQ 数据集)、情感分析、Winograd Schema 指代消解和英希翻译,均采用 few-shot 提示格式评测。
Artificial Analysis 与 Hugging Face 合作上线 LLM Performance Leaderboard,覆盖 100 多个 serverless LLM API 端点的质量、价格与速度指标。
Hugging Face 展示如何用自定义 inference handler 在 Inference Endpoints 上部署 Whisper ASR,并结合 Pyannote diarization pipeline 实现说话人分离,以及通过投机解码加速推理。
Hugging Face Leaderboards 团队与 Dottxt 合作研究发现,MMLU 评测对提示词格式高度敏感,各模型分数随 8 种格式波动约 10 个点,Qwen1.5-7B 在不同提示下准确率从 22.9% 到 51.2%,且模型排名也随格式变化。
Hugging Face 团队发布 StarCoder2-15B-Instruct-v0.1,首个采用完全透明、许可开放管线的自对齐代码 LLM,无需人工标注或从专有大模型蒸馏数据。
Hugging Face 推出 Open CoT Leaderboard,追踪 LLM 生成有效链式推理的能力。榜单不评绝对准确率,而是计算有无 CoT 提示的准确率差值 Δ,以检验 CoT 对准确率的实际影响,并对训练数据污染更稳健。评测采用 LogiQA 和 LSAT 数据集(多数属于 AGIEval),任务以选择题形式呈现,目前已实现 Classic 和 Reflect 两种提示策略。
Hugging Face 发布 JAT,一个基于 Transformer 的多用途智能体项目,包含 Gato 的开放复现:发布了覆盖 Atari、BabyAI、Meta-World、MuJoCo 等环境的大量专家 RL 智能体、首个通用智能体训练数据集 JAT dataset(含数十万条专家轨迹)以及可玩电子游戏、控制机器人、执行导航指令的 JAT 模型。
Hugging Face 推出 Open Medical-LLM Leaderboard,为医疗领域大语言模型提供标准化评测平台,以 accuracy 为主要指标,覆盖 MedQA、MedMCQA、PubMedQA 及 MMLU 医学相关子集等多个数据集。
Meta 发布 Llama 3 开源模型,提供 8B 和 70B 两种规模,各有 base 与 instruct 版本,并附基于 Llama 3 8B 微调的 Llama Guard 2,全部上架 Hugging Face Hub。
推荐理由:官方发布说明完整给出模型规格、许可证变化和部署微调路径,读者可据此评估升级与迁移成本。
UC Berkeley、MIT 和 Cornell 研究者推出 LiveCodeBench 排行榜,通过从 LeetCode、AtCoder、CodeForces 收集并标注发布日期的题目,检测并防止 benchmark 污染。
医疗与生命科学领域的生成式 AI 平台 Ryght 宣布正式发布 Ryght Preview,现已向所有用户公开。
Hugging Face 博客介绍 Gradio 的 reload 模式,用 gradio app.py 代替 python app.py 启动即可在不重启服务器的情况下载入最新代码改动。
Zama 团队将其基于全同态加密(FHE)的隐私保护机器学习框架 Concrete ML 的预编译模型上线 Hugging Face Endpoints,用户可一键部署 FHE 友好模型(如加密垃圾邮件检测的决策树)并在加密数据上直接推理。
Hugging Face 发布通用多模态模型 Idefics2,参数量 8B,权重以 Apache 2.0 许可开源,支持任意图文序列输入,可回答图像问题、描述视觉内容、从文档提取信息和执行基础算术。
推荐理由:官方发布 8B 开源多模态模型并给出基准对比和训练数据,读者可以直接在 Hub 和 transformers 中上手微调。
Hugging Face 发布视觉语言模型入门教程,介绍其图像编码器、投影层与文本解码器等核心结构,并列出 LLaVA 1.6、KOSMOS-2、Qwen-VL 等开源模型。
Hugging Face 宣布在 Hub 上推出 Deploy on Google Cloud 集成,可将数千个基础模型通过 Vertex AI 或 GKE 部署到用户自己的 Google Cloud 账户中。
Google 与 Hugging Face 合作发布 CodeGemma,包含专注代码填充的 2B 基座、混合代码与自然语言的 7B 基座,以及 7B Instruct 对话版本,均支持 8K 上下文。
推荐理由:原文给出三个模型规格、基准对比与 FIM 提示词格式,读者可以据此选择适合延迟、显存或对话场景的版本。
Hugging Face 宣布与云安全公司 Wiz 合作,已集成 Wiz 用于漏洞管理和云安全态势管理,并自动修复 Spaces 中的问题。Wiz 研究人员通过 pickle 发现其沙箱计算环境的缺陷,相关漏洞已全部修复。官方建议用户在生产环境弃用 pickle、改用 Safetensors,并警告 pickle 未来可能不再受支持。
DuckDB-NSQL-7B 是 MotherDuck 和 Numbers Station 专为 DuckDB SQL 推出的 text2SQL 模型,基于 Meta 的 Llama-2-7b 微调,可生成包括 SELECT 在内的多种有效 DuckDB SQL 语句。
SetFit 是 Hugging Face 与 Intel Labs、UKP Lab 合作开发的少样本微调框架,在 Banking 77 数据集上,5-shot 表现优于 3-shot GPT-4,无需提示词且训练推理速度比 LLM 方法快一个数量级以上。
Hugging Face Hub 推出 Deploy on Cloudflare Workers AI 集成,将 Llama 2 7B、Gemma、Mistral 等热门开源模型以 serverless API 形式部署在 Cloudflare 边缘数据中心的 GPU 上,采用按请求付费模式。
开源人形机器人 Reachy 的开发商 Pollen Robotics 发布开源库 pollen-vision,提供面向机器人的零样本视觉模型统一接口,无需训练即可开箱使用。
Hugging Face 博客介绍 embedding 量化方法,展示二值量化可将内存与磁盘占用降至 1/32、检索最快提速 45x,配合 rescoring 可保留约 96% 的检索性能;int8 标量量化占用为 1/4、平均提速 3.66x。
推荐理由:原文给出 embedding 量化的原理、代码与实测数据,读者可以照此在检索场景中权衡内存、速度与精度。
Hugging Face 发布面向非技术读者的 Transformers 入门教程,手把手演示如何在 Hugging Face Space 的 JupyterLab notebook 中运行微软的 Phi-2 大语言模型。
Lighthouz AI 与 Hugging Face 合作推出 Chatbot Guardrails Arena,让用户与两个匿名、带 guardrails 的聊天机器人对话,尝试套取虚构银行 XYZ001 客户的姓名、SSN、账号、余额等敏感信息并投票,结果将以 Elo 评分汇入公开排行榜。