Hugging Face TGI Benchmarking 工具:如何对 LLM 推理部署做吞吐与延迟基准测试
Hugging Face 介绍其 Text Generation Inference(TGI)附带的 TGI Benchmarking 工具,用于在吞吐之外同时测量延迟(含 TTFT),帮助用户根据场景权衡调优 LLM 部署。
Hugging Face 介绍其 Text Generation Inference(TGI)附带的 TGI Benchmarking 工具,用于在吞吐之外同时测量延迟(含 TTFT),帮助用户根据场景权衡调优 LLM 部署。
Hugging Face 发布教程,介绍如何使用 Sentence Transformers 库微调或从零训练嵌入模型,覆盖数据集、损失函数、训练参数、评估器和 Trainer 五个组件。
Meta 发布开源评测框架 CyberSecEval 2,用于评估 LLM 在生成不安全代码、提示词注入、协助网络攻击、代码解释器滥用和自动化攻击能力等方面的安全风险。评测显示,LLM 平均协助网络攻击的合规率已从上一版的 52% 降至 28%;提示词注入防护仍未解决,模型在端到端漏洞利用上能力有限。全部代码开源,并提供 leaderboard,欢迎社区贡献。
TII 发布开源模型系列 Falcon 2,包含 11B 基础 LLM 和具备图像理解能力的 11B VLM,训练数据超过 5000B token,支持英语及另外 10 种语言。
OpenAI 宣布与 News Corp 签署多年期全球合作伙伴关系,将其优质新闻内容引入 OpenAI 的生成式 AI 产品和平台。
Hugging Face 宣布 Inference Endpoints 新增 AWS Inferentia2(Inf2)实例支持,可将 Hub 上模型几步点击部署到 Inferentia2。
OpenAI 表示,AGI 有潜力惠及生活的几乎各个方面,因此必须以负责任的方式开发和部署。
Hugging Face 与 AMD 合作,将 AMD Instinct MI300 GPU 深度集成到 Hugging Face 平台,用户在 Azure ND MI300x V5 上使用 transformers 和 text-generation-inference 无需改代码。
Hugging Face Spaces 推出 Dev Mode,用户可一键通过 VS Code 或 SSH 直连 Space 编辑代码,无需再用 git 推送本地更改,编辑后点“Refresh”即可测试。该功能目前处于 beta 阶段,仅面向 PRO 订阅用户开放,改动确认满意后可 commit 并 merge 持久保存。目前社区已创建超过 500,000 个 Spaces。
Hugging Face 宣布推出 Dell Enterprise Hub(dell.huggingface.co),用于在 Dell 平台上便捷地本地训练和部署开源模型。
Hugging Face 与 Microsoft 在 Microsoft Build 上深化合作,扩展 Azure Model Catalog 的 Hugging Face Collection,新增 Llama 3、Mistral 7B、Command R Plus、Qwen 1.5 110B 等,支持在 Azure AI Studio 一键部署。
OpenAI 与行业领先的选角和导演专业人士合作,从超过 400 份投稿中筛选,最终选定 ChatGPT 的 5 个语音。
OpenAI 改进了 ChatGPT 的数据分析功能,用户可与表格和图表交互,并直接从 Google Drive 和 Microsoft OneDrive 添加文件。
OpenAI 宣布与 Reddit 达成合作,将 Reddit 的独特内容引入 ChatGPT 及其产品。本条为官方公告摘要,feed 未提供完整正文。
推荐理由:OpenAI 官方宣布与 Reddit 达成合作,读者可据此关注 Reddit 内容进入 ChatGPT 后对产品信息来源的影响。
Hugging Face 在 Transformers 中新增 KV Cache 量化功能,通过降低缓存精度显著减少长上下文生成的内存占用,同时保持生成质量。
Canva 是一个视觉传播平台,每月有超过 175 million 人使用它制作演示文稿、视频、文档、网站和社交媒体图片等。世界上大多数知识工作者缺乏设计训练,Canva 凭借易用的界面、丰富的素材库和省时工具,让任何人都能创作出视觉效果出色的内容。
OpenAI 宣布 Ilya Sutskever 将离开公司,Jakub Pachocki 接任首席科学家。该消息由 OpenAI 官方发布,正文内容未能抓取,仅标题可用。
推荐理由:OpenAI 官宣核心人事变动,首席科学家由 Ilya Sutskever 更替为 Jakub Pachocki,可关注后续研究路线走向。
Google 发布 PaliGemma 视觉语言模型系列,采用 SigLIP-So400m 图像编码器加 Gemma-2B 文本解码器的架构,提供 pt、mix、ft 三类checkpoint,支持 224x224、448x448、896x896 三种分辨率和 bfloat16、float16、float32 三种精度。
推荐理由:原文由官方介绍模型架构、三种checkpoint类型、基准分数和transformers推理微调用法,可作为上手PaliGemma的实用参考。
Hugging Face 与 LangChain 联合发布合作伙伴包 langchain_huggingface,由双方共同维护,旨在让 LangChain 用户更快用上 Hugging Face 生态的新功能。
Hugging Face 与 TII 推出 Open Arabic LLM Leaderboard(OALL),为阿拉伯语大模型提供专门的评测与比较平台,服务全球超 3.8 亿阿拉伯语使用者。
OpenAI 宣布推出新旗舰模型 GPT-4o(GPT-4 Omni),该模型可实时对音频、视觉和文本进行推理。
推荐理由:官方宣布新旗舰模型 GPT-4o,可实时跨音频、视觉和文本推理,是了解该模型定位的直接信源。
OpenAI 发布 GPT-4o,并在 ChatGPT 中向免费用户开放更多能力。
推荐理由:OpenAI 官方宣布 GPT-4o,并提及免费用户可用性变化,适合想了解该模型基本定位的读者。
OpenAI 宣布推出最新旗舰模型 GPT-4o,并在 ChatGPT 中向免费用户开放更多能力。发布同时带来更多工具供免费用户使用。
推荐理由:OpenAI 官宣新旗舰模型,并说明同步向免费用户开放更多 ChatGPT 能力,适合关注模型可用范围变化。
Hugging Face 发布 Transformers Agents 2.0,新增可基于过往观察迭代的 ReactCodeAgent 与 ReactJsonAgent,并支持社区智能体分享。
推荐理由:官方详解新 Agent 框架的设计原则与多智能体用例,并给出基准结果,开源模型表现可作选型参考。
Hugging Face 组织现在可通过 AWS Marketplace 使用 AWS 账户订阅升级到 Enterprise Hub,费用与公开定价一致,由 AWS 账户结算。
Hugging Face 与 Intel 在 OPEA 框架下演示企业 RAG 应用构建:嵌入模型 BAAI/bge-base-en-v1.5 跑在 Xeon CPU(AMX-FP16 带来 2-3x 性能提升),LLM 经 TGI 服务跑在 Gaudi 2 加速器上,示例为 Intel/neural-chat-7b-v3-3。
OpenAI 发布 Model Spec,一份定义其模型期望行为的规范文档。材料抓取失败,仅标题可用,具体内容细节以原文为准。
OpenAI 推出新工具,帮助研究人员识别由其工具生成的内容,同时宣布加入内容来源与真实性联盟(C2PA)指导委员会,以推动行业标准。
ChatGPT 发布一年多后,OpenAI 阐述了其在 AI 时代的数据处理方法。公司同时推出 Media Manager,供创作者和内容所有者管理自己的内容,并介绍了未来方向。
Stack Overflow 与 OpenAI 宣布达成新的 API 合作,将全球领先的技术知识平台与 OpenAI 最受欢迎的 LLM 模型相结合,为开发者提供支持。
Hugging Face 推出专门评估希伯来语大语言模型的开放排行榜,包含四个基准:希伯来语问答(HeQ 数据集)、情感分析、Winograd Schema 指代消解和英希翻译,均采用 few-shot 提示格式评测。
Artificial Analysis 与 Hugging Face 合作上线 LLM Performance Leaderboard,覆盖 100 多个 serverless LLM API 端点的质量、价格与速度指标。
OpenAI 封禁了与伊朗起源的行动 IUVM 相关的账号,该行动利用 AI 生成并翻译支持伊朗、反对以色列和反对美国的网站内容。
Hugging Face 展示如何用自定义 inference handler 在 Inference Endpoints 上部署 Whisper ASR,并结合 Pyannote diarization pipeline 实现说话人分离,以及通过投机解码加速推理。
OpenAI 封禁了与中国相关的 "Spamouflage" 影响力行动所使用的账号。该行动利用 AI 研究社交媒体活动、生成帖子,并调试一个此前未被报道的网站。
OpenAI 封禁了与一个此前未报告、源自以色列的影响行动相关的账号,该行动被 OpenAI 命名为 Zero Zeno。行动使用 AI 生成反哈马斯、反卡塔尔、亲以色列、反印度人民党(BJP)以及亲以色列总工会 Histadrut 的内容。
OpenAI 封禁了一批此前未被披露、来自俄罗斯的“Bad Grammar”行动相关账号。该行动利用 AI 生成英语和俄语的 Telegram 评论,涉及乌克兰、摩尔多瓦、波罗的海国家及美国政治话题。
OpenAI 封禁了与俄罗斯来源影响力行动 "Doppelganger" 相关的账号。该行动利用 AI 生成针对乌克兰的反乌社交媒体评论、翻译及多种语言的网站文案。
Hugging Face Leaderboards 团队与 Dottxt 合作研究发现,MMLU 评测对提示词格式高度敏感,各模型分数随 8 种格式波动约 10 个点,Qwen1.5-7B 在不同提示下准确率从 22.9% 到 51.2%,且模型排名也随格式变化。
OpenAI 宣布与《金融时报》(Financial Times)合作,将 FT 的新闻内容引入 ChatGPT。双方还将合作,为 FT 读者打造新的 AI 体验。