Hugging Face 盘点视觉语言模型年度进展:更好、更快、更强
Hugging Face 发布长文,回顾 2024 年 4 月以来视觉语言模型(VLM)的关键变化与趋势。
推荐理由:Hugging Face 系统梳理了过去一年 VLM 的新架构、多模态 RAG、智能体与安全模型,可作为领域入门与选型参考。
Hugging Face 发布长文,回顾 2024 年 4 月以来视觉语言模型(VLM)的关键变化与趋势。
推荐理由:Hugging Face 系统梳理了过去一年 VLM 的新架构、多模态 RAG、智能体与安全模型,可作为领域入门与选型参考。
Hugging Face LeRobot 团队认为机器人泛化本质上是一个数据问题,正通过简化录制流程、简化上传至 Hugging Face Hub、降低硬件成本,让社区数据集快速增长。目前社区贡献主要集中在 So100 和 Koch 机械臂与操作任务,但自动驾驶、辅助机器人、移动导航等领域同样受益。随着数据采集大众化,数据策展成为下一个挑战。
Hugging Face 博客对比 Qwen-3 与 Qwen-2.5、QwQ 的 Jinja chat template,总结出四点设计差异:Qwen-3 通过 enable_thinking 标志配合空 <think></think> 让推理变为可选项,而 QwQ 强制每次推理。
Hugging Face 官方博客介绍如何用 Gradio 将 Python 函数构建为 MCP 服务器,只需安装 gradio[mcp] 并在 .launch() 中设置 mcp_server=True,即可让 LLM 通过 Claude Desktop、Cursor、Cline 等 MCP Client 调用该应用作为工具。
推荐理由:官方教程演示只需在 launch 中设 mcp_server=True 即可把任意 Gradio 应用变成 MCP server,含资源和鉴权等进阶用法。
Intel 推出 AutoRound,一种 weight-only 后训练量化方法,通过符号梯度下降联合优化权重取整和截断范围,支持 INT2 至 INT8 低比特量化。
Hugging Face 开源 PipelineRL,这是一种实验性 LLM 强化学习实现,核心创新是在训练过程中进行 inflight 权重更新,在不停止推理的情况下同步最新模型权重,兼顾高推理吞吐与 on-policy 数据。
Hugging Face 发布 Tiny Agents 教程,展示在 InferenceClient 之上实现 MCP 客户端后,Agent 本质上只是一个 while 循环,全部代码约 50 行 TypeScript。
推荐理由:作者把 MCP 客户端到 Agent 的实现压缩成约 50 行 TypeScript,并提供可运行的开源代码,适合想理解 Agent 与 MCP 基本结构的开发者直接上手。
TNG 基于 olmOCR-7B-0225-preview 微调出一款忠实 OCR 引擎,解决原模型忽略页眉页脚信息的问题,已开源到 HuggingFace。团队用 Qwen2.5-VL-72B-Instruct 生成了 8000 份文档的数据集,在 8xH100 节点上训练 2.5 epochs,默认超参数即可取得良好效果。
TNG 在 Hugging Face 博客发布 LLM 性能系列第二篇,讲解 prefill 与 decode 两个阶段对延迟、吞吐和 GPU 利用率的影响,并比较 static batching、continuous batching 和 prefill-first 等并发策略。
Hugging Face 官方博客发文《17 Reasons Why Gradio Isn't Just Another UI Library》,称 Gradio 不只是 Python UI 库,而是可通过 UI 和 API 与机器学习模型交互的框架。
Cohere 正式成为 Hugging Face Hub 支持的 Inference Provider,也是首个在 Hub 上直接分享并提供模型推理的模型创建方。
Hugging Face 宣布收购开源机器人公司 Pollen Robotics,这是其第五次收购,将开售旗舰人形机器人 Reachy 2,售价 $70,000,已用于 Cornell 和 Carnegie Mellon 等实验室。
推荐理由:官方宣布收购开源机器人公司并开放 Reachy 2 订购,读者可据此了解 Hugging Face 从软件平台走向机器人硬件的路线。
Protect AI 与 Hugging Face 自 2024 年 10 月合作以来,截至 2025 年 4 月 1 日已扫描 Hub 上 141 万个仓库中的 447 万个模型版本,累计在 51,700 个模型中发现 352,000 个不安全或可疑问题。
Cloudflare 与 Hugging Face 达成合作,FastRTC 开发者只需 Hugging Face token 即可使用企业级 WebRTC 基础设施。持有有效 token 的开发者每月可免费传输 10GB 数据,无需信用卡;集成从 FastRTC 0.0.20 起可用,Cloudflare 的 TURN 服务器网络覆盖全球 335 个以上地点。
Inception 联合 MBZUAI 在 Hugging Face 推出 Arabic-Leaderboards Space,整合阿拉伯语 AI 评测,目前包含 AraGen-03-25 和基于 Arabic IFEval 的指令遵循榜单。
Meta 发布 Llama 4 Maverick(约 400B、128 专家)和 Scout(约 109B、16 专家),均为 17B 激活参数的 MoE 原生多模态模型,在最多 40 万亿 token、200 种语言数据上训练。
推荐理由:官方公告给出两款模型的参数、上下文长度与架构细节,读者可以据此评估部署门槛和与 transformers 的集成方式。
Hugging Face 团队宣布 Gradio 每月有超过 100 万开发者使用,并复盘五年增长经验。核心做法包括以 Gradio Blocks 等低层原语代替高层抽象(gr.Blocks 占 80% 用量)、用 share links 一行代码实现应用传播、聚焦机器学习 Web 应用这一细分场景、不设路线图只做快速迭代,以及让每个应用同时生成 API 端点以便本地部署或程序化调用。
Hugging Face 宣布把运营 3 年的 NLP 课程更新扩展为 LLM 课程, hf.co/learn 同步升级。已新增微调 LLM(第 11 章)和构建 Deepseek R1 类推理模型(第 12 章)等章节,并与 LlamaIndex、LangChain、Unsloth、Marimo、Maxime Labonne 合作。
TNG Technology Consulting 分享自托管 LLM 服务时的请求排队优化经验,指出单个"重度用户"大量请求会通过 vLLM 等推理引擎的 FIFO 队列阻塞其他用户。
Hugging Face 在从 AWS 迁向多云(Azure、GCP)后,选择 Infisical 替代 HashiCorp Vault 集中管理 secrets。
Hugging Face 宣布将 Intel Gaudi 硬件支持直接合入 Text Generation Inference(TGI)主代码库(PR #3091),取代此前维护的独立 fork,基于 TGI 多后端架构支持 Gaudi1/2/3 全系列硬件。
DeepSeek-V3 更新版 0324 上架 Hugging Face Hub,架构与原版相同并改为 MIT 许可,重点改进指令遵循、代码与数学能力。官方基准显示 MMLU-Pro 75.9→81.2、AIME 39.6→59.4、LiveCodeBench 39.2→49.2,常与 GPT-4.5 相当、普遍强于 Claude-Sonnet-3.7。
推荐理由:原文汇总了基准对比、能力改进细节和多种本地部署路径,读者可据此评估是否在自己的工作流中替换旧版 V3。
Hugging Face 发布 Sentence Transformers 训练和微调 reranker(Cross Encoder)模型的详细教程,覆盖数据集、损失函数、训练参数、评估器和 CrossEncoderTrainer 五个组件,并介绍 mine_hard_negatives 挖掘难负样本。
推荐理由:教程给出完整可复现的 reranker 微调配方和评测数据,读者可据此在自己领域训练出超过通用大模型的小型 reranker。
Hugging Face 的 Gradio 更新了 gr.Dataframe 组件,过去 6 周关闭了 70 多个相关 issue。新功能包括多单元格选择、行号与 pinned_columns 列固定、复制与全屏按钮、static_columns 静态列,以及 show_search 参数提供的搜索和过滤功能,还改进了键盘导航等无障碍体验。
Hugging Face 为 Inference Endpoints 更新了分析仪表盘,提供实时指标,可即时查看请求延迟、响应时间和错误率,并重构后端加快高流量端点的数据加载。此外新增自定义时间范围与自动刷新功能,以及 Replica 生命周期视图,可跟踪副本从初始化到终止的每个状态变化。
Hugging Face 发布教程,讲解如何用 LM Studio、4bit GGUF 量化的 OlympicCoder 7B 和 VS Code 的 Continue 扩展搭建本地编码助手。
推荐理由:原文给出从 LM Studio 到 VS Code 的完整本地部署步骤,并说明 OlympicCoder 适合竞赛类编码的定位,方法可直接照做。
Hugging Face 于 3 月 14 日向白宫科技政策办公室提交了对白宫 AI 行动计划 RFI 的回应,主张开放 AI 系统与开放科学是提升性能、推广落地和安全保障的关键。
Hugging Face 已将首批 Model 和 Dataset 仓库从 LFS 迁移到 Xet 存储,共 4.5 TB,约占 Hub 下载流量的 6%。Xet 采用内容定义分块(约 64KB chunk)做字节级去重,只传输改动部分;迁移后团队修复了 CAS 下载开销问题(将 GET 延迟降低约 35%)和 Pod 负载不均衡问题。
Google 发布 Gemma 3 系列开源模型,提供 1B/4B/12B/27B 四种尺寸,4B 及以上支持图文输入和 140+ 种语言,上下文窗口扩展到 128K(1B 为 32K)。
推荐理由:文章梳理了 Gemma 3 各尺寸能力变化并给出 transformers、llama.cpp、MLX 的推理用法,便于判断上手方式。
Hugging Face 在 Open R1 第三次更新中发布了从 DeepSeek-R1 蒸馏的 CodeForces-CoTs 数据集(近 10 万样本)、2024 年 IOI 题目构成的 IOI 基准,以及基于 Qwen2.5 Coder 微调的 OlympicCoder-7B 和 OlympicCoder-32B。
推荐理由:Hugging Face 官方复盘训练过程,给出样本打包、学习率等可复用经验,并附带完整数据集、基准和评测代码。
Yaak 与 LeRobot 团队发布开源自驾数据集 L2D(Learning to Drive),R4 版含 100 万个 episode、5000+ 小时驾驶、90+ TB 多模态数据,采集自德国 30 个城市的 60 辆驾校电动车。
Hugging Face 发布端侧推理教程,用 React Native、llama.rn(llama.cpp 绑定)和 react-native-fs 构建可从 Hub 下载 GGUF 模型并完全离线对话的移动应用,代码在 EdgeLLM 仓库。
推荐理由:教程讲解模型选择与 GGUF 量化差异,并用 llama.rn 完整走通端侧聊天应用,方法可直接复用。
Hugging Face 宣布与 JFrog 合作,将 JFrog 的扫描器集成到 Hugging Face Hub,以提升模型安全检测。与仅做模式匹配的 picklescan 不同,JFrog 会解析并分析模型权重中的代码,降低误报,并可检出 pickle 反序列化和 Keras Lambda 层等任意代码执行漏洞。所有公开模型仓库在推送后自动扫描,目前已扫描数亿个文件。
Hugging Face 博客讲解如何用 smolagents 构建一个配备 DuckDuckGoSearchTool 和 VisitWebpageTool 的 CodeAgent,并通过 Arize Phoenix 结合 OpenTelemetry + OpenInference 实现对 Agent 每一步调用的实时追踪与调试。
印度科学理工学院(IISc)与 ARTPARK 和 Hugging Face 合作,将开源多模态多语言数据集 Vaani 开放给全球开发者。
Hugging Face 发布 FastRTC,一个面向 Python 的实时通信库,用于简化实时音视频 AI 应用开发。库内自动处理语音检测与轮次切换,自带 WebRTC Gradio UI,支持 WebRTC 和 WebSocket,可将 Stream 挂载到任意 FastAPI 应用。
推荐理由:官方发布 Python 实时通信库,内置语音检测、Gradio UI 和免费电话接入,作者还演示了接入 LLM 的完整语音对话代码。
Diffusers 团队推出实验性 Remote VAE 功能,通过 huggingface-inference-toolkit 自定义 handler 将 VAE 解码委托给远程端点,以缓解高分辨率图像和视频生成时消费级 GPU 显存不足、offload 延迟和 tiling 画质损失问题。
Google 发布 SigLIP 2 多语言视觉语言编码器家族,在 sigmoid 损失之上加入解码器、Global-Local 损失和 Masked Prediction 等训练目标。新模型在零样本分类、图文检索和为 VLM 提取视觉表征的迁移能力上全面超过旧版 SigLIP,并新增动态分辨率的 naflex 变体和 1B 参数的 Giant 系列,模型已在 Hugging Face 开放。
Hugging Face 发布 SmolVLM2 系列,包含 2.2B、500M 和 256M 三种参数规模,主打让视频理解在手机到服务器等设备上运行。
推荐理由:官方发布三档小尺寸视频理解模型并给出端侧运行方案,读者可以据此评估轻量多模态模型在自己的设备上的可行性。
Hugging Face Hub 新增 Hyperbolic、Nebius AI Studio 和 Novita 三家 serverless 推理提供商,支持 DeepSeek-R1、FLUX.1 等模型,并集成到 Python 和 JS 客户端 SDK。