NVIDIA NIM 支持 Hugging Face 上超 10 万个 LLM 的一键部署
NVIDIA NIM 推出单一 Docker 容器,可在 Hugging Face 上快速部署超过 100,000 个 LLM。容器会自动识别模型格式、架构与量化方式(如 FP16、FP8、GGUF、AWQ),并从 NVIDIA TensorRT-LLM、vLLM 和 SGLang 中选择推理后端,无需手动配置。
NVIDIA NIM 推出单一 Docker 容器,可在 Hugging Face 上快速部署超过 100,000 个 LLM。容器会自动识别模型格式、架构与量化方式(如 FP16、FP8、GGUF、AWQ),并从 NVIDIA TensorRT-LLM、vLLM 和 SGLang 中选择推理后端,无需手动配置。
Gradio 团队宣布截至 5.38.0 版本的五项 MCP 服务器改进:新增 File Upload MCP 服务器让智能体直接向 Gradio 应用上传本地文件。
Hugging Face 提出 FutureBench,通过真实世界事件评测 AI 智能体预测未来的能力。该基准从新闻和 Polymarket 预测市场采集题目:基于 smolagents 的智能体用 DeepSeek-V3 生成预测问题,每次抓取约生成 5 道题、时间范围为一周,另有每周约 8 道来自 Polymarket 的问题。
Hugging Face 推出 Ettin 套件,用 ModernBERT 配方在相同数据(2T tokens)、架构和训练流程下训练出 17M 至 1B 参数的成对 encoder-only 与 decoder-only 模型,全部数据开源可复现。
Hugging Face 宣布 Hub 已从 Git LFS 迁移到 Xet,半年内 500,000 个仓库、20 PB 数据完成迁移,超 100 万用户在使用,5 月起新用户和组织默认启用 Xet。
推荐理由:官方复盘 Hub 从 Git LFS 迁移到 Xet 的完整过程,详解 Git LFS Bridge 与后台迁移机制及规模化踩坑经验。
Hugging Face 发布官方 MCP Server 并撰文复盘其构建过程,通过一个 URL 提供可定制的 Hub 工具接入和数千个 Spaces 应用访问。
推荐理由:官方团队复盘自建 MCP Server 的传输选型与部署权衡,涵盖 Streamable HTTP、无状态配置等可迁移经验。
Hugging Face 发布 Python 库 ScreenEnv,可在 Docker 容器中创建隔离的 Ubuntu 桌面环境,用于测试和部署 GUI 智能体(Computer Use agents)。
推荐理由:原文给出在 Docker 中运行隔离 Ubuntu 桌面环境的用法和 API 与 MCP 两种接入方式,读者可直接复用搭建 GUI 智能体。
Hugging Face 提出机器人异步推理方案,将动作预测与执行解耦:PolicyServer 负责推理,RobotClient 维护动作队列并执行,两者通过 gRPC 通信,比同类 REST API 快约 5 倍。该方案已在 SmolVLA 中引入,任务完成时间提速约 2 倍,成功率相当,使机器人不再等待推理,支持中途重规划和更快的控制循环。
Hugging Face 与 Pollen Robotics 发布开源桌面机器人 Reachy Mini,面向人机交互、创意编程与 AI 实验,提供 $399 的 Lite 版和 $499 的无线自主版(含树莓派 4 与电池)。
Hugging Face 发布教程,讲解如何通过 MCP 协议给 LLM 添加图像编辑、转写等新能力。Gradio 自 5.28.0 版本起支持 MCP 协议,使 Hugging Face Spaces 成为可按 MCP Compatible 筛选的 MCP 服务器集合。
推荐理由:官方教程给出把 Hugging Face Spaces 当作 MCP 工具来源的具体步骤,读者可照做给自己的 LLM 添加图像编辑等新能力。
Hugging Face 与 AMD 合作,为在 8 张 MI300X 节点上用 VLLM 以 FP8 部署 Llama 3.1 405B 优化 kernel,包含融合残差连接、RMS norm 与 FP8 转换、融合 SwiGLU 与 FP8 转换、skinny GEMM 三个优化 kernel,显著降低解码延迟。
Hugging Face 基础设施团队分享支撑其生产基础设施的三个关键监控告警:NAT Gateway 高吞吐量告警用于发现异常流量峰值并优化成本(如通过 DNS 覆盖让对象存储访问走私有低成本路径),以及 Hub 请求日志归档成功率告警。
Hugging Face 团队在 nanoVLM 项目中发现训练慢的根源是数据管线浪费,朴素 padding 约浪费 60% 的 batch。文章分五阶段构建高效管线,用背包问题的 greedy 与 bin-packing 策略打包样本,兼顾 token 长度和图像预算,显著减少 padding。
Hugging Face 发布完全开源的 SmolLM3-3B,用 11.2T tokens 分三阶段预训练,性能超越 Llama-3.2-3B 和 Qwen2.5-3B,并与 Qwen3-4B、Gemma3-4B 等更大模型竞争力相当。
推荐理由:官方同步放出模型、三阶段预训练配比和双模式推理完整训练配方,适合想复现或改进同级小模型的研究者对照学习。
Hugging Face 联合 NeurIPS 2025 举办 E2LM 竞赛,旨在构建能捕捉 LLM 早期训练阶段(约 200B token 以内)推理与科学知识信号的新基准。
Hugging Face 发布长文教程,讲解如何用 Sentence Transformers 训练和微调稀疏嵌入模型,并演示得到 sparse-encoder/example-inference-free-splade-distilbert-base-uncased-nq。
NVIDIA 发布 Llama Nemotron Nano VL,一个面向智能文档处理的 8B 视觉语言模型,已在 Hugging Face 提供下载,并可通过 NVIDIA NIM API 使用。
SGLang 现已支持 Hugging Face transformers 作为推理后端,任何 transformers 兼容模型可开箱获得高性能推理。
Hugging Face 发布教程,展示用 QLoRA 配合 diffusers 在单张 GPU 上以约 9GB 峰值显存微调 FLUX.1-dev 学习 Alphonse Mucha 画风,700 步在 RTX 4090 上约 41 分钟完成,标准 BF16 LoRA 则需 26GB。
推荐理由:官方博客给出完整的 QLoRA 微调配方和实测显存与耗时数据,方法可直接迁移到消费级显卡上的 FLUX.1-dev 定制训练。
Hugging Face 宣布 Groq 成为 Hub 上的 Inference Provider,可直接在模型页和 JS、Python 客户端 SDK 中调用 Groq 托管的开源模型,包括 Meta 的 Llama 4 和 Qwen 的 QWQ-32B。
Hugging Face 官方博客介绍 Kernel Hub,开发者可通过 kernels 库的 get_kernel 一行代码加载预编译的优化计算内核,自动匹配 Python、PyTorch 和 CUDA 版本。
推荐理由:原文给出从加载到基准测试的完整可复现步骤,读者可据此评估把优化内核接入自己模型的实际收益。
Featherless AI 成为 Hugging Face Hub 支持的 Inference Provider,用户可在模型页面直接使用其 serverless 推理服务。
NVIDIA 发布 Isaac GR00T N1.5——首个开源通用人形机器人基础模型 GR00T N1 的首次重大更新,并提供用 LeRobot SO-101 机械臂遥操作数据进行微调的完整教程。
Hugging Face 与 NVIDIA 在 GTC Paris 上宣布推出 Training Cluster as a Service,让全球研究机构可按需申请 GPU 集群并只为训练运行时长付费。
Hugging Face 发布 ScreenSuite,一套覆盖感知、定位、单步操作和多步智能体四类能力的 GUI Agent 评测套件,整合 13 个基准,如 ScreenQA-Short、ScreenSpot-Pro、AndroidWorld 和 OSWorld。
Hugging Face 在 nanoVLM 仓库中从零实现 KV Caching,生成速度提升 38%。文章讲解自回归生成中重复计算 K/V 的冗余来源,展示通过逐层缓存字典、start_pos 位置对齐以及将 generate 循环拆分为 prefill 和 decode 两阶段来消除冗余计算,并指出这是速度与显存之间的权衡。
H Company 发布开源 Action VLM 系列 Holo1(含 Holo1-3B 与 Holo1-7B),并同步开源含 1,639 项 UI 任务的 WebClick 多模态定位基准。
推荐理由:官方给出模型规格、定位准确率和每任务成本数字,读者可据此评估这套开源 GUI 自动化方案的实际性价比。
Hugging Face 在 TRL v0.18.0 通过 PR #3394 引入 vllm_mode="colocate",让 vLLM 不再以独立 HTTP 服务器运行,而是嵌入同一分布式进程组,与 GRPO 训练共享同一批 GPU,消除训练与生成之间的互相等待。
Hugging Face 发布 450M 参数的开源视觉-语言-动作模型 SmolVLA,基于 lerobot 标签下的社区共享数据集预训练,可在消费级硬件(甚至 CPU 或 MacBook)上运行和训练。
Hugging Face 发布研究,让 CodeAgent 以强制 JSON 结构同时生成 thoughts 和 code,在 GAIA、MATH、SimpleQA、Frames 等基准上比常规 CodeAgent 平均高出 2-7 个百分点。
推荐理由:原文给出结构化输出结合 CodeAgent 的实测数据与适用边界,读者可据此判断自己的模型规模是否适合启用该方案。
TRL 的 GRPOTrainer 通过 compute_liger_loss 接入 liger_kernel 的 GRPO loss。
Hugging Face 发布 Python 版 Tiny Agents,将 huggingface_hub SDK 扩展为 MCP Client,用约 70 行代码即可构建可调用 MCP 工具的 Agent。
推荐理由:官方博客展示了 MCP Client 如何让约 70 行 Python 代码搭起可调用工具的 Agent,核心思路可迁移到自己的项目。
Hugging Face 与 Dell 在 Dell Tech World 上发布新版 Dell Enterprise Hub,提供模型与应用套件,可在 Dell AI 服务器和 AI PC 上本地部署 AI。
Hugging Face 联合 TII 推出 Falcon-Arabic,一个基于 Falcon 3 架构的 7B 参数多语言大模型,支持阿拉伯语和英语。模型通过扩展 32,000 个阿拉伯语 token 进行持续预训练,上下文长度为 32,000 tokens。
Hugging Face 发布 nanoVLM,一个纯 PyTorch 的轻量工具包,可在免费 Colab 上启动视觉语言模型训练,灵感来自 Andrej Karpathy 的 nanoGPT。
推荐理由:原文拆解了 nanoVLM 的架构、训练与推理全流程,代码轻量可读,适合想从头理解 VLM 训练机制的读者上手实践。
Hugging Face 发布 Diffusers 量化后端解读文章,以 black-forest-labs/FLUX.1-dev 为例实测 bitsandbytes、torchao、Quanto、GGUF 和 FP8 Layerwise Casting 五种方案。
推荐理由:文章系统对比了 Diffusers 各量化后端在 Flux-dev 上的内存、速度与画质差异,并给出选型建议和可复现代码。
Microsoft 与 Hugging Face 在 Microsoft Build 上宣布扩大合作,Azure AI Foundry 现提供 10,000+ Hugging Face 开放模型,可数次点击部署以支持文本、音频和图像 AI 应用。
Hugging Face 宣布 Transformers 将成为跨框架的模型定义标准,现支持 300+ 架构,平均每周新增约 3 个,并为 Llama、Qwen、GLM 等热门架构提供 day-0 支持。
推荐理由:Hugging Face 官方说明 Transformers 转型为跨框架模型定义标准,读者可以据此判断训练与推理工具链如何围绕它互通。
Hugging Face 与 Kaggle 推出平台整合,提升 Hugging Face 模型在 Kaggle 上的可见性与可发现性。
Hugging Face 在 Inference Endpoints 上推出新的 OpenAI Whisper 部署选项,推理由 vLLM 驱动,Whisper Large V3 的 RTFx 较此前提升近 8x 且转写质量无损失。