NVIDIA 发布 Nemotron 3 Nano Omni 全模态模型,覆盖文档、语音、视频与 GUI 智能体
NVIDIA 发布 Nemotron 3 Nano Omni(30B-A3B)全模态理解模型,支持文档分析、ASR、长音视频理解和 agentic computer use,并在 Hugging Face 开放 BF16、FP8 和 NVFP4 权重。
推荐理由:原文给出完整基准对比和架构细节,读者可以据此评估它是否值得替换现有的多模态工作流。
NVIDIA 发布 Nemotron 3 Nano Omni(30B-A3B)全模态理解模型,支持文档分析、ASR、长音视频理解和 agentic computer use,并在 Hugging Face 开放 BF16、FP8 和 NVFP4 权重。
推荐理由:原文给出完整基准对比和架构细节,读者可以据此评估它是否值得替换现有的多模态工作流。
OpenAI 本周在 Hub 上开源发布 Privacy Filter,一个 PII 检测模型,1.5B 参数、50M 激活参数,Apache 2.0 许可,支持 128k 上下文单次前向识别 8 类个人信息,在 PII-Masking-300k 基准上达到 SOTA。
Hugging Face 发布教程,指导开发者在 Manifest V3 约束下用 Transformers.js 在 Chrome 扩展中运行本地 AI,并复刻其 Gemma 4 Browser Assistant 架构。
推荐理由:作者基于自家 Gemma 4 浏览器扩展拆解 MV3 下运行 Transformers.js 的架构决策,给出可直接迁移的运行时划分与消息契约设计。
Hugging Face 发布一个 Skill 和独立测试套件,帮助贡献者把 transformers 模型移植到 mlx-lm,模型进入 transformers 后可更快在 MLX 上可用。
推荐理由:原文给出一个可复用的 Skill 加非智能体测试套件,并总结了让智能体 PR 符合开源惯例的具体规则,可迁移到其他项目。
Hugging Face 将 RLVE 框架从单轮推理任务扩展到多轮、带工具调用的电商对话场景,推出 EcomRLVE-GYM,提供 8 个可算法验证的环境,如商品发现、换货、购物车构建、订单追踪等。
Hugging Face 博客讲解如何用 Sentence Transformers 训练和微调多模态嵌入与重排模型,以 Qwen/Qwen3-VL-Embedding-2B 在 Visual Document Retrieval 任务上微调为例。
推荐理由:作者用 Qwen3-VL 完整走通多模态嵌入微调流程,NDCG@10 从 0.888 提到 0.947,方法可直接迁移到自己的领域数据。
Hugging Face 介绍了其推出的可执行基准 VAKRA,用于评估 AI 智能体在企业级环境中的推理与执行能力。基准提供 8,000+ 本地托管 API、覆盖 62 个领域,任务需 3-7 步推理链,包含 API 链式调用、工具选择、多跳推理等四类能力。文章还分析了模型在不同任务上的失败模式。
HCompany 推出 Chrome 扩展 HoloTab,将其 3 月 31 日发布的 computer-use 模型 Holo3 直接带到浏览器中,无需配置即可在任何网站自动化操作。其 Routines 功能通过录屏和讲解生成可重复运行或定时执行的例程,适合比价、找工作等重复任务;产品目前免费开放使用。
推荐理由:原文介绍了浏览器智能体的录制生成例程能力和免费入口,读者可以据此了解它如何把 computer-use 模型带入日常工作流。
Hugging Face 发布 Sentence Transformers v5.4,用户可用同一套 API 对文本、图像、音频和视频进行嵌入编码与相关性重排。
推荐理由:官方教程给出 v5.4 多模态嵌入与重排的完整用法、代码示例和支持模型清单,读者可以直接照着搭建跨模态检索或 RAG 流程。
Hugging Face 宣布 Safetensors 作为基金会托管项目加入 PyTorch Foundation(隶属 Linux Foundation),与 DeepSpeed、vLLM、Ray 等并列。
Google DeepMind 发布 Gemma 4 多模态模型系列,共五个尺寸(E2B、E4B、12B Unified、31B、26B A4B MoE),采用 Apache 2.0 许可,支持图像、文本和音频输入,上下文窗口最高 256K。
推荐理由:Hugging Face 官方详解 Gemma 4 架构、多模态能力与全生态部署方式,还覆盖 DiffusionGemma 和推理加速等上手细节。
TII Falcon Vision 团队发布 Falcon Perception,一个 0.6B 参数的早融合 Transformer,用混合注意力掩码处理图像块与文本,做自然语言提示的开放词汇定位与分割,在 SA-Co 上达到 68.0 Macro-F1(SAM 3 为 62.3),但在 presence calibration 上落后(MCC 0.64 vs 0.82)。
推荐理由:TII 自述用单一早融合 Transformer 做开放词汇感知,读者可以看到架构、数据配方和 SA-Co 与 PBench 上的具体对比依据。
Hugging Face 发布 gradio.Server,一个扩展自 FastAPI 的类,让开发者用 React、Svelte 或原生 HTML/JS 等任意前端框架,同时保留 Gradio 的排队、并发管理、SSE 流式、gradio_client 兼容和 Spaces 上的 ZeroGPU 支持。
推荐理由:官方介绍了 gradio.Server 如何让任意自定义前端继续复用 Gradio 的排队、MCP 和 ZeroGPU 能力,并附完整代码示例。
OpenMed 构建了覆盖结构预测、序列设计与密码子优化的端到端蛋白质 AI 流水线。在对比多种 transformer 架构后,CodonRoBERTa-large-v2 胜出,困惑度 4.10、Spearman CAI 相关性 0.40,显著超过 ModernBERT;团队随后扩展到 25 个物种,用 55 GPU 小时训练了 4 个生产模型,建立了其他开源项目没有的物种条件化系统。
Hugging Face 发布 TRL v1.0,将六年迭代的后训练代码库正式转为稳定库,已实现超过 75 种后训练方法,月下载量达 300 万次。
推荐理由:原文解释了 v1.0 的稳定与实验分层契约和反抽象设计取舍,读者可以借此理解后训练库如何应对快速变化的算法领域。
Hugging Face 发文称 Anthropic 正在限制 Pro/Max 订阅者在开放智能体平台使用 Claude 模型,并给出两条迁移路径。
Hugging Face 发布端到端语音智能体评估框架 EVA,采用 bot-to-bot 音频架构评估完整多轮语音对话,产出 EVA-A(准确性)与 EVA-X(体验)两项分数。
NVIDIA 在 Hugging Face 博客发布教程,用 6 条命令在单张 80GB GPU、不到一天内把 Llama-Nemotron-Embed-1B-v2 微调为领域专用嵌入模型,无需人工标注。
推荐理由:原文给出从文档到部署的完整六步命令与关键超参数,读者可照此在单卡上微调自己的领域嵌入模型。
Hugging Face 发布 2026 年春季开源生态分析,过去一年用户增长至 1300 万、公开模型超 200 万、公开数据集超 50 万。
推荐理由:Hugging Face 用平台自身数据刻画开源 AI 一年来的竞争、地理与社区变化,读者可以据此把握生态格局的量化走向。
H Company 发布多模态计算机使用模型 Holotron-12B,基于 NVIDIA Nemotron-Nano-2 VL 后训练约 140 亿 token,已在 Hugging Face 以 NVIDIA Open Model License 开放。
Hugging Face 为给 TRL 设计新的异步训练器,调研了 16 个围绕异步 RL 训练构建的开源库,并从编排原语、rollout 缓冲、权重同步协议、staleness 管理、partial rollout、LoRA 支持和分布式训练后端 7 个维度对比。
Hugging Face 在 Hub 上推出 Storage Buckets,一种不版本控制的可变、类 S3 对象存储,用于存放 checkpoints、处理后的数据、Agent traces 等中间产物。
推荐理由:官方发布后明确解释了为什么中间产物不适合放 Git 仓库,并给出 CLI、Python、fsspec 的完整上手路径,便于迁移现有训练和数据流程。
Hugging Face LeRobot 发布 v0.5.0,合并超过 200 个 PR、新增 50 多位贡献者。
推荐理由:官方完整发布说明覆盖硬件、策略、数据集和代码库四大方向,读者可据此评估升级对机器人训练与部署的实际影响。
Hugging Face 官方博客详解 Ulysses Sequence Parallelism 的原理,通过注意力头并行将长序列训练扩展到多卡,已集成到 Accelerate、Transformers Trainer 和 TRL 的 SFTTrainer。
NXP 发布实践指南,讲解如何在嵌入式机器人平台上录制可靠数据集并微调 ACT 与 SmolVLA 等 VLA 策略,并展示 NXP i.MX 95 SoC 优化后的实时性能。
Hugging Face 发布 Modular Diffusers,将扩散流水线拆成文本编码、去噪、解码等可独立运行、自由增删互换的可复用块,作为现有 DiffusionPipeline 的灵活补充。
推荐理由:原文展示了用可组合积木搭建扩散流水线的完整用法,包括自定义块、模块化仓库和 Mellon 可视化集成,方法可直接复用。
Photoroom 以约 $1500 算力预算(32 张 H200,$2/小时/GPU)在 24 小时内完成文生图扩散模型训练,并开源 PRX 训练代码与实验框架。
Hugging Face 博客介绍 transformers 库如何让 MoE 稀疏架构成为一等公民,涵盖权重加载重构、Expert Backend、专家并行和 MoE 训练支持。
Hugging Face 发布教程,讲解如何用编码智能体(Claude Code、Codex、Open Code)配合 Unsloth 在 HF Jobs 上微调 LiquidAI/LFM2.5-1.2B-Instruct。
推荐理由:官方教程给出用编码智能体加 Unsloth 在 HF Jobs 上微调小模型的完整流程,含脚本、命令和各尺寸 GPU 的每小时成本参考。
GGML 及 Georgi Gerganov 团队宣布加入 Hugging Face,以保障本地 AI 的长期开源发展。团队将继续全职维护 llama.cpp,保持技术方向与社区自治,项目继续 100% 开源、社区驱动;双方计划让 transformers 中的模型定义能近乎一键地在 llama.cpp 中落地,并改进基于 ggml 的软件的打包与用户体验。
推荐理由:收购方官方说明团队加入后的自治安排与技术方向,读者可据此评估 llama.cpp 社区的连续性与本地推理生态走向。
Hugging Face 官方博客介绍 Gradio 6 中 gr.HTML 支持自定义模板、scoped CSS 和 JavaScript 交互,可让 LLM 一次性生成前端、后端和状态管理都在单个 Python 文件里的应用。
推荐理由:原文由官方讲解 gr.HTML 的模板机制和 API,并结合多类应用示例说明如何用单个 Python 文件构建交互式组件。
Hugging Face 发布一个随 kernels 库分发的智能体技能,教编码智能体编写可集成进 transformers 和 diffusers 的生产级 CUDA 内核。
推荐理由:原文给出技能安装方法、覆盖内容和 H100 实测数据,读者可以照此让编码智能体生成并发布 CUDA 内核。
Turing 在 Meta 与 Hugging Face 的开源框架 OpenEnv 上构建了生产级日历管理环境 Calendar Gym,用于在访问控制、时间推理和多智能体协调等真实约束下评估工具调用智能体。
Hugging Face 发布 Transformers.js v4,已可在 NPM 安装,核心变化是采用 C++ 重写的 WebGPU Runtime,同一套代码可运行于浏览器、Node、Bun 和 Deno。
推荐理由:官方发布说明完整列出 WebGPU 运行时重写、新架构支持和构建性能数据,读者可评估在浏览器或服务端本地跑模型的可行性。
Hugging Face 在 Hub 上推出 Community Evals 功能,评测数据集(MMLU-Pro、GPQA、HLE 已上线)可托管排行榜,模型分数存于模型仓库的 .eval_results/*.yaml 并展示在 Model Card 上。
H 公司发布其最大的 UI 定位模型 Holo2-235B-A22B Preview,在 ScreenSpot-Pro 达到 78.5%、OSWorld G 达到 79.0%,创下 SOTA 纪录。该模型采用智能体定位方式迭代修正预测,带来 10-20% 相对提升,已作为研究版本在 Hugging Face 开放。训练使用 SkyPilot 统一管理跨云的 Kubernetes 集群任务。
Photorium 发布 PRX 文生图训练系列第二篇,在统一的 Flow Matching 基线上系统消融各类训练技巧。
Hugging Face Gradio 团队发布开源 Python 库 Daggr(beta,当前版本 0.4.3),用几行代码把 Gradio Spaces、ML 模型和自定义函数连接成 AI 工作流,并自动生成可视化画布。
推荐理由:Gradio 团队介绍用代码定义 AI 工作流并自动生成可视化画布,可单步检查和重跑,适合在重编排平台和脆弱脚本之外多一个实验选择。
Hugging Face 发布 upskill 工具,用 Claude Opus 4.5 生成和评估 agent 技能,再供更小、更便宜或本地模型使用。流程为用 Claude Code 完成任务并导出 trace、从 trace 生成 SKILL.md 技能文件并自动生成测试用例,然后用 upskill eval 对比模型有无技能的表现。
推荐理由:原文给出了用大模型生成技能再迁移到小模型的完整流程和实测数字,方法可直接复用于领域任务。
Hugging Face 团队推出 Alyah(意为阿联酋方言中的"北极星"),一个评测阿拉伯语大模型阿联酋方言能力的基准,包含 1,173 个由母语者人工采集的多选题样本,覆盖问候语、诗歌、历史遗产和方言语言等类别。