Hugging Face 联合 OpenAI 推出开放推理标准 Open Responses
Hugging Face 发布开放推理标准 Open Responses,扩展并开源 OpenAI 的 Responses API,面向 Agent 时代的推理需求。
Hugging Face 发布开放推理标准 Open Responses,扩展并开源 OpenAI 的 Responses API,面向 Agent 时代的推理需求。
NVIDIA 发布 Cosmos Reason 2,一个面向物理 AI 的开源推理视觉语言模型,登顶 Physical AI Bench 和 Physical Reasoning 排行榜,成为视觉理解排名第一的开源模型。
推荐理由:官方发布给出模型规格、上下文长度和评测变化,读者可据此评估其是否适合机器人与视频分析场景。
Hugging Face 博客宣布推出 Falcon-H1-Arabic 阿拉伯语模型家族,包含 3B、7B、34B 三种规格,采用融合 Mamba(State Space Model)与 Transformer 注意力的混合架构。
Hugging Face 发布分步教程,教你在 CES 2026 演示基础上用 NVIDIA DGX Spark 和 Reachy Mini 搭建桌面私人助理。
Hugging Face 博客详解 Transformers v5 对分词器的重新设计:将分词器架构(normalizer、pre-tokenizer、算法类型、post-processor、decoder)与训练好的词表和 merges 分离,类似 PyTorch 分离模型结构与权重。
推荐理由:文章来自 transformers 团队,解释 v5 将分词器架构与训练词表分离的设计,便于读者直接检查组件或训练自定义分词器。
NVIDIA 以开放评测方式发布 Nemotron 3 Nano 30B A3B,并公开其完整的评测 recipe。该 recipe 基于 NeMo Evaluator 开源库构建,任何人都可以重跑评测流水线、查看配置与产物并独立验证结果。NeMo Evaluator 将多个评测 harness 统一在同一接口下,评测流程与推理后端解耦,并可生成结构化结果与日志以便审计。
IBM Research 宣布开源可配置通用智能体 CUGA 接入 Hugging Face Spaces,提供基于 CRM 场景、含 20 个预配置工具的 Demo。
推荐理由:IBM Research 介绍 CUGA 接入 Hugging Face Spaces,读者可以据此了解其架构能力、开放模型选项和上手路径。
Google 联合 SisonkeBiotik、Ro'ya 和 DS-I Africa 举办全非健康数据科学 Ideathon,参赛团队基于 Google 开源健康模型 MedGemma、TxGemma 和 MedSigLIP 解决现实健康挑战,从 30 多份提交中选出六支决赛队伍。
llama.cpp server 新增 router mode,无需重启即可动态加载、卸载和切换多个模型,补上类似 Ollama 的模型管理能力。该功能采用多进程架构,单个模型崩溃不影响其他模型;支持自动发现 GGUF 文件、按需加载、LRU 淘汰(默认 --models-max 4)、请求路由和 Web UI 切换。
推荐理由:原文给出 router mode 的加载与切换机制和具体命令选项,读者可以据此评估本地多模型管理的新工作流。
Hugging Face 发布教程,展示如何用 Hugging Face Skills 让 OpenAI Codex 端到端完成机器学习实验,覆盖数据验证、硬件选择、提交 Hugging Face Jobs、用 Trackio 监控训练、维护训练报告以及用 lighteval 评测。
推荐理由:官方教程给出让 Codex 端到端跑完微调、评测和 GGUF 导出的完整流程与成本参考,方法可直接迁移到自己的实验。
Mistral AI 发布开源编码模型 Devstral 2(123B)和 Devstral Small 2(24B),SWE-bench Verified 分别取得 72.2% 和 68.0%,并推出开源终端编码智能体 Mistral Vibe CLI。
推荐理由:官方公布两个尺寸开源编码模型的基准成绩、许可与部署门槛,并同步开放终端 CLI,读者可评估其替代现有方案的成本。
OpenAI 宣布联合发起 Linux Foundation 旗下的 Agentic AI Foundation,并捐赠 AGENTS.md,以支持面向安全智能体 AI 的开放、可互操作标准。
推荐理由:OpenAI 官方宣布捐出 AGENTS.md 并参与设立开放标准基金会,读者可以据此跟踪智能体互操作标准的走向。
Hugging Face 推出 Swift 软件包 swift-huggingface,为 Hugging Face Hub 提供完整客户端,后续将集成进 swift-transformers 替换其 HubApi 实现。
Intel AI 软件团队推出 DeepMath,一个基于 Qwen3-4B Thinking、用 GRPO 微调并通过 smolagents 实现的数学推理智能体。模型用简短 Python 代码片段替代冗长文本推理,在沙箱中执行后回填推理上下文,输出长度最多减少 66%,同时常提升准确率。在 MATH500、AIME、HMMT、HLE 四个数据集上,GRPO 训练与智能体推理结合取得最高准确率。
Hugging Face 推出 hf-llm-trainer 技能,让 Claude Code、Codex、Gemini CLI 等编码智能体可自动选择 GPU、生成脚本、向 Hugging Face Jobs 提交微调任务并用 Trackio 监控进度,完成后模型自动推送到 Hub。
推荐理由:官方发布了让 Claude Code 等编码智能体端到端微调开源模型的 hf-llm-trainer 技能,覆盖 GPU 选择、任务提交到监控的完整流程。
Mistral 发布 Mistral 3 系列模型,包括 41B 激活、675B 总参数的 MoE 模型 Mistral Large 3,以及 3B/8B/14B 三种尺寸的 Ministral 3 小模型,全部以 Apache 2.0 协议开源。
推荐理由:官方发布涵盖 Large 3 与 Ministral 3 全系的参数规模、开源协议和部署途径,读者可以据此判断各档模型适合的场景。
Hugging Face 发布 Transformers v5.0.0rc-0,距 v4 首个 RC 五年,目前每日 pip 安装超 300 万次、累计超 12 亿次,模型架构从 40 个增至 400 多个。
推荐理由:官方详解 v5 在简洁性、训练、推理和量化上的改动,以及与主流训练推理工具的互操作设计。
Hugging Face 官方博客宣布 Diffusers 支持 FLUX.2,提供 Flux2Pipeline 和 Flux2Transformer2DModel 的完整加载与推理示例。
推荐理由:官方博客给出 FLUX.2 在 Diffusers 中的完整推理代码和量化加载方式,读者可以直接照搬运行文生图流程。
Hugging Face 的 Open ASR Leaderboard 新增多语言与长音频转写赛道,目前对比 18 个机构的 60 多个开源与闭源模型,覆盖 11 个数据集。
Hugging Face TRL 官方集成 RapidFire AI,可通过 RFSFTConfig、RFDPOConfig、RFGRPOConfig 等近乎零代码的封装并发运行多个微调/后训练配置。
Hugging Face 博客宣布 AnyLanguageModel,一个 Swift 包,作为 Apple Foundation Models 框架的 drop-in 替代,支持多模型供应商。
推荐理由:原文解释了为何以 Apple Foundation Models API 为模板设计,并给出换 import 即切换本地或云端模型的实际用法。
SLAM Lab 发布 Apriel-H1 系列,将 15B 推理模型部分注意力层替换为 Mamba,旗舰 Apriel-H1-15b-Thinker-SFT 以 76.8B token 训练实现 2.1 倍吞吐且推理质量损失很小。
Hugging Face 的 kernels 库支持构建和分享可在 AMD GPU 上运行的 ROCm kernel,文章以获 AMD Developer Challenge 2025 大奖的 RadeonFlow GEMM kernel 为例,讲解项目结构、build.toml 配置与打包流程。
AMD、Hugging Face 与 Data Monsters 联合举办 AMD Open Robotics Hackathon,首站 2025 年 12 月 5-7 日在东京举行,第二站 12 月 12-14 日在巴黎举行。
Hugging Face 宣布与 Google Cloud 达成更深入的合作,帮助企业在 Google Cloud 上用开放模型构建自己的 AI。
Google 发布 provably private insights(PPI)系统,结合 LLM、差分隐私和可信执行环境分析 GenAI 使用数据,保证个体数据不可查看、聚合结果匿名。
MiniMax 团队成员分享 MiniMax M2 后训练中智能体对齐的关键经验。结论包括:智能体需要 Interleaved Thinking,思考可在任务任意阶段发生以应对工具输出等外部扰动。
Hugging Face 发布长文分析全球算力格局变化,指出中国开源权重模型的进展正与国产 AI 芯片的快速发展相互推动。近几个月华为昇腾、寒武纪等国产芯片已开始支撑热门开源模型的推理,蚂蚁集团、百度等开始在国产硬件上训练模型。
推荐理由:文章把美国出口管制与中国芯片进展、开源模型效率创新放在同一条线索里梳理,帮助读者理解算力格局变化的来龙去脉。
OpenAI 发布 gpt-oss-safeguard-120b 和 gpt-oss-safeguard-20b 两个开放权重推理模型,由 gpt-oss 模型后训练而来,可根据给定策略推理并对内容进行标注。技术报告描述了其能力,并以底层 gpt-oss 模型为基线提供了安全评估结果。
推荐理由:原文给出两个安全审核模型的训练思路和基线安全评估来源,读者可以据此了解其按策略标注内容的能力定位。
OpenAI 发布 gpt-oss-safeguard,是用于安全分类的开源权重推理模型。开发者可以在其上应用并迭代自定义安全策略。
推荐理由:原文说明这是面向安全分类的开源权重推理模型,开发者可自定义安全策略并迭代,适合关注安全工程的人参考。
NVIDIA Isaac for Healthcare v0.4 提供 SO-ARM 入门工作流,帮助开发者构建自主手术助理机器人,覆盖数据采集、训练与部署全流程。
IBM 发布 Granite 4.0 Nano,这是 Granite 4.0 家族中参数最小的模型,含 Granite 4.0 H 1B(约 1.5B)、Granite 4.0 H 350M(约 350M)及对应传统 transformer 版本,采用 Apache 2.0 许可。
Hugging Face 发布 huggingface_hub v1.0,该库现支持 20 万依赖库,并提供超过 200 万公开模型、50 万公开数据集和 100 万公开 Spaces 的访问。
推荐理由:官方完整梳理了 huggingface_hub 五年演进与 v1.0 的破坏性变更,含兼容性影响和迁移指引,对依赖该库的开发者有直接参考价值。
Hugging Face 发布 datasets 与 huggingface_hub 库的流式加载优化,一行 streaming=True 即可免下载训练多 TB 数据集。
推荐理由:官方给出 streaming 后端的具体优化指标和可复现代码,适合据此评估是否直接用流式替代本地下载来训练大规模数据集。
Hugging Face 团队发布 LeRobot v0.4.0,引入支持超过 400GB 数据集的 LeRobotDataset v3.0 分块格式与流式加载,并集成 Physical Intelligence 的 pi0、pi0.5 和 NVIDIA 的 GR00T N1.5 等 VLA 模型。
推荐理由:Hugging Face 官方详述 LeRobot v0.4.0 各项升级,读者可以据此评估新的数据格式、VLA 模型集成和硬件插件如何用于自己的机器人学习项目。
Meta-PyTorch 与 Hugging Face 联合推出 OpenEnv Hub,一个共享开放的智能体环境社区平台,同时发布 OpenEnv 0.1 规范(RFC)征集社区反馈。
Sentence Transformers(SBERT)正式从 TU Darmstadt 的 UKP Lab 移交至 Hugging Face,由 2023 年底起接手维护的 Tom Aarsen 继续领导。该开源库自 2019 年由 Nils Reimers 创建,Hub 上已有超过 16,000 个模型,月独立用户超百万。项目将继续以 Apache 2.0 许可证保持社区驱动的开源模式。
Hugging Face 与威胁情报平台 VirusTotal 合作,对 Hub 上 220 万个以上的公开模型和数据集仓库进行持续安全扫描。访问仓库或文件页面时会自动比对文件哈希与 VirusTotal 威胁情报数据库,返回检测结果和威胁情报元数据,且不共享文件原始内容以保护隐私。用户可在下载前查看文件是否被标记,企业也能将检测集成到 CI/CD 流程中。
Hugging Face 宣布其开源无代码工具 AI Sheets 新增视觉支持,可在表格中分析图片、提取结构化数据、从文本生成图像并用 Qwen-Image-Edit 等模型编辑图像。
推荐理由:官方发布带来图像提取、生成与编辑能力,教程演示了手写菜谱数字化等具体用法,便于读者评估是否引入自己的数据工作流。
Hugging Face 发布开源 OCR 模型指南,新增 Chandra 和 OlmOCR-2 及其 OlmOCR Benchmark 得分。
推荐理由:指南基于 OlmOCR Benchmark 等公开基准对比了 9 个开源 OCR 模型的格式、大小与成本,并给出按使用场景选型的具体方法。