Hugging Face 从 16 个开源 RL 库总结异步强化学习训练经验
Hugging Face 为给 TRL 设计新的异步训练器,调研了 16 个围绕异步 RL 训练构建的开源库,并从编排原语、rollout 缓冲、权重同步协议、staleness 管理、partial rollout、LoRA 支持和分布式训练后端 7 个维度对比。
Hugging Face 为给 TRL 设计新的异步训练器,调研了 16 个围绕异步 RL 训练构建的开源库,并从编排原语、rollout 缓冲、权重同步协议、staleness 管理、partial rollout、LoRA 支持和分布式训练后端 7 个维度对比。
Hugging Face 在 Hub 上推出 Storage Buckets,一种不版本控制的可变、类 S3 对象存储,用于存放 checkpoints、处理后的数据、Agent traces 等中间产物。
推荐理由:官方发布后明确解释了为什么中间产物不适合放 Git 仓库,并给出 CLI、Python、fsspec 的完整上手路径,便于迁移现有训练和数据流程。
Hugging Face 官方博客详解 Ulysses Sequence Parallelism 的原理,通过注意力头并行将长序列训练扩展到多卡,已集成到 Accelerate、Transformers Trainer 和 TRL 的 SFTTrainer。
Amazon Bedrock 推出 Stateful Runtime for Agents,为多步骤 AI 工作流提供持久编排、记忆和安全执行能力。该运行时由 OpenAI 模型驱动,可支持跨步骤保持状态的智能体应用。
Hugging Face 博客介绍 transformers 库如何让 MoE 稀疏架构成为一等公民,涵盖权重加载重构、Expert Backend、专家并行和 MoE 训练支持。
IBM Research 与 UC Berkeley 将 MAST(多智能体系统失败分类法)应用于 ITBench,标注了 310 条由 Gemini-3-Flash、Kimi-K2 和 GPT-OSS-120B 产生的 SRE 执行轨迹,把成功率之外的黑盒失败转成结构化失败签名。
推荐理由:原文把基准的单一成功率拆解为结构化失败模式,并针对三类模型给出对应的工程修复方向。
OpenAI 介绍其构建的实时访问系统,结合速率限制、用量追踪和 credits,为 Sora 和 Codex 提供持续访问能力。材料仅提供摘要,未包含更多细节。
Hugging Face 发布一个随 kernels 库分发的智能体技能,教编码智能体编写可集成进 transformers 和 diffusers 的生产级 CUDA 内核。
推荐理由:原文给出技能安装方法、覆盖内容和 H100 实测数据,读者可以照此让编码智能体生成并发布 CUDA 内核。
Hugging Face 发布 Transformers.js v4,已可在 NPM 安装,核心变化是采用 C++ 重写的 WebGPU Runtime,同一套代码可运行于浏览器、Node、Bun 和 Deno。
推荐理由:官方发布说明完整列出 WebGPU 运行时重写、新架构支持和构建性能数据,读者可评估在浏览器或服务端本地跑模型的可行性。
OpenAI 的 GPT-5 与 Ginkgo Bioworks 的云自动化平台结合,组成自主实验室,通过闭环实验将无细胞蛋白质合成成本降低了 40%。
Google Research 提出 Sequential Attention,一种用于特征选择等子集选择问题的贪心算法,利用注意力分数逐步选出最有价值的组件。它将选择过程集成到单次模型训练中,避免了传统贪心方法每步重新训练的高昂开销,以极小代价应用于大规模模型。该方法在多个神经网络基准上取得 SOTA 结果,并支持并行评估候选、提升可解释性。
OpenAI 介绍 Codex App Server,这是一个双向 JSON-RPC API,用于嵌入 Codex 智能体。该 API 支持流式进度、工具调用、审批和 diffs。
Hugging Face Gradio 团队发布开源 Python 库 Daggr(beta,当前版本 0.4.3),用几行代码把 Gradio Spaces、ML 模型和自定义函数连接成 AI 工作流,并自动生成可视化画布。
推荐理由:Gradio 团队介绍用代码定义 AI 工作流并自动生成可视化画布,可单步检查和重跑,适合在重编排平台和脆弱脚本之外多一个实验选择。
OpenAI 详解了其如何将 PostgreSQL 扩展到每秒数百万次查询,以支撑 8 亿 ChatGPT 用户。技术手段包括使用副本、缓存、速率限制和工作负载隔离。
Mistral AI 团队分享了排查 vLLM 内存泄漏的过程,问题仅出现在 Mistral Medium 3.1 与 P/D 分离部署结合 NIXL、开启 graph compilation 的条件下,系统内存以每分钟 400 MB 的速度线性增长,数小时后触发 out of memory。
OpenAI 发布 Stargate Community 计划细节,提出以社区为先的 AI 基础设施建设方式。方案将结合社区意见、能源需求和就业优先事项,因地制宜地进行本地化定制。
OpenAI 与 Cerebras 达成合作,新增 750MW 高速 AI 算力,用于降低推理延迟,使 ChatGPT 在实时 AI 工作负载下更快。
OpenAI 与软银集团宣布与 SB Energy 合作,开发多吉瓦级 AI 数据中心园区,其中包含一座支持 Stargate 计划的 1.2 GW 德克萨斯州设施。
推荐理由:合作扩展了 Stargate 的算力与能源布局,读者可以借此了解 AI 数据中心建设对电力供应的依赖程度。
llama.cpp server 新增 router mode,无需重启即可动态加载、卸载和切换多个模型,补上类似 Ollama 的模型管理能力。该功能采用多进程架构,单个模型崩溃不影响其他模型;支持自动发现 GGUF 文件、按需加载、LRU 淘汰(默认 --models-max 4)、请求路由和 Web UI 切换。
推荐理由:原文给出 router mode 的加载与切换机制和具体命令选项,读者可以据此评估本地多模型管理的新工作流。
Hugging Face 推出 Swift 软件包 swift-huggingface,为 Hugging Face Hub 提供完整客户端,后续将集成进 swift-transformers 替换其 HubApi 实现。
Hugging Face 发布 Transformers v5.0.0rc-0,距 v4 首个 RC 五年,目前每日 pip 安装超 300 万次、累计超 12 亿次,模型架构从 40 个增至 400 多个。
推荐理由:官方详解 v5 在简洁性、训练、推理和量化上的改动,以及与主流训练推理工具的互操作设计。
OpenAI 为 ChatGPT Enterprise、ChatGPT Edu 和 API Platform 扩展数据驻留能力,符合条件的客户可将静态数据存储在所在区域内。此举帮助全球企业客户满足本地数据合规要求。
Hugging Face 发布教程,从 attention 机制和 KV cache 出发推导 continuous batching,讲解其如何最大化 LLM 服务的吞吐。
Tavily 分享其打造达到 SOTA 水平的 deep research 智能体的经验:七个月前他们放弃了第一版复杂架构并从零重建,因为其中的假设在下一代模型到来时成为瓶颈。
OVHcloud 现已成为 Hugging Face Hub 支持的 Inference Provider,用户可在模型页面直接调用其 AI Endpoints 服务。
Google Research 发布一个轻量级线性回归模型,预测特定时间后电动车充电桩可用的概率。团队在加州和德国的真实充电网络数据上训练,以一天中各小时为特征,在 30 和 60 分钟预测窗口、100 座随机选取的站点上评估,表现优于"保持当前状态"基线。该简单模型依赖易获取的特征即可实现低延迟部署,有助于减少里程焦虑。
SLAM Lab 发布 Apriel-H1 系列,将 15B 推理模型部分注意力层替换为 Mamba,旗舰 Apriel-H1-15b-Thinker-SFT 以 76.8B token 训练实现 2.1 倍吞吐且推理质量损失很小。
Hugging Face 的 kernels 库支持构建和分享可在 AMD GPU 上运行的 ROCm kernel,文章以获 AMD Developer Challenge 2025 大奖的 RadeonFlow GEMM kernel 为例,讲解项目结构、build.toml 配置与打包流程。
Hugging Face 宣布与 Google Cloud 达成更深入的合作,帮助企业在 Google Cloud 上用开放模型构建自己的 AI。
Google 发布预印论文,提出 Project Suncatcher 计划,设想在晨昏太阳同步低地球轨道部署搭载 TPU、以自由空间光链路互联的太阳能卫星星座来扩展 AI 算力。
推荐理由:Google 官方给出太空 AI 算力设想的关键数据与验证进展,读者可据此了解星载 TPU、星间光链路与发射成本的具体可行性分析。
Google 发布 provably private insights(PPI)系统,结合 LLM、差分隐私和可信执行环境分析 GenAI 使用数据,保证个体数据不可查看、聚合结果匿名。
OpenAI 深入解析了为 ChatGPT Atlas 浏览器打造的新架构 OWL。OWL 将 Chromium 解耦,实现快速启动和丰富 UI,并支持与 ChatGPT 结合的 agentic 浏览体验。
NVIDIA 推出的 Isaac for Healthcare v0.4 提供 SO-ARM 起始工作流,可端到端构建自主手术辅助机器人:用 SO-ARM101 和 LeRobot 采集仿真与真实遥操作数据,post-train GR00T N1.5,在 Isaac Lab 评估后部署到真实硬件。
Hugging Face 发布 huggingface_hub v1.0,该库现支持 20 万依赖库,并提供超过 200 万公开模型、50 万公开数据集和 100 万公开 Spaces 的访问。
推荐理由:官方完整梳理了 huggingface_hub 五年演进与 v1.0 的破坏性变更,含兼容性影响和迁移指引,对依赖该库的开发者有直接参考价值。
Mistral 发布 Mistral AI Studio,将支撑其自身大规模系统的基础设施打包给企业团队,用于在生产环境构建、评估和运行 AI。平台由三大支柱组成:Observability、基于 Temporal 的 Agent Runtime 和 AI Registry,提供评估、可追溯反馈回路、版本管理与治理能力,并支持混合、专用和自托管部署。
Hugging Face 发布开源 OCR 模型指南,新增 Chandra 和 OlmOCR-2 及其 OlmOCR Benchmark 得分。
推荐理由:指南基于 OlmOCR Benchmark 等公开基准对比了 9 个开源 OCR 模型的格式、大小与成本,并给出按使用场景选型的具体方法。
Intel 与 Hugging Face 在 Google Cloud C4 VM(Intel Xeon 6,代号 Granite Rapids)上对开源 MoE 模型 GPT OSS 进行文本生成基准测试,结果显示相比上一代 C3 VM 实例 TCO 提升 1.7 倍。
Hugging Face 发布教程,介绍用 Optimum Intel 和 OpenVINO 在无 GPU 的 Intel CPU 上本地部署 SmolVLM2-256M-Video-Instruct 的三个步骤:模型转换、量化(权重量化或静态量化)和推理。
OpenAI 与 Broadcom 宣布达成多年期合作,将部署 10 吉瓦 OpenAI 设计的 AI 加速器。双方将共同开发下一代系统和以太网方案,目标是到 2029 年建成可扩展、高能效的 AI 基础设施。
推荐理由:官方宣布的合作明确了 10GW 规模和 2029 年时间线,读者可以据此了解 OpenAI 自研加速器布局的实际部署节奏。
AMD 与 OpenAI 宣布多年战略合作,将部署 6 GW 的 AMD Instinct GPU,首期 1 GW 于 2026 年开始,用于支撑 OpenAI 下一代 AI 基础设施并加速全球 AI 创新。
推荐理由:官方公布多年合作规模与首阶段时间表,读者可据此了解 OpenAI 算力供应的多元布局。