AllenAI 发布 Olmo-core 3:面向万亿参数 MoE 的开源训练框架
AllenAI 发布开源训练框架 Olmo-core 3, redesigned MoE 训练系统,目标是将 MoE 训练扩展到万亿参数规模。基准测试显示,在 512 块 NVIDIA B300 GPU 上运行 1.2 万亿总参数模型达到 858 TFLOP/s/GPU,新栈比旧 FSDP 实现吞吐高约 2.7 倍;MXFP8 使吞吐比 BF16 提高约 21%。
AllenAI 发布开源训练框架 Olmo-core 3, redesigned MoE 训练系统,目标是将 MoE 训练扩展到万亿参数规模。基准测试显示,在 512 块 NVIDIA B300 GPU 上运行 1.2 万亿总参数模型达到 858 TFLOP/s/GPU,新栈比旧 FSDP 实现吞吐高约 2.7 倍;MXFP8 使吞吐比 BF16 提高约 21%。
Simon Willison 于 2026 年 9 月 24 日发布了关于 commit-rewriter 0.2 的短讯。正文未提供更多功能或版本细节。
GitHub Security Lab 的 Antonio Morales 发布开源 Fuzzing Taskflow,基于 Taskflow Agent 为 C/C++ 项目提供自主模糊测试流水线。
推荐理由:作者亲述设计取舍,读者可以照着跑起来,并理解 LLM 智能体如何接管模糊测试中重复的人工环节。
NVIDIA 与 Google DeepMind、EMBL-EBI 等机构合作,通过 AlphaFold Database 开放发布超过 2,800 种病毒蛋白复合物的预测 3D 结构。
Simon Willison 推出 LLM 插件 llm-typesafe 0.1a0,为 TypeSafe AI 新的 Jev 模型提供支持。
UK AISI 正在使用 EvalEval 的基础设施公开分享评测结果,以提升评测的可复现性与可验证性。
Microsoft Research 的逆合成模型 RetroChimera 发表于 Nature,结合 Transformer 架构的 R-SMILES 2 与基于 GNN 的 NeuralLoc 两个子模型,用 learning-to-rank 集成策略生成合成路线。
Hugging Face 发布 tokenizers v1 的 release candidate,在 Apple M4 Max 单线程上编码速度比 v0.23 快 3 到 30 倍(低端 t5-base,高端 gpt2),八线程扩展达线性的 76%。
推荐理由:Hugging Face 官方实测数据说明 tokenizers v1 为何能比 v0.23 快 3 到 30 倍,读者可以借此判断升级对训练和推理工作流的影响。
Google Research 推出 MilleMiglia,一个用 C++ 编写的实例生成器,可为中英里(middle-mile)物流网络生成贴近现实且保护隐私的基准数据,源代码与文档已在 GitHub 开放。
Hugging Face WebAI 团队发布 @huggingface/kernels 库和 207 个 WebGPU 内核(Apache-2.0),每个内核以带版本号的独立仓库发布,包含 manifest、正确性测试、基准用例和 WGSL shader 模板。
推荐理由:官方介绍了 207 个 WebGPU 内核的发布方式和与 ORT WebGPU 的实测对比,读者可以据此评估浏览器端推理优化的可用路径。
Hugging Face 论文提出两项系统改动来降低 LLM 知识蒸馏成本:离线缓存 teacher 的 top-100 logits,以及将输出投影融合进损失的 fused chunked KL loss,避免构建全词表 × 序列长度矩阵。
Google DeepMind 在 Nature 发表论文并开源 WeatherNext 2 和 WeatherNext Cyclones 模型,单一 AI 模型即可预测气旋路径、强度和风结构,平均多出超过 24 小时的预报提前量,相当于过去 20 年趋势下约十年的气象进步。
推荐理由:Google DeepMind 官方发布并开源了模型权重,读者可以结合 Nature 论文数据评估其对气旋预报工作流的实际改进。
Microsoft Research 发布开源框架 Orchard,核心是可复用的 Kubernetes 环境服务 Orchard Env,支持软件工程、网页导航和个人助理智能体的训练与评估,并可直接在 Codex、OpenClaw、ZeroClaw 等真实部署 harness 中训练。
推荐理由:开源框架把环境层做成可复用服务,并支持直接在真实部署 harness 中训练,为低成本研究智能体提供了可复用的路径。
Pollen Robotics 发布开源低成本系统 Grabette,用手持夹爪录制操作任务并自动转成机器人可用的 LeRobot 数据集,无需机器人或遥操作设备。
Hugging Face 宣布 vLLM 的 transformers modeling backend 在多类 LLM 架构上已达到甚至超过 vLLM 手写原生实现的吞吐。
推荐理由:原文给出三档 Qwen3 模型的吞吐对比和实现原理,读者可据此评估 transformers backend 能否替代手写 vLLM 实现来省掉移植成本。
LeRobot v0.6.0 发布,引入 VLA-JEPA、FastWAM、LingBot-VA 三种会预测未来的世界模型策略,新增 GR00T N1.7、MolmoAct2、EO-1 等多个 VLA,以及统一奖励模型 API(Robometer、TOPReward)。
推荐理由:官方发布页完整列出各项新能力与配套工具,读者可以据此评估这次版本更新对机器人学习工作流的实际影响。
Mistral 发布 Leanstral 1.5,Apache-2.0 许可,总参数 119B、激活 6B,主打 Lean 4 形式化证明工程。模型饱和 miniF2F,解出 587/672 PutnamBench 问题,在 FATE-H 达 87%、FATE-X 达 34%;经 mid-training、SFT 和 CISPO 强化学习三阶段训练。
推荐理由:原文给出基准成绩、成本对比和真实代码验证案例,读者可以据此评估开源形式化推理模型的实用边界。
Hugging Face 联合 Microsoft、Google、GoDaddy 等贡献者发布 Agentic Resource Discovery(ARD)开放规范草案,定义如何通过联邦注册表对 Agent 能力进行编目、索引和自然语言搜索,让 Agent 在运行时发现 MCP 工具、A2A Agent 和 Skills,而无需预先安装配置。
推荐理由:原文介绍了 ARD 开放规范的设计细节和 Hugging Face 的参考实现,附 CLI 和 API 用法,可直接上手做运行时能力发现。
Google Research 在 GitHub 上以 Apache 2.0 许可开源其水文建模框架,让各国气象水文部门可将 AI 洪水预报整合进自身工作流。
推荐理由:原文说明了开源水文框架的架构、训练数据和性能提升,读者可据此评估如何在本地流域部署 AI 洪水预报。
Hugging Face 发布 Sentence Transformers v5.4,用户可用同一套 API 对文本、图像、音频和视频进行嵌入编码与相关性重排。
推荐理由:官方教程给出 v5.4 多模态嵌入与重排的完整用法、代码示例和支持模型清单,读者可以直接照着搭建跨模态检索或 RAG 流程。
Hugging Face 发布 TRL v1.0,将六年迭代的后训练代码库正式转为稳定库,已实现超过 75 种后训练方法,月下载量达 300 万次。
推荐理由:原文解释了 v1.0 的稳定与实验分层契约和反抽象设计取舍,读者可以借此理解后训练库如何应对快速变化的算法领域。
Mistral 发布 Leanstral,称其为首个面向 Lean 4 的开源代码智能体,权重采用 Apache 2.0 许可证,提供 120B-A6B 稀疏架构(6B 激活参数),并集成于 Mistral Vibe 及免费 API 端点 labs-leanstral-2603。
Google Research 推出大规模开放语音数据集 WAXAL,覆盖撒哈拉以南非洲 27 种语言、超过 1 亿使用者。首批包含约 1,846 小时转写自然语音(WAXAL-ASR,采用图像提示引发自发话语)和 565 小时以上高保真 TTS 录音,以 CC-BY-4.0 许可发布,由 Makerere 大学、加纳大学等非洲机构主导采集,后续计划持续扩展语言。
OpenAI 推出开源工具包 GABRIEL,利用 GPT 将定性文本和图像转化为定量数据,帮助社会科学家大规模分析研究数据。该工具包面向社会科学研究领域,已开源可用。
SyGra 2.0.0 引入交互式环境 Studio,让用户在画布上可视化编排合成数据生成流程,替代 YAML 文件和终端操作。
Hugging Face Gradio 团队发布开源 Python 库 Daggr(beta,当前版本 0.4.3),用几行代码把 Gradio Spaces、ML 模型和自定义函数连接成 AI 工作流,并自动生成可视化画布。
推荐理由:Gradio 团队介绍用代码定义 AI 工作流并自动生成可视化画布,可单步检查和重跑,适合在重编排平台和脆弱脚本之外多一个实验选择。
Google DeepMind 发布开源可解释性工具套件 Gemma Scope 2,覆盖 Gemma 3 从 270M 到 27B 的全部模型尺寸,结合稀疏自编码器(SAE)与 transcoder 分析模型内部行为。
Hugging Face 发布 Transformers v5.0.0rc-0,距 v4 首个 RC 五年,目前每日 pip 安装超 300 万次、累计超 12 亿次,模型架构从 40 个增至 400 多个。
推荐理由:官方详解 v5 在简洁性、训练、推理和量化上的改动,以及与主流训练推理工具的互操作设计。
Google 发布 JAX-Privacy 1.0,一套构建和审计差分隐私(DP)模型的开源工具包,提供 DP-SGD、DP-FTRL、DP 矩阵分解等算法和基于 JAX 的原生并行扩展能力。库内含 per-example 梯度裁剪、噪声注入、微批处理等组件,并附 Keras 下微调 Gemma 系列模型的完整示例,此前曾用于训练 VaultGemma。
Hugging Face 发布 huggingface_hub v1.0,该库现支持 20 万依赖库,并提供超过 200 万公开模型、50 万公开数据集和 100 万公开 Spaces 的访问。
推荐理由:官方完整梳理了 huggingface_hub 五年演进与 v1.0 的破坏性变更,含兼容性影响和迁移指引,对依赖该库的开发者有直接参考价值。
Hugging Face 团队发布 LeRobot v0.4.0,引入支持超过 400GB 数据集的 LeRobotDataset v3.0 分块格式与流式加载,并集成 Physical Intelligence 的 pi0、pi0.5 和 NVIDIA 的 GR00T N1.5 等 VLA 模型。
推荐理由:Hugging Face 官方详述 LeRobot v0.4.0 各项升级,读者可以据此评估新的数据格式、VLA 模型集成和硬件插件如何用于自己的机器人学习项目。
Sentence Transformers(SBERT)正式从 TU Darmstadt 的 UKP Lab 移交至 Hugging Face,由 2023 年底起接手维护的 Tom Aarsen 继续领导。该开源库自 2019 年由 Nils Reimers 创建,Hub 上已有超过 16,000 个模型,月独立用户超百万。项目将继续以 Apache 2.0 许可证保持社区驱动的开源模式。
NVIDIA 发布 Nemotron-Personas-India,首个对齐印度真实人口分布的开源合成人物数据集,采用 CC BY 4.0 许可。数据集包含 2100 万个人物(3M 记录 × 7 人物),共 7.7 billion tokens,支持英语和印地语(天城文与拉丁字母),覆盖全部 36 个邦和 640 个地区。
NVIDIA 发布首个面向日本人口统计、地理与文化特征的开源合成人设数据集 Nemotron-Personas-Japan,采用 CC BY 4.0 许可。
Hugging Face 介绍了 SyGra,一个用于 LLM 与 SLM 数据集创建、转换与对齐的低代码/无代码框架。它以 Python 库形式提供,支持 vLLM、Hugging Face TGI、Triton、Ollama 等多种推理后端,用户只需专注于提示词工程。该框架可覆盖 Q&A 生成、DPO 偏好对、推理增强、多语言转换、质量过滤及 RAG 场景等多种数据构建需求。
Numina 与 Kimi 开源 kimina-prover-rl,一个基于 DeepSeek-R1 推理范式、与 Verl 完全兼容的 Lean 4 形式化定理证明训练管线,采用 GRPO 强化学习并配套 kimina-lean-server 验证服务。
Intel 推出 AutoRound,一种 weight-only 后训练量化方法,通过符号梯度下降联合优化权重取整和截断范围,支持 INT2 至 INT8 低比特量化。
Hugging Face 开源 PipelineRL,这是一种实验性 LLM 强化学习实现,核心创新是在训练过程中进行 inflight 权重更新,在不停止推理的情况下同步最新模型权重,兼顾高推理吞吐与 on-policy 数据。
Yaak 与 LeRobot 团队发布开源自驾数据集 L2D(Learning to Drive),R4 版含 100 万个 episode、5000+ 小时驾驶、90+ TB 多模态数据,采集自德国 30 个城市的 60 辆驾校电动车。
印度科学理工学院(IISc)与 ARTPARK 和 Hugging Face 合作,将开源多模态多语言数据集 Vaani 开放给全球开发者。