AllenAI 发布 Olmo-core 3:面向万亿参数 MoE 的开源训练框架
AllenAI 发布开源训练框架 Olmo-core 3, redesigned MoE 训练系统,目标是将 MoE 训练扩展到万亿参数规模。基准测试显示,在 512 块 NVIDIA B300 GPU 上运行 1.2 万亿总参数模型达到 858 TFLOP/s/GPU,新栈比旧 FSDP 实现吞吐高约 2.7 倍;MXFP8 使吞吐比 BF16 提高约 21%。
AllenAI 发布开源训练框架 Olmo-core 3, redesigned MoE 训练系统,目标是将 MoE 训练扩展到万亿参数规模。基准测试显示,在 512 块 NVIDIA B300 GPU 上运行 1.2 万亿总参数模型达到 858 TFLOP/s/GPU,新栈比旧 FSDP 实现吞吐高约 2.7 倍;MXFP8 使吞吐比 BF16 提高约 21%。
OpenAI 宣布拦截了一次旨在提取其受保护模型推理内容的协同行动,并表示正在加强针对对抗性蒸馏的防御措施。
NVIDIA 发布开源表格基础模型 Kumo Tabular,对带标签的表格数据在单次前向传播中完成分类或回归预测,无需训练、调参或特征工程。
推荐理由:官方发布开放表格基础模型,用上下文学习免训练预测,作者给出了架构细节和基准表现,读者可以评估它是否适合替换现有梯度提升树流程。
NVIDIA 与 Google DeepMind、EMBL-EBI 等机构合作,通过 AlphaFold Database 开放发布超过 2,800 种病毒蛋白复合物的预测 3D 结构。
NVIDIA 在多伦多 ROSCon 大会上发布 Isaac ROS 5.0,新增面向智能体的工作流、Isaac skills 和对 ROS Lyrical 与 Ubuntu 24.04 的支持。
Google Research 在 ACL 2026 提出 ToolGrad,先生成真实工具调用链再标注用户查询的“answer-first”范式,替代传统 DFS 探索式数据生成,通过 propose、execute、select、update 四个模块迭代构建 API 工作流。
Hugging Face 博客介绍 TRL v1.14 的 AsyncGRPOTrainer 支持 LoRA 训练并仅向 vLLM 同步几 MB 的 adapter,训练与推理以独立 HF Jobs 运行,通过 Storage Bucket 挂载共享 adapter,前置代理负责加鉴权头、按 KV 前缀路由 rollout 并向所有副本广播 adapter 加载。
推荐理由:原文给出了跨机 LoRA GRPO 的完整架构与五轮瓶颈调优数据,500 步从 3 小时 27 分压到 53 分钟,方法可直接复用。
Google Research 评估了将 UK Biobank 欧洲人群 GWAS 训练的多基因风险评分(PRS)迁移到 Biobank Japan 近 20 万日本人群样本的效果,涵盖 BMI、血压、HDL、LDL、血糖等 8 个临床性状。
Hugging Face 工程师用 TRL 和 OpenEnv 开源复现了 Surya Narreddi 的项目:训练语言模型写 JavaScript(通过 p5.brush)绘制水彩画。
Hugging Face 发布教程,展示用 TRL 库以 GRPO 微调 LiquidAI/LFM2.5-350M 提升结构化输出合规率。训练仅用约 500 样本和 100 步,可在免费版 Colab 或 Kaggle GPU 上运行,评测经 llama.cpp 在 MacBook 本地完成。
推荐理由:原文给出完整可复现的 GRPO 微调流程和量化前后对比,读者可以用同样低成本方法提升小模型的结构化输出合规率。
Google 与 NASA JPL 在 PNAS 发表 MAPL-EMIT,一个基于 Swin-S 视觉 transformer 的框架,可自动检测、量化和定位 EMIT 高光谱数据中的甲烷羽流。
Voice Arena 与 Hugging Face 合作,在 Open ASR Leaderboard 引入 Monsoon en-IN 和 Monsoon hi-IN 两套评测集,覆盖 4,888 名说话人,印地语是该多语言榜单上首个非欧洲语言。
推荐理由:原文给出 Monsoon 四个评测集的采集设计与区域误差分析样例,读者可以了解带说话人元数据的 ASR 评测能揭示什么。
Multiverse Computing 发布 Quantization-Aware Healing(QAH)方法,将 GPT-OSS 120B 压缩到 60B 参数并量化为 MXFP4 后,模型在 9 项基准中的 7 项超过其 bfloat16 全精度版本,AA-LCR 提升 7.4 分、AIME 2025 提升 5.6 分。
Microsoft Research 发布 Skala 1.1,训练数据较上一版增加 2.5 倍,在 GMTKN55 基准的 55 个类别中 32 项排名第一,加权平均误差 2.8 kcal/mol,并以 meta-GGA 的计算成本超越最昂贵的 global hybrid 泛函。
IBM Research 在博客中对比自家的 ALTK-Evolve 与 ACE 两种智能体记忆方法,两者都不压缩经验教训,差异在于交付:ACE 每步注入完整 playbook,ALTK-Evolve 按任务和模型能力检索适量 guideline。
Hugging Face 论文提出两项系统改动来降低 LLM 知识蒸馏成本:离线缓存 teacher 的 top-100 logits,以及将输出投影融合进损失的 fused chunked KL loss,避免构建全词表 × 序列长度矩阵。
Google Research 提出 Chain-of-Evidence(CoE)可验证性框架,并发布原生维护证据链的自主科研原型 Science One Framework,配套 CoE Audit 自动审计指标。
UC Berkeley BAIR 团队提出 ABBEL 框架,用自然语言信念状态替代完整交互历史作为 LLM 智能体的工作上下文,并通过 belief grading 监督摘要内容。
UC Berkeley 的 Aditya G. Parameswaran 团队发文认为近零成本推理时代将重塑数据系统,提出三类议程:For Agents 重新设计系统以应对智能体高并发重复查询(实验中仅 10-20% 子计划不同)。
Photoroom 发布 PRX 系列第四篇博客,详解其 7B 文生图模型的预训练数据策略,包括用 Lance 建库、Mosaic Streaming(MDS)供流、分辨率与长宽比分桶等核心环节。
Google Research 发布面向表格数据分类与回归的零样本基础模型 TabFM,将表格预测重构为上下文学习问题,免去人工训练、调参和特征工程。
推荐理由:官方介绍了把表格预测重构为上下文学习问题的模型设计、合成数据训练方式和 TabArena 基准结果,读者可据此评估其对传统表格机器学习流程的影响。
NVIDIA NeMo AutoModel 构建在 HuggingFace Transformers v5 之上,只需更改一行 import 即可微调 MoE 模型,相比最优的 v5 配置训练吞吐提升 3.4-3.7x、GPU 显存降低 29-32%。
ServiceNow 团队在 Hugging Face Blog 发布 MosaicLeaks 基准与 PA-DR 训练方法,研究深度研究智能体通过 web 查询逐步拼出私有文档信息导致的马赛克式隐私泄露。
Hugging Face 在 PEFT 库中 added LLM 数学微调和图像生成两个基准,用相同模型、数据、代码和硬件对比 40 多种 PEFT 技术,并追踪 VRAM、遗忘、运行时间和 checkpoint 大小等指标。
推荐理由:Hugging Face 用统一条件的基准实测多种 PEFT 技术,给出 LoRA 并非处处最优的证据和其他技术在两个任务上的具体取舍数据。
Hugging Face 宣布 OpenEnv 转为由多方委员会协调的开源项目,委员会成员包括 Meta-PyTorch、Unsloth、Modal、Nvidia、Microsoft 等。
Google 在 Nature 发表 PHRM 研究系统,利用人脸解锁后的前摄视频,通过深度学习在后台估计心率,相比 ECG 的 MAPE 为 6.09%,日静息心率相对 Fitbit Charge 6 的 MAE 为 4.39 bpm。研究覆盖近 700 名不同肤色参与者,是迄今最大规模的 rPPG 研究,并公开发布数据集与预训练 PHRM-mini 模型供合格研究者申请使用。
推荐理由:原文给出跨肤色验证数据与免费开放的数据集和模型入口,研究者可以据此评估rPPG方法的可复用性。
NVIDIA 发布 Nemotron 3.5 Content Safety,基于 Gemma 3 4B IT 微调,将多模态输入、12 种语言显式训练覆盖、自定义策略执行和可审计推理轨迹统一到一次推理调用中。
Hugging Face 在 DharmaOCR 训练中把 DPO 用于聊天对齐之外的场景:用模型自身失败产生的退化循环构建拒绝对,作为第二训练阶段降低结构化 OCR 的文本退化率。
Hugging Face 的 Tom Aarsen 发布 ettin-reranker-v1 系列,含 17M 到 1B 六个 Sentence Transformers CrossEncoder 重排序模型,基于 Ettin ModernBERT 编码器,Apache 2.0 许可,支持最长 8192 token 上下文。
推荐理由:作者公开了六个模型、完整训练脚本和1.43亿条蒸馏数据,并给出与主流reranker的速度和精度对比,便于按规模选型或自行复现训练。
OpenAI 举办 Parameter Golf 活动,汇聚 1000+ 参与者和 2000+ 提交作品,探索 AI 辅助机器学习研究。活动在严格约束下覆盖 coding agents、量化和新型模型设计等方向。
Hugging Face 与 AWS 分析了基础模型预训练、后训练和推理生命周期所需的基础设施,提出由加速计算、高带宽低延迟网络和分布式存储构成的分层架构。
PipelineRL 在从 vLLM V0(0.8.5)迁移到 V1(0.18.1)时发现 train-inference 不匹配,影响 GSPO 训练的 clip rate、KL、entropy 和 reward。
OpenAI 介绍了 ChatGPT 如何在了解世界的同时保护用户隐私:减少训练中的个人数据,并让用户可以选择自己的对话是否用于改进 AI 模型。
IBM Granite 团队发布 Granite 4.1 系列 dense 模型,含 3B、8B、30B 三个规模,在约 15T tokens 上训练,上下文经长文本扩展达 512K,均以 Apache 2.0 许可开源。
推荐理由:原文完整披露了五阶段预训练、SFT 质控和四阶段 RL 的训练配方,8B 稠密模型对标上一代 32B-A9B MoE 的结果也可供选型参考。
Google DeepMind 发布 Decoupled DiLoCo 分布式训练架构,将训练拆分为异步通信的“岛屿”(learner units),可在全球分布的数据中心间训练 LLM。
Google Research 推出 Simula,一个推理优先的合成数据生成框架,无需种子数据,将数据集构建分解为全局多样性、局部多样性、复杂化和质量检查四个可控维度。
Hugging Face 将 RLVE 框架从单轮推理任务扩展到多轮、带工具调用的电商对话场景,推出 EcomRLVE-GYM,提供 8 个可算法验证的环境,如商品发现、换货、购物车构建、订单追踪等。
Google Research 发布 ConvApparel 数据集,包含 4,000 多段服装购物领域的人机多轮对话(近 15,000 轮),用于量化 LLM 用户模拟器与真实人类行为的“真实感差距”。
TII Falcon Vision 团队发布 Falcon Perception,一个 0.6B 参数的早融合 Transformer,用混合注意力掩码处理图像块与文本,做自然语言提示的开放词汇定位与分割,在 SA-Co 上达到 68.0 Macro-F1(SAM 3 为 62.3),但在 presence calibration 上落后(MCC 0.64 vs 0.82)。
推荐理由:TII 自述用单一早融合 Transformer 做开放词汇感知,读者可以看到架构、数据配方和 SA-Co 与 PBench 上的具体对比依据。
Google Research 在论文 "Forest vs Tree: The (N,K) Trade-off in Reproducible ML Evaluation" 中研究了 AI 评测中每题标注数(K)与标注条目数(N)之间的可复现性权衡,模拟器已开源在 GitHub。