AI 系统 Ataraxos 以 15 比 1 击败史上最强 Stratego 棋手
CMU、MIT、纽约大学和斯坦福的研究团队开发 AI 系统 Ataraxos,以 15 比 1(另有四局和棋)击败被认为史上最强的 Stratego 棋手 Pim Niemeijer。训练仅用 16 块 GPU 和几千美元。Stratego 属于不完全信息游戏,棋子身份要直到碰撞时才揭晓,此前连 DeepMind 也未能造出可靠战胜顶尖人类玩家的系统。
CMU、MIT、纽约大学和斯坦福的研究团队开发 AI 系统 Ataraxos,以 15 比 1(另有四局和棋)击败被认为史上最强的 Stratego 棋手 Pim Niemeijer。训练仅用 16 块 GPU 和几千美元。Stratego 属于不完全信息游戏,棋子身份要直到碰撞时才揭晓,此前连 DeepMind 也未能造出可靠战胜顶尖人类玩家的系统。
研究人员开发的 Ataraxos AI 以 85% 的有效胜率击败四届世界冠军、公认史上最强 Stratego 玩家 Niemeijer,结束了一个人类对 AI 的最后堡垒。
推荐理由:研究以约八千美元算力战胜最强人类 Stratego 玩家,正则化和信念网络方法可迁移到其他不完全信息博弈。
Google DeepMind 发布 Gemini 4 Argon,面向编码、企业知识工作与网络防御,宣称在 19 项基准中的 13 项排名第一,输出上限从 64K 提升至 1M(通过 Long Decode Continuation 实现)。
推荐理由:汇总了 Gemini 4 Argon 的基准成绩、定价与获取限制,并保留独立评测和质疑声音,读者可据此平衡官方宣传。
Google 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind 计划向可信网络防御者和内部团队开放,再逐步向开发者、企业和消费者开放,暂未给出日期。
推荐理由:文章汇总独立评测、定价和灰度策略,显示 Argon 缩小与头部差距但在 token 效率上仍有代价。
Google 发布新一代前沿模型 Gemini 4 Argon,称其在软件工程、法律和金融等企业知识工作以及网络防御方面具有前沿表现。初期仅限一组受信任的网络防御者使用,Google 正参与美国政府发布前模型访问的自愿流程并逐步扩大访问范围;该模型已用于 Google 内部工作流,如大规模代码库迁移。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络防御者开放,后续面向开发者、企业和消费者推出。
推荐理由:官方公布的能力、价格与安全机制信息完整,读者可以据此判断 Gemini 4 Argon 在编码、知识工作和网防上的实际变化。
OpenAI 在 DevDay 2026 发布常驻智能体 Dots(由 GPT-6 Astra 驱动,连接 4000+ 应用)、GPT-6.1 Sol(价格约为 Astra 的 1/5。
Latent Space 主笔 swyx 宣布 AINews v3 计划,将合并 Discord 与 AINews 的功能、探索迁移至 Beehiiv,并重新开放赞助(business@latent.space)与 PR/tips 投稿。
NVIDIA Vera Rubin NVL72 首次参加 MLPerf Inference v6.1 预览提交即取得领先性能:在 Qwen3-VL 上吞吐量最高达 GB300 NVL72 的 3.7 倍,在 DeepSeek-R1 上使用 TensorRT-LLM 最高达 2.5 倍。
Google DeepMind 发布 AlphaGenome Atlas 平台,收录人类基因组约 90 亿个单核苷酸变体的分子效应预测,数据集达 1 PB,超过 AlphaFold 数据库 30 倍以上。
推荐理由:平台把 90 亿个单核苷酸变体的预测免费开放,配合 AVI 评分与案例结果,研究者在排序罕见病变体时可省去大量实验验证。
Google DeepMind 发布 Gemini 3.8 Flash 和 3.8 Flash Cyber,称其为迄今最佳推理与编码模型,定价与 3.7 Flash 相同(每百万输入 token $0.75、输出 $3.75)。
推荐理由:官方公布了两个变体的基准数字、定价和 Cyber 版的申请入口,读者可据此评估升级成本与实际收益。
Hugging Face 推出 BenchMIRT,一种基于多维 IRT 的方法,用于在题目层面审计 LLM 基准的真实测量内容。该方法基于 100 个 LLM、16 个基准和超过 34K 道题的结果训练,未事先标注即独立恢复出安全与通用推理两个维度。分析发现 BBQ 和 WMDP 得分与通用推理的关联强于安全,HarmBench 的版权类题目也更偏向通用推理。
IBM 发布 Granite 4.2 推理模型家族,含 3B、8B、30B 三个稠密模型,以 Apache 2.0 许可开源。
推荐理由:IBM 官方公开 Granite 4.2 从预训练到多阶段 RL 的完整训练细节,读者可以借此了解推理模型的可复现构建路径。
METR 研究发现 AI 在网络安全领域带来重大加速、对数学研究是小幅加速,而对 AI 研究本身优化无可测加速。华盛顿大学、斯坦福等多校团队发布 SPADE 框架,通过自博弈共同进化环境生成与智能体能力,在 Qwen3-30B-A3B 上使游戏环境套件平均分达 58.3,较基座高 +8.1。
Liquid AI 为 LFM2.5 系列三个模型(LFM2.5-1.2B-Instruct、LFM2.5-2.6B、LFM2.5-8B-A1B)发布 DSpark 草稿模型检查点,采用投机解码在不改变输出质量的前提下大幅加速解码。
推荐理由:官方给出 DSpark 草稿模型的具体加速数据、质量等价原理和 llama.cpp 与 SGLang 的用法,端侧部署可直接迁移。
DiG-bench 是一个包含 70 款隐藏规则游戏的基准,用于测试 AI 通过探索发现环境规则的能力,来自牛津、Princeton、MIT 等机构,作者包括 Juergen Schmidhuber。
Microsoft Research 推出 MindTopo 基准,评估多模态大模型在连通性、包围、顺序、分离与绳结五类拓扑概念上的推理与规划能力。测试显示,各类专有和开源模型在静态推理上明显优于交互式规划任务,且均远低于人类水平,错误多出现在多步规划中丢失结构关系或提出违反物理约束的动作。该基准可为机器人和交互环境中需要保持拓扑结构的智能体研究提供诊断工具。
Google Research 提出 knowledge profiling 行为框架和 WikiProfile 基准(2,150 条 Wikipedia 事实,各配 10 个任务),评估 13 个 LLM 约 450 万条回复。
推荐理由:Google 用知识画像框架把事实错误拆成编码与召回两类,指出前沿模型瓶颈在召回,并量化 thinking 的恢复作用。
IBM Research 在博客中对比自家的 ALTK-Evolve 与 ACE 两种智能体记忆方法,两者都不压缩经验教训,差异在于交付:ACE 每步注入完整 playbook,ALTK-Evolve 按任务和模型能力检索适量 guideline。
Import AI 468 期关注 AI 研究自动化风险:智库 IFP 提出 23 项分属 7 大类的“低悔”政策建议,帮助美国应对 AI R&D 自动化,包括提升透明度、发展 AI 验证技术和增强社会韧性。
多伦多大学、Vector Institute、剑桥大学与 ServiceNow 的研究者构建了一个用开源权重 LLM 驱动的自复制计算机蠕虫原型:被攻陷主机的 GPU 上运行 LLM 进行推理,自主发现漏洞并感染新目标,单 GPU(80GB A100)即可运行且不依赖厂商 API。漏洞检测成功率约 80%,利用约 53%,自复制 88%,完整攻击总体成功率约 37%。
Google Research 提出 Chain-of-Evidence(CoE)可验证性框架,并发布原生维护证据链的自主科研原型 Science One Framework,配套 CoE Audit 自动审计指标。
Google DeepMind 发布 Gemini Robotics ER 2,定位为机器人的高层具身推理大脑,可编排 VLA 模型、导航 API 等底层工具完成多步任务。
推荐理由:官方发布详细列出了视频理解、进度追踪、多机协作的量化指标与获取入口,读者可据此评估机器人任务编排能力的变化。
IBM Research 与 UC Berkeley Sky Lab 基于开源 K-Search 框架构建结构化 CUDA 到 MLX 翻译层,用演化搜索为 Apple Silicon 生成高质量内核。
Google 在 DOE Genesis Mission Summit 2026 上宣布投入价值 4000 万美元的 AI tokens 和云资源,支持白宫十年内将美国科学发现速度翻倍的 Genesis Mission。
Thinking Machines 在 Hugging Face 发布开源多模态模型 Inkling,总参数 975B、激活 41B 的 MoE 架构,原生接受图像、文本和音频输入,支持 1M 上下文窗口,训练数据为 45 万亿 token。
推荐理由:原文给出架构细节、各档位 VRAM 部署配置和多模态评测数据,对评估落地成本和选择变体有直接参考。
Hugging Face 发布 Profiling in PyTorch 系列第三篇,用 A100 GPU 对比 naive attention、in-place 掩码、SDPA math/efficient/flash/cuDNN 六种实现的 profiler trace。
Mistral 发布 Leanstral 1.5,Apache-2.0 许可,总参数 119B、激活 6B,主打 Lean 4 形式化证明工程。模型饱和 miniF2F,解出 587/672 PutnamBench 问题,在 FATE-H 达 87%、FATE-X 达 34%;经 mid-training、SFT 和 CISPO 强化学习三阶段训练。
推荐理由:原文给出基准成绩、成本对比和真实代码验证案例,读者可以据此评估开源形式化推理模型的实用边界。
Hugging Face 团队提出 DiScoFormer,单个 Transformer 模型经一次前向传播即可同时估计任意数据集分布的密度和 score,无需针对新分布重训练。
Google 将 Multi-Token Prediction(MTP)头附加到冻结权重的 Gemini Nano v3 模型上,已面向 Pixel 9 和 10 系列推出,可开箱即用地加速端侧 AI。
Google Research 在 COLM 2026 发表论文,发现开启推理后模型能召回原本无法给出的简单单跳事实,实验覆盖 Gemini-2.5 Flash/Pro 与 Qwen3-32B,使用 SimpleQA Verified 和 EntityQuestions 数据集。
智谱发布旗舰模型 GLM-5.2,面向长时程任务,首次在稳定的 1M-token 上下文上交付该能力,采用 MIT 开源协议。架构上提出 IndexShare,每 4 层稀疏注意力共享一个 indexer,1M 上下文下每 token FLOPs 降低 2.9 倍,并改进 MTP 层使投机解码接受长度最多提升 20%。
推荐理由:官方技术报告给出 1M 上下文的架构改进和三项长时程基准对比,读者可以借此评估开源模型在真实编码场景的可用性。
Google DeepMind 发布基于文本扩散的开源实验模型 DiffusionGemma,采用 Apache 2.0 协议,权重已在 Hugging Face 上提供。
推荐理由:官方说明了文本扩散模型的架构取舍与适用场景,读者可据此判断它是否适合本地低并发的高吞吐需求。
Google DeepMind 发布在塞拉利昂开展的预注册 RCT 结果,使用 Guided Learning 的学生数学成绩较对照组提升 +0.258 个标准差,约合 1.2 至 1.7 年常规学习进度;教师将 Gemini 融入约半数课时(目标 12 小时)的班级提升更高,约 1.8 至 2.5 年。
推荐理由:原文给出了预注册 RCT 的量化结果和交互数据,读者可以据此评估 AI 辅助教学在真实课堂中的效果与局限。
JetBrains 发布 Mellum2,一个总参数 12B、每 token 仅激活 2.5B 的开源 Mixture-of-Experts 模型,在自然语言和代码语料上从头训练,采用 Apache 2.0 许可证。
OpenAI 宣布其模型解决了有 80 年历史的单位距离问题,推翻了离散几何中的一个重要猜想。官方称这是 AI 驱动数学研究的里程碑。
推荐理由:OpenAI 官方宣布模型在数学研究上解决 80 年悬而未决的问题,可关注其对 AI 驱动数学研究的意义。
Google 发布基于 Gemini 的科学研究工具 ERA,可搜索文献、编写和用树搜索优化科学代码,在基因组学、公共卫生、卫星图像、神经科学、时间序列预测和数学等基准上达到专家级表现,论文发表于 Nature。
推荐理由:原文给出 ERA 的树搜索方法、多领域基准结果和五篇应用论文细节,并说明新工具的开放入口,读者可了解它如何用于具体科学问题。
Google 发布 Gemini for Science,包含 Google Labs 上三个实验性工具和 Google Antigravity 中的 Science Skills。
剑桥大学 Clare Bryant 教授使用 Google DeepMind 的 Co-Scientist 研究病原体跨物种传播(如禽流感和人流感)时引发脓毒症等重症的分子开关。
Google DeepMind 的 AI 工具 Co-Scientist 正被 Calico Life Sciences 用于衰老研究,帮助整合零散的生物学发现并生成可检验的假设。Calico 团队利用它提出了关于整合应激反应(ISR)如何受代谢调控的新假设,并借助它优化实验设计。相关实验带来对 ISR 在健康与疾病中作用的新发现,团队计划发表结果。