AI 系统 Ataraxos 以 15 比 1 击败史上最强 Stratego 棋手
CMU、MIT、纽约大学和斯坦福的研究团队开发 AI 系统 Ataraxos,以 15 比 1(另有四局和棋)击败被认为史上最强的 Stratego 棋手 Pim Niemeijer。训练仅用 16 块 GPU 和几千美元。Stratego 属于不完全信息游戏,棋子身份要直到碰撞时才揭晓,此前连 DeepMind 也未能造出可靠战胜顶尖人类玩家的系统。
CMU、MIT、纽约大学和斯坦福的研究团队开发 AI 系统 Ataraxos,以 15 比 1(另有四局和棋)击败被认为史上最强的 Stratego 棋手 Pim Niemeijer。训练仅用 16 块 GPU 和几千美元。Stratego 属于不完全信息游戏,棋子身份要直到碰撞时才揭晓,此前连 DeepMind 也未能造出可靠战胜顶尖人类玩家的系统。
Microsoft Research 的逆合成模型 RetroChimera 发表于 Nature,结合 Transformer 架构的 R-SMILES 2 与基于 GNN 的 NeuralLoc 两个子模型,用 learning-to-rank 集成策略生成合成路线。
H Company 发布 NeoMME 系列 260M 和 800M 多语言多模态编码器,用单个双向 Transformer 处理文本和 32×32 图像 patch,从零以掩码离散扩散目标训练,无需独立视觉塔或因果语言模型。
Google DeepMind 推出针对专有前沿模型的首个双盲评测,将外部评测限制在密码学安全的“盒子”环境中,防止模型提前看到测试题导致基准污染。此次与 Singapore AI Safety Institute、OpenMined、AVERI 和 MLCommons 合作,对一个 Gemini Flash Lite 模型在隐私保护环境下测试机密基准。
Google Research 发布 AMIE (Video),基于 Gemini 和 Project Astra 的实时视频问诊系统,采用 Talker、Planner、Perception 三个智能体并行工作的异步多智能体架构。
推荐理由:原文给出研究架构、随机对照规模和关键结果,读者可以了解视频问诊 AI 与真人医生对比的具体依据和局限。
Google DeepMind 在 Nature 发表论文并开源 WeatherNext 2 和 WeatherNext Cyclones 模型,单一 AI 模型即可预测气旋路径、强度和风结构,平均多出超过 24 小时的预报提前量,相当于过去 20 年趋势下约十年的气象进步。
推荐理由:Google DeepMind 官方发布并开源了模型权重,读者可以结合 Nature 论文数据评估其对气旋预报工作流的实际改进。
TII Falcon Vision 团队发布 Falcon Perception,一个 0.6B 参数的早融合 Transformer,用混合注意力掩码处理图像块与文本,做自然语言提示的开放词汇定位与分割,在 SA-Co 上达到 68.0 Macro-F1(SAM 3 为 62.3),但在 presence calibration 上落后(MCC 0.64 vs 0.82)。
推荐理由:TII 自述用单一早融合 Transformer 做开放词汇感知,读者可以看到架构、数据配方和 SA-Co 与 PBench 上的具体对比依据。
OpenAI 发布预印本,显示 GPT-5.2 提出了一个新的 gluon amplitude(胶子振幅)公式,该公式随后由 OpenAI 与学术合作者正式证明和验证。
推荐理由:模型提出的新物理公式经学术合作者证明与验证,可作为前沿模型科研能力的具体例证。
Google DeepMind 发布两篇论文,介绍 Gemini Deep Think 在专家指导下解决数学、物理和计算机科学的专业研究问题。其数学研究智能体 Aletheia 配备自然语言验证器并可承认失败,在 IMO-ProofBench Advanced 上最高得分 90%,并自主解决 Bloom's Erdős 猜想数据库中的四个开放问题,包括 Erdős-1051。
推荐理由:原文给出两篇论文的具体成果和方法细节,读者可以了解 AI 辅助科研的实际边界与协作模式。
微软团队(Tianzhu Ye、Li Dong、Yutao Sun、Furu Wei)发布 DIFF Transformer V2,在 DIFF V1 基础上让相减的两个 head 共享同一 GQA 组的 key 和 value,不再增加 KV head,解码速度与标准 Transformer 相当,也无需自定义 attention kernel。
Google 发布在 Science Advances 的论文,介绍 NeuralGCM 通过直接在 2001 至 2018 年 NASA 卫星降水观测上训练,改进全球降水模拟能力。
Google DeepMind 发布 SIMA 2,将 Gemini 模型嵌入智能体核心,使其从跟随指令进化为能思考目标、与用户对话并自我改进的通用游戏智能体。
推荐理由:官方介绍 SIMA 2 如何借 Gemini 从执行指令走向推理与自改进,读者可了解具身智能体训练路径。
OpenAI 推出面向 o1 模型的新对齐策略 Deliberative alignment,直接教模型安全规范并让其对这些规范进行推理。该方法旨在通过推理能力提升语言模型的安全性。
推荐理由:OpenAI 官方介绍了 o1 系列采用的对齐策略思路,可作为理解推理能力如何用于安全规范的参考材料。
Hugging Face 发布 JAT,一个基于 Transformer 的多用途智能体项目,包含 Gato 的开放复现:发布了覆盖 Atari、BabyAI、Meta-World、MuJoCo 等环境的大量专家 RL 智能体、首个通用智能体训练数据集 JAT dataset(含数十万条专家轨迹)以及可玩电子游戏、控制机器人、执行导航指令的 JAT 模型。
OpenAI 构建了一个面向 Lean 的神经定理证明器,能解多种有挑战性的高中奥赛题,包括 AMC12 和 AIME 竞赛题,以及两道由 IMO 改编的题目。
OpenAI Five 在温哥华 The International 2018 上与顶级 Dota 2 选手对战两局均告负,两局中 OpenAI Five 在前 20-35 分钟内保持较大获胜机会。
OpenAI 构建了一套实体消歧系统,由神经网络判断词语是否属于约 100 个自动发现的“类型”(非互斥类别),从而自动确定词语所指的对象。
OpenAI 最新的机器人技术让完全在仿真中训练的机器人控制器能部署到实体机器人上,并在解决简单任务时对环境中未计划的变化做出反应。借助这些技术,OpenAI 构建了闭环系统,而非此前的开环系统。
OpenAI 宣布其 Dota 2 bot 在标准赛事规则的 1v1 对局中击败世界顶尖职业选手。该 bot 从零开始通过自对弈学习,不使用模仿学习或树搜索。作者称这是向在涉及真实人类的混乱复杂环境中完成明确目标的 AI 系统迈出的一步。
推荐理由:原文点明该 bot 完全靠自对弈从零学习、不用模仿学习和树搜索,可帮助读者理解其在复杂环境 AI 中的定位。
OpenAI 开发了一个无监督系统,仅在 Amazon 评论文本上训练预测下一个字符,却学到了优秀的情感表示。方法无需情感标注数据。
推荐理由:原文说明模型仅靠预测 Amazon 评论下一字符就学到优秀情感表示,展示了无监督表征的潜力。