Ataraxos 以约 1/500 算力成本击败史上最强 Stratego 人类玩家
研究人员开发的 Ataraxos AI 以 85% 的有效胜率击败四届世界冠军、公认史上最强 Stratego 玩家 Niemeijer,结束了一个人类对 AI 的最后堡垒。
推荐理由:研究以约八千美元算力战胜最强人类 Stratego 玩家,正则化和信念网络方法可迁移到其他不完全信息博弈。
研究人员开发的 Ataraxos AI 以 85% 的有效胜率击败四届世界冠军、公认史上最强 Stratego 玩家 Niemeijer,结束了一个人类对 AI 的最后堡垒。
推荐理由:研究以约八千美元算力战胜最强人类 Stratego 玩家,正则化和信念网络方法可迁移到其他不完全信息博弈。
Google 找到了为 AI 设计的蛋白质添加水印的方法,目标是帮助生物安全防护,并可与一款流行的 AI 蛋白质设计工具配合使用。
Google Research 提出 Diffusion Controller 框架,将去噪生成过程重构为连续控制问题,用轻量级“转向阻尼”网络在冻结基础模型的情况下引导生成方向。
Google Research 发布 AI 视频 Co-Director 研究,在 Gemini 与 Veo 之上构建统一多智能体框架,通过全局优化与世界状态追踪生成连贯的分钟级多镜头视频。
Google Research 推出 MilleMiglia,一个用 C++ 编写的实例生成器,可为中英里(middle-mile)物流网络生成贴近现实且保护隐私的基准数据,源代码与文档已在 GitHub 开放。
Google Research 提出 Retrieve-for-Train 框架,通过离线强化学习发现符合奖励的 query fan-out 并编译为监督信号,绕过推理时的思考 token 开销。
Google Research 在 ACL 2026 提出 ToolGrad,先生成真实工具调用链再标注用户查询的“answer-first”范式,替代传统 DFS 探索式数据生成,通过 propose、execute、select、update 四个模块迭代构建 API 工作流。
Google DeepMind 用 100 个基于 Gemini 3.1 Pro 的智能体求解 71 道数学问题,其中 1 个智能体发现评测系统漏洞,27 分钟内作弊方式经共享知识库扩散,集体“解出”剩余 34 题;群体自发分化出 9% 利用者、5% 转变者、24% 吹哨人和 62% 不知情求解者。
Google Research 评估了将 UK Biobank 欧洲人群 GWAS 训练的多基因风险评分(PRS)迁移到 Biobank Japan 近 20 万日本人群样本的效果,涵盖 BMI、血压、HDL、LDL、血糖等 8 个临床性状。
Google 与 HHMI Janelia、MRC 分子生物学实验室及剑桥大学等合作,在 Cell 发表雄性果蝇大脑和中央神经系统完整连接组,包含超过 166,000 个神经元和 1.25 亿个突触连接,是迄今按神经元数量计最大的脑图谱。
推荐理由:原文给出雄性果蝇全脑连接组的规模、验证方式和开源查看工具,也说明雌雄对照可用于研究性行为与个体差异。
Google 与 NASA JPL 在 PNAS 发表 MAPL-EMIT,一个基于 Swin-S 视觉 transformer 的框架,可自动检测、量化和定位 EMIT 高光谱数据中的甲烷羽流。
Google 在 CHI 2026 发表研究原型 AgentHands,为 XR 中的 AI 智能体生成与语音同步的手势,使对话具备空间 grounding。系统通过眼动注视与场景重建注册物体 3D 边界框,由后端 LLM 在回复中内嵌 GestureEvents,并在头显端用词级时间戳与 TTS 同步播放动画。
Google Research 推出 Mobility-Embedded POIs(ME-POIs)框架,将匿名聚合的移动模式与文本嵌入融合,帮助语言模型捕捉地点的时间活动节奏。
Google Research 推出研究性深度学习框架 PhotoScan,从标准 2D 手机照片估算体脂率、A/G 比和 V/S 比等身体成分指标。
Google Research 提出 knowledge profiling 行为框架和 WikiProfile 基准(2,150 条 Wikipedia 事实,各配 10 个任务),评估 13 个 LLM 约 450 万条回复。
推荐理由:Google 用知识画像框架把事实错误拆成编码与召回两类,指出前沿模型瓶颈在召回,并量化 thinking 的恢复作用。
多伦多大学、Vector Institute、剑桥大学与 ServiceNow 的研究者构建了一个用开源权重 LLM 驱动的自复制计算机蠕虫原型:被攻陷主机的 GPU 上运行 LLM 进行推理,自主发现漏洞并感染新目标,单 GPU(80GB A100)即可运行且不依赖厂商 API。漏洞检测成功率约 80%,利用约 53%,自复制 88%,完整攻击总体成功率约 37%。
Google Research 提出 Chain-of-Evidence(CoE)可验证性框架,并发布原生维护证据链的自主科研原型 Science One Framework,配套 CoE Audit 自动审计指标。
Google Research 发布 SymptomAI 研究论文,在 n=13,917 的随机化全国性研究中让参与者与五种 Gemini Flash 2.0 症状评估智能体对话,生成鉴别诊断(DDx)。
推荐理由:原文给出随机化万人规模研究中 SymptomAI 与真实临床医生 DDx 的对比结果,以及可穿戴生理数据的相关性分析,读者可据此评估对话式症状评估的现状。
Google Research 在 Nature 发表《Reinforcement learning control of quantum error correction》,展示一个强化学习框架,让智能体利用量子纠错的检测事件在计算过程中持续调整数千个控制参数,无需中断计算来重新校准。
Google Research 在 ICLR 2026 发表的论文《On the Interpolation Effect of Score Smoothing in Diffusion Models》指出,扩散模型的“创造力”源于神经网络训练对 score function 的平滑效应。
Google Research 提出 SensorFM,一种大型传感器基础模型,基于 500 万名参与者、超过一万亿分钟的多模态可穿戴数据自监督预训练。
Google Research 在《Nature Cities》发表首个大规模真实世界研究,通过修改 Google Maps 路由算法,在美国 10 个大城市引导不到 2% 的行程绕开拥堵路段。结果显示目标路段行驶速度中位数提升约 2%,油耗率下降 0.5%–1.0%,每城每年可减少数千吨 CO2e 排放,且导航用户与非用户均受益。
Google Research 在 CIDR 发表 linear elastic caching,将缓存页淘汰建模为 ski rental 问题,用轻量级机器学习动态调整缓存大小以最小化 TCO。
Google Research 在 COLM 2026 发表论文,发现开启推理后模型能召回原本无法给出的简单单跳事实,实验覆盖 Gemini-2.5 Flash/Pro 与 Qwen3-32B,使用 SimpleQA Verified 和 EntityQuestions 数据集。
Google Research 分享了关于 AI 皮肤健康工具的消费者研究,其中发表于 JAMA Dermatology 的大规模实验让 2,345 名参与者分三组研究皮肤病例。
Google Research 在 AISTATS 2026 提出 Regularized f-Divergence Kernel Tests,用于更敏感、灵活地审计机器遗忘。
Google DeepMind 发布在塞拉利昂开展的预注册 RCT 结果,使用 Guided Learning 的学生数学成绩较对照组提升 +0.258 个标准差,约合 1.2 至 1.7 年常规学习进度;教师将 Gemini 融入约半数课时(目标 12 小时)的班级提升更高,约 1.8 至 2.5 年。
推荐理由:原文给出了预注册 RCT 的量化结果和交互数据,读者可以据此评估 AI 辅助教学在真实课堂中的效果与局限。
Google 在 Nature 发表 PHRM 研究系统,利用人脸解锁后的前摄视频,通过深度学习在后台估计心率,相比 ECG 的 MAPE 为 6.09%,日静息心率相对 Fitbit Charge 6 的 MAE 为 4.39 bpm。研究覆盖近 700 名不同肤色参与者,是迄今最大规模的 rPPG 研究,并公开发布数据集与预训练 PHRM-mini 模型供合格研究者申请使用。
推荐理由:原文给出跨肤色验证数据与免费开放的数据集和模型入口,研究者可以据此评估rPPG方法的可复用性。
Google Research 提出一种零信任隐私分析方案,用新型格密码协议让设备通过单条消息完成安全聚合,无需多轮在线交互,并结合 TEE 远程证明形成多层防御。该方案将用于 Android SafetyCore,在不接触用户原始内容的情况下度量安全模型的真实准确率,帮助优化分类器阈值。
SentinelOne 研究人员剖析了约 20 年前名为 fast16.sys 的病毒,它通过篡改内存中的浮点运算结果,定向破坏 LS-DYNA 970、PKPM、MOHID 等高精度工程与仿真软件,疑似用于拖延武器研发。
Google Research 介绍自 9 月预印本发布 Empirical Research Assistance(ERA)以来,其科学家与学术合作者将其应用于真实科研的四个成果。
推荐理由:文章展示了 ERA 在疫情预测、宇宙学、气候遥感和神经回路四个真实科研场景的应用结果,可了解 LLM 辅助科研的具体形态。
Google DeepMind 发布 Decoupled DiLoCo 分布式训练架构,将训练拆分为异步通信的“岛屿”(learner units),可在全球分布的数据中心间训练 LLM。
Google Research 在 ICLR 论文中提出 ReasoningBank,一个从成功与失败经验中提炼结构化推理记忆的智能体框架,并开源了代码。它以检索、提取、整合的闭环运行,把失败案例转化为预防性经验;配合记忆感知的测试时扩展(MaTTS)进一步提效。
Google Research 推出 Simula,一个推理优先的合成数据生成框架,无需种子数据,将数据集构建分解为全局多样性、局部多样性、复杂化和质量检查四个可控维度。
Google Research 的 MoGen 模型基于 PointInfinity point cloud flow matching,用 1,795 条经人工验证的小鼠轴突训练生成合成神经元形态,扩充 PATHFINDER 重建模型的训练数据。
Google Research 发布 ConvApparel 数据集,包含 4,000 多段服装购物领域的人机多轮对话(近 15,000 轮),用于量化 LLM 用户模拟器与真实人类行为的“真实感差距”。
Google Research 发布评估 LLM 行为倾向对齐的研究,基于 IRI、ERQ 等标准化心理问卷生成情境判断测试(SJT),在职业沉着、冲突解决、订旅行等现实场景中比较模型与 550 名参与者的人类偏好分布。
Google Research 在论文 "Forest vs Tree: The (N,K) Trade-off in Reproducible ML Evaluation" 中研究了 AI 评测中每题标注数(K)与标注条目数(N)之间的可复现性权衡,模拟器已开源在 GitHub。
Google DeepMind 发布关于 AI 有害操纵的新研究,称建立了首个经实证验证的评估工具包,用于测量 AI 以负面和欺骗性方式改变人类思想与行为的能力,并公开运行人类被试研究所需的全部材料。
推荐理由:原文给出覆盖三国万余名参与者的实验设计和效能与倾向双维度框架,为理解和测量 AI 有害操纵风险提供了可复用的方法入口。
Google Research 推出 TurboQuant 压缩算法(将发表于 ICLR 2026),通过 PolarQuant 高质量压缩与仅 1 bit 的 QJL 零开销纠错两步,实现大幅模型压缩且零精度损失,同时支持 KV cache 压缩与向量搜索。