跳到正文

#论文/研究

今日 1 条
今天10月2日周五
  1. Ars Technica · AI61

    AI 系统 Ataraxos 以 15 比 1 击败史上最强 Stratego 棋手

    CMU、MIT、纽约大学和斯坦福的研究团队开发 AI 系统 Ataraxos,以 15 比 1(另有四局和棋)击败被认为史上最强的 Stratego 棋手 Pim Niemeijer。训练仅用 16 块 GPU 和几千美元。Stratego 属于不完全信息游戏,棋子身份要直到碰撞时才揭晓,此前连 DeepMind 也未能造出可靠战胜顶尖人类玩家的系统。

9月21日周一
9月3日周四
8月27日周四
8月12日周三
  1. Google Research61

    Google Research 推出 AMIE (Video) 实现实时音视频临床问诊的专家级表现

    Google Research 发布 AMIE (Video),基于 Gemini 和 Project Astra 的实时视频问诊系统,采用 Talker、Planner、Perception 三个智能体并行工作的异步多智能体架构。

    推荐理由:原文给出研究架构、随机对照规模和关键结果,读者可以了解视频问诊 AI 与真人医生对比的具体依据和局限。

8月6日周四
  1. Google DeepMind78

    Google DeepMind 开源 WeatherNext 气旋预报模型,提前量超过 24 小时

    Google DeepMind 在 Nature 发表论文并开源 WeatherNext 2 和 WeatherNext Cyclones 模型,单一 AI 模型即可预测气旋路径、强度和风结构,平均多出超过 24 小时的预报提前量,相当于过去 20 年趋势下约十年的气象进步。

    推荐理由:Google DeepMind 官方发布并开源了模型权重,读者可以结合 Nature 论文数据评估其对气旋预报工作流的实际改进。

4月1日周三
  1. Hugging Face Blog62

    TII 发布 Falcon Perception 0.6B 早融合感知模型及 0.3B Falcon OCR

    TII Falcon Vision 团队发布 Falcon Perception,一个 0.6B 参数的早融合 Transformer,用混合注意力掩码处理图像块与文本,做自然语言提示的开放词汇定位与分割,在 SA-Co 上达到 68.0 Macro-F1(SAM 3 为 62.3),但在 presence calibration 上落后(MCC 0.64 vs 0.82)。

    推荐理由:TII 自述用单一早融合 Transformer 做开放词汇感知,读者可以看到架构、数据配方和 SA-Co 与 PBench 上的具体对比依据。

2月13日周五
  1. OpenAI News65

    GPT-5.2 推导出理论物理新结果

    OpenAI 发布预印本,显示 GPT-5.2 提出了一个新的 gluon amplitude(胶子振幅)公式,该公式随后由 OpenAI 与学术合作者正式证明和验证。

    推荐理由:模型提出的新物理公式经学术合作者证明与验证,可作为前沿模型科研能力的具体例证。

2月10日周二
  1. Google DeepMind80

    Google DeepMind 发布两篇论文,展示 Gemini Deep Think 在数学与科学研究中的应用

    Google DeepMind 发布两篇论文,介绍 Gemini Deep Think 在专家指导下解决数学、物理和计算机科学的专业研究问题。其数学研究智能体 Aletheia 配备自然语言验证器并可承认失败,在 IMO-ProofBench Advanced 上最高得分 90%,并自主解决 Bloom's Erdős 猜想数据库中的四个开放问题,包括 Erdős-1051。

    推荐理由:原文给出两篇论文的具体成果和方法细节,读者可以了解 AI 辅助科研的实际边界与协作模式。

1月20日周二
1月13日周二
11月13日周四
12月20日周五
  1. OpenAI News60

    OpenAI 发布 Deliberative alignment 研究,让 o1 模型通过推理执行安全规范

    OpenAI 推出面向 o1 模型的新对齐策略 Deliberative alignment,直接教模型安全规范并让其对这些规范进行推理。该方法旨在通过推理能力提升语言模型的安全性。

    推荐理由:OpenAI 官方介绍了 o1 系列采用的对齐策略思路,可作为理解推理能力如何用于安全规范的参考材料。

4月22日周一
  1. Hugging Face Blog50

    Hugging Face 发布多用途 Transformer 智能体 JAT 及首个通用智能体训练数据集

    Hugging Face 发布 JAT,一个基于 Transformer 的多用途智能体项目,包含 Gato 的开放复现:发布了覆盖 Atari、BabyAI、Meta-World、MuJoCo 等环境的大量专家 RL 智能体、首个通用智能体训练数据集 JAT dataset(含数十万条专家轨迹)以及可玩电子游戏、控制机器人、执行导航指令的 JAT 模型。

2月2日周三
8月23日周四
2月7日周三
10月19日周四
8月11日周五
  1. OpenAI News65

    OpenAI 自对弈 Dota 2 bot 在 1v1 标准赛事规则下击败世界顶尖职业选手

    OpenAI 宣布其 Dota 2 bot 在标准赛事规则的 1v1 对局中击败世界顶尖职业选手。该 bot 从零开始通过自对弈学习,不使用模仿学习或树搜索。作者称这是向在涉及真实人类的混乱复杂环境中完成明确目标的 AI 系统迈出的一步。

    推荐理由:原文点明该 bot 完全靠自对弈从零学习、不用模仿学习和树搜索,可帮助读者理解其在复杂环境 AI 中的定位。

4月6日周四