跳到正文

#推理

今日 1 条
今天10月2日周五
  1. Ars Technica · AI61

    AI 系统 Ataraxos 以 15 比 1 击败史上最强 Stratego 棋手

    CMU、MIT、纽约大学和斯坦福的研究团队开发 AI 系统 Ataraxos,以 15 比 1(另有四局和棋)击败被认为史上最强的 Stratego 棋手 Pim Niemeijer。训练仅用 16 块 GPU 和几千美元。Stratego 属于不完全信息游戏,棋子身份要直到碰撞时才揭晓,此前连 DeepMind 也未能造出可靠战胜顶尖人类玩家的系统。

10月1日周四
  1. Latent Space77

    Google DeepMind 发布 Gemini 4 Argon,输出上限达 1M token

    Google DeepMind 发布 Gemini 4 Argon,面向编码、企业知识工作与网络防御,宣称在 19 项基准中的 13 项排名第一,输出上限从 64K 提升至 1M(通过 Long Decode Continuation 实现)。

    推荐理由:汇总了 Gemini 4 Argon 的基准成绩、定价与获取限制,并保留独立评测和质疑声音,读者可据此平衡官方宣传。

  2. The Verge · AI68

    Google 发布 Gemini 4 Argon,初期仅向受信任的网络防御者开放

    Google 发布新一代前沿模型 Gemini 4 Argon,称其在软件工程、法律和金融等企业知识工作以及网络防御方面具有前沿表现。初期仅限一组受信任的网络防御者使用,Google 正参与美国政府发布前模型访问的自愿流程并逐步扩大访问范围;该模型已用于 Google 内部工作流,如大规模代码库迁移。

9月30日周三
9月25日周五
9月16日周三
9月8日周二
  1. Google DeepMind72

    Google DeepMind 发布 AlphaGenome Atlas 覆盖人类基因组全部 90 亿单碱基变体预测

    Google DeepMind 发布 AlphaGenome Atlas 平台,收录人类基因组约 90 亿个单核苷酸变体的分子效应预测,数据集达 1 PB,超过 AlphaFold 数据库 30 倍以上。

    推荐理由:平台把 90 亿个单核苷酸变体的预测免费开放,配合 AVI 评分与案例结果,研究者在排序罕见病变体时可省去大量实验验证。

9月3日周四
9月2日周三
  1. Hugging Face Blog43

    Hugging Face 发布 BenchMIRT:审计 LLM 基准实际测的是什么

    Hugging Face 推出 BenchMIRT,一种基于多维 IRT 的方法,用于在题目层面审计 LLM 基准的真实测量内容。该方法基于 100 个 LLM、16 个基准和超过 34K 道题的结果训练,未事先标注即独立恢复出安全与通用推理两个维度。分析发现 BBQ 和 WMDP 得分与通用推理的关联强于安全,HarmBench 的版权类题目也更偏向通用推理。

8月25日周二
8月24日周一
  1. Import AI43

    Import AI 470:机器权利之争、SPADE 自动化环境生成与 Hawkeye 构建 GPU kernel

    METR 研究发现 AI 在网络安全领域带来重大加速、对数学研究是小幅加速,而对 AI 研究本身优化无可测加速。华盛顿大学、斯坦福等多校团队发布 SPADE 框架,通过自博弈共同进化环境生成与智能体能力,在 Qwen3-30B-A3B 上使游戏环境套件平均分达 58.3,较基座高 +8.1。

8月21日周五
  1. Hugging Face Blog66

    Liquid AI 发布 LFM2.5-DSpark 草稿模型,推理最高提速 3.2x

    Liquid AI 为 LFM2.5 系列三个模型(LFM2.5-1.2B-Instruct、LFM2.5-2.6B、LFM2.5-8B-A1B)发布 DSpark 草稿模型检查点,采用投机解码在不改变输出质量的前提下大幅加速解码。

    推荐理由:官方给出 DSpark 草稿模型的具体加速数据、质量等价原理和 llama.cpp 与 SGLang 的用法,端侧部署可直接迁移。

8月17日周一
8月13日周四
  1. Microsoft Research41

    Microsoft Research 推出 MindTopo 基准,测试多模态模型的拓扑空间推理能力

    Microsoft Research 推出 MindTopo 基准,评估多模态大模型在连通性、包围、顺序、分离与绳结五类拓扑概念上的推理与规划能力。测试显示,各类专有和开源模型在静态推理上明显优于交互式规划任务,且均远低于人类水平,错误多出现在多步规划中丢失结构关系或提出违反物理约束的动作。该基准可为机器人和交互环境中需要保持拓扑结构的智能体研究提供诊断工具。

8月12日周三
8月11日周二
8月10日周一
8月3日周一
  1. Import AI48

    Import AI 467:自持自复制的 AI 病毒、AI 进展节奏与 AI 与创造力的困惑

    多伦多大学、Vector Institute、剑桥大学与 ServiceNow 的研究者构建了一个用开源权重 LLM 驱动的自复制计算机蠕虫原型:被攻陷主机的 GPU 上运行 LLM 进行推理,自主发现漏洞并感染新目标,单 GPU(80GB A100)即可运行且不依赖厂商 API。漏洞检测成功率约 80%,利用约 53%,自复制 88%,完整攻击总体成功率约 37%。

7月31日周五
7月30日周四
  1. Google DeepMind69

    Google DeepMind 发布 Gemini Robotics ER 2 具身推理模型,新增视频理解与多机器人协作

    Google DeepMind 发布 Gemini Robotics ER 2,定位为机器人的高层具身推理大脑,可编排 VLA 模型、导航 API 等底层工具完成多步任务。

    推荐理由:官方发布详细列出了视频理解、进度追踪、多机协作的量化指标与获取入口,读者可据此评估机器人任务编排能力的变化。

7月29日周三
7月22日周三
7月15日周三
  1. Hugging Face Blog81

    Thinking Machines 发布万亿参数开源多模态模型 Inkling 及 Inkling-Small

    Thinking Machines 在 Hugging Face 发布开源多模态模型 Inkling,总参数 975B、激活 41B 的 MoE 架构,原生接受图像、文本和音频输入,支持 1M 上下文窗口,训练数据为 45 万亿 token。

    推荐理由:原文给出架构细节、各档位 VRAM 部署配置和多模态评测数据,对评估落地成本和选择变体有直接参考。

7月10日周五
7月2日周四
  1. Mistral AI62

    Mistral 发布 Apache-2.0 开源模型 Leanstral 1.5,6B 激活参数聚焦形式化证明

    Mistral 发布 Leanstral 1.5,Apache-2.0 许可,总参数 119B、激活 6B,主打 Lean 4 形式化证明工程。模型饱和 miniF2F,解出 587/672 PutnamBench 问题,在 FATE-H 达 87%、FATE-X 达 34%;经 mid-training、SFT 和 CISPO 强化学习三阶段训练。

    推荐理由:原文给出基准成绩、成本对比和真实代码验证案例,读者可以据此评估开源形式化推理模型的实用边界。

6月30日周二
6月27日周六
6月25日周四
6月17日周三
  1. Hugging Face Blog77

    智谱发布旗舰模型 GLM-5.2,主打 1M 上下文长时程任务

    智谱发布旗舰模型 GLM-5.2,面向长时程任务,首次在稳定的 1M-token 上下文上交付该能力,采用 MIT 开源协议。架构上提出 IndexShare,每 4 层稀疏注意力共享一个 indexer,1M 上下文下每 token FLOPs 降低 2.9 倍,并改进 MTP 层使投机解码接受长度最多提升 20%。

    推荐理由:官方技术报告给出 1M 上下文的架构改进和三项长时程基准对比,读者可以借此评估开源模型在真实编码场景的可用性。

6月11日周四
6月8日周一
  1. Google DeepMind62

    Google DeepMind 报告塞拉利昂 Guided Learning 试验:Gemini 辅助数学学习提升约 1.2 至 1.7 年学习进度

    Google DeepMind 发布在塞拉利昂开展的预注册 RCT 结果,使用 Guided Learning 的学生数学成绩较对照组提升 +0.258 个标准差,约合 1.2 至 1.7 年常规学习进度;教师将 Gemini 融入约半数课时(目标 12 小时)的班级提升更高,约 1.8 至 2.5 年。

    推荐理由:原文给出了预注册 RCT 的量化结果和交互数据,读者可以据此评估 AI 辅助教学在真实课堂中的效果与局限。

6月1日周一
5月20日周三
  1. Google Research70

    Google 发布 ERA 研究工具并推出 Computational Discovery,论文登上 Nature

    Google 发布基于 Gemini 的科学研究工具 ERA,可搜索文献、编写和用树搜索优化科学代码,在基因组学、公共卫生、卫星图像、神经科学、时间序列预测和数学等基准上达到专家级表现,论文发表于 Nature。

    推荐理由:原文给出 ERA 的树搜索方法、多领域基准结果和五篇应用论文细节,并说明新工具的开放入口,读者可了解它如何用于具体科学问题。

5月17日周日
5月16日周六
  1. Google DeepMind40

    Google DeepMind Co-Scientist 为衰老研究开辟新路径

    Google DeepMind 的 AI 工具 Co-Scientist 正被 Calico Life Sciences 用于衰老研究,帮助整合零散的生物学发现并生成可检验的假设。Calico 团队利用它提出了关于整合应激反应(ISR)如何受代谢调控的新假设,并借助它优化实验设计。相关实验带来对 ISR 在健康与疾病中作用的新发现,团队计划发表结果。