跳到正文

推理能力

模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。

最新精选

第 1–20 条 · 共 56 条
10月1日周四
  1. Latent Space77

    Google DeepMind 发布 Gemini 4 Argon,输出上限达 1M token

    Google DeepMind 发布 Gemini 4 Argon,面向编码、企业知识工作与网络防御,宣称在 19 项基准中的 13 项排名第一,输出上限从 64K 提升至 1M(通过 Long Decode Continuation 实现)。

    推荐理由:汇总了 Gemini 4 Argon 的基准成绩、定价与获取限制,并保留独立评测和质疑声音,读者可据此平衡官方宣传。

9月8日周二
  1. Google DeepMind72

    Google DeepMind 发布 AlphaGenome Atlas 覆盖人类基因组全部 90 亿单碱基变体预测

    Google DeepMind 发布 AlphaGenome Atlas 平台,收录人类基因组约 90 亿个单核苷酸变体的分子效应预测,数据集达 1 PB,超过 AlphaFold 数据库 30 倍以上。

    推荐理由:平台把 90 亿个单核苷酸变体的预测免费开放,配合 AVI 评分与案例结果,研究者在排序罕见病变体时可省去大量实验验证。

9月3日周四
8月25日周二
8月21日周五
  1. Hugging Face Blog66

    Liquid AI 发布 LFM2.5-DSpark 草稿模型,推理最高提速 3.2x

    Liquid AI 为 LFM2.5 系列三个模型(LFM2.5-1.2B-Instruct、LFM2.5-2.6B、LFM2.5-8B-A1B)发布 DSpark 草稿模型检查点,采用投机解码在不改变输出质量的前提下大幅加速解码。

    推荐理由:官方给出 DSpark 草稿模型的具体加速数据、质量等价原理和 llama.cpp 与 SGLang 的用法,端侧部署可直接迁移。

8月12日周三
7月30日周四
  1. Google DeepMind69

    Google DeepMind 发布 Gemini Robotics ER 2 具身推理模型,新增视频理解与多机器人协作

    Google DeepMind 发布 Gemini Robotics ER 2,定位为机器人的高层具身推理大脑,可编排 VLA 模型、导航 API 等底层工具完成多步任务。

    推荐理由:官方发布详细列出了视频理解、进度追踪、多机协作的量化指标与获取入口,读者可据此评估机器人任务编排能力的变化。

7月15日周三
  1. Hugging Face Blog81

    Thinking Machines 发布万亿参数开源多模态模型 Inkling 及 Inkling-Small

    Thinking Machines 在 Hugging Face 发布开源多模态模型 Inkling,总参数 975B、激活 41B 的 MoE 架构,原生接受图像、文本和音频输入,支持 1M 上下文窗口,训练数据为 45 万亿 token。

    推荐理由:原文给出架构细节、各档位 VRAM 部署配置和多模态评测数据,对评估落地成本和选择变体有直接参考。

7月2日周四
  1. Mistral AI62

    Mistral 发布 Apache-2.0 开源模型 Leanstral 1.5,6B 激活参数聚焦形式化证明

    Mistral 发布 Leanstral 1.5,Apache-2.0 许可,总参数 119B、激活 6B,主打 Lean 4 形式化证明工程。模型饱和 miniF2F,解出 587/672 PutnamBench 问题,在 FATE-H 达 87%、FATE-X 达 34%;经 mid-training、SFT 和 CISPO 强化学习三阶段训练。

    推荐理由:原文给出基准成绩、成本对比和真实代码验证案例,读者可以据此评估开源形式化推理模型的实用边界。

6月17日周三
  1. Hugging Face Blog77

    智谱发布旗舰模型 GLM-5.2,主打 1M 上下文长时程任务

    智谱发布旗舰模型 GLM-5.2,面向长时程任务,首次在稳定的 1M-token 上下文上交付该能力,采用 MIT 开源协议。架构上提出 IndexShare,每 4 层稀疏注意力共享一个 indexer,1M 上下文下每 token FLOPs 降低 2.9 倍,并改进 MTP 层使投机解码接受长度最多提升 20%。

    推荐理由:官方技术报告给出 1M 上下文的架构改进和三项长时程基准对比,读者可以借此评估开源模型在真实编码场景的可用性。

6月11日周四
6月8日周一
  1. Google DeepMind62

    Google DeepMind 报告塞拉利昂 Guided Learning 试验:Gemini 辅助数学学习提升约 1.2 至 1.7 年学习进度

    Google DeepMind 发布在塞拉利昂开展的预注册 RCT 结果,使用 Guided Learning 的学生数学成绩较对照组提升 +0.258 个标准差,约合 1.2 至 1.7 年常规学习进度;教师将 Gemini 融入约半数课时(目标 12 小时)的班级提升更高,约 1.8 至 2.5 年。

    推荐理由:原文给出了预注册 RCT 的量化结果和交互数据,读者可以据此评估 AI 辅助教学在真实课堂中的效果与局限。

5月20日周三
  1. Google Research70

    Google 发布 ERA 研究工具并推出 Computational Discovery,论文登上 Nature

    Google 发布基于 Gemini 的科学研究工具 ERA,可搜索文献、编写和用树搜索优化科学代码,在基因组学、公共卫生、卫星图像、神经科学、时间序列预测和数学等基准上达到专家级表现,论文发表于 Nature。

    推荐理由:原文给出 ERA 的树搜索方法、多领域基准结果和五篇应用论文细节,并说明新工具的开放入口,读者可了解它如何用于具体科学问题。

5月16日周六
5月12日周二
  1. Google DeepMind64

    Google DeepMind 发布多智能体科研系统 Co-Scientist 并向个人研究者开放

    Google DeepMind 在 Nature 发表 Co-Scientist 研究,推出基于 Gemini 的多智能体 AI 系统,通过生成、辩论和进化假设迭代产生科研新假设,并通过 Hypothesis Generation 实验工具向个人研究者开放,未来几周开始推出,可在 labs.google/science 注册。

    推荐理由:官方发布完整介绍了 Co-Scientist 的多智能体架构、验证机制和多所高校实验室的实际应用结果,还给出了个人研究者注册入口。

4月30日周四
  1. Google Research62

    Google Research 展示科学家使用 Empirical Research Assistance 的四个科研方向

    Google Research 介绍自 9 月预印本发布 Empirical Research Assistance(ERA)以来,其科学家与学术合作者将其应用于真实科研的四个成果。

    推荐理由:文章展示了 ERA 在疫情预测、宇宙学、气候遥感和神经回路四个真实科研场景的应用结果,可了解 LLM 辅助科研的具体形态。