跳到正文

#Google

今日 5 条
3月5日周四
  1. Google Research48

    Google Research:教 LLM 像贝叶斯派一样推理

    Google Research 通过“Bayesian teaching”监督微调,让 LLM 模仿 Bayesian Assistant 的最优贝叶斯推理预测,弥补其默认简单启发式的不足。在简化航班推荐任务中,各系列 LLM 原本表现明显差于 Bayesian Assistant,且常在单轮交互后停滞;训练后不仅显著提升推荐任务表现,还能泛化到其他任务。

3月4日周三
2月27日周五
2月20日周五
2月19日周四
2月18日周三
2月17日周二
2月13日周五
2月11日周三
2月10日周二
  1. Google DeepMind80

    Google DeepMind 发布两篇论文,展示 Gemini Deep Think 在数学与科学研究中的应用

    Google DeepMind 发布两篇论文,介绍 Gemini Deep Think 在专家指导下解决数学、物理和计算机科学的专业研究问题。其数学研究智能体 Aletheia 配备自然语言验证器并可承认失败,在 IMO-ProofBench Advanced 上最高得分 90%,并自主解决 Bloom's Erdős 猜想数据库中的四个开放问题,包括 Erdős-1051。

    推荐理由:原文给出两篇论文的具体成果和方法细节,读者可以了解 AI 辅助科研的实际边界与协作模式。

2月5日周四
2月4日周三
  1. Google Research39

    Google 提出 Sequential Attention:让 AI 模型更精简快速且不牺牲准确率

    Google Research 提出 Sequential Attention,一种用于特征选择等子集选择问题的贪心算法,利用注意力分数逐步选出最有价值的组件。它将选择过程集成到单次模型训练中,避免了传统贪心方法每步重新训练的高昂开销,以极小代价应用于大规模模型。该方法在多个神经网络基准上取得 SOTA 结果,并支持并行评估候选、提升可解释性。

  2. Google Research55

    Google Research 与 Included Health 合作开展全国范围医疗 AI 随机对照研究

    Google Research 宣布与 Included Health 合作,待 IRB 批准后启动一项全国范围、经参与者知情同意的随机对照研究,在真实虚拟诊疗流程中评估其对话式 AI。研究基于 AMIE 诊断推理、个人健康智能体(PHA)和信息导航等前期工作,此前与 Beth Israel Deaconess Medical Center 的单中心可行性研究已观察到安全性方面的积极迹象。

1月30日周五
1月28日周三
  1. Google Research68

    Google Research 发布 ATLAS 多语言模型缩放定律,将亮相 ICLR 2026

    Google Research 发布 ATLAS(Adaptive Transfer Scaling Laws),迄今最大规模公开多语言预训练研究,覆盖 774 次训练、10M–8B 参数模型、400+ 语言数据和 48 语言评测。

    推荐理由:原文给出多语言训练的跨语言迁移矩阵和预训练与微调的token分界点,开发者可据此规划语言混合与算力预算。

1月27日周二
1月24日周六
  1. Google Research39

    Google Research 推出 GIST:智能采样的下一阶段

    Google Research 在 NeurIPS 2025 上提出 GIST(Greedy Independent Set Thresholding)算法,用于训练数据子集选择,兼顾数据多样性与效用。它将问题分解为一系列最大独立集近似问题,并首次为多样性-效用权衡提供可证明的强保证:所得子集的价值至少为最优解的一半。GIST 在图像分类等任务上超越现有 SOTA 基准。

1月23日周五
1月16日周五
  1. Google Research43

    Google Research 用智能手表估计高级步行指标

    Google Research 展示搭载 TCN 架构多输出深度学习模型,仅凭 Pixel Watch 50 Hz IMU 信号和用户身高,即可直接估计步速、步长、双支撑时间、摆动/站立时间等时空步态指标。在 246 名参与者、约 70,000 个步行片段的验证中,多数指标 Pearson r>0.80、ICC>0.80,与手机方案性能相当,且无显著差异(p>0.05)。

1月14日周三
1月13日周二
12月24日周三
12月19日周五
12月17日周三
12月16日周二
  1. Google Research63

    Google 在 STOC 2026 试点 Gemini Paper Assistant Tool 为理论计算机科学论文提供投稿前自动反馈

    Google Research 在 STOC 2026 试点 Paper Assistant Tool(PAT),基于 Gemini 2.5 Deep Think 在提交后 24 小时内为理论计算机科学论文提供自动反馈。PAT 识别出计算错误、不等式误用和证明逻辑漏洞等问题,97% 的受访作者认为反馈有用并愿意再次使用,88% 希望在整个研究过程中持续使用;工具定位是辅助而非替代同行评审。

    推荐理由:官方报告了 STOC 2026 投稿试点中的实测数据与作者反馈,读者可据此了解 AI 辅助审稿在理论数学写作中的实际表现。

12月13日周六
  1. Google DeepMind66

    Google DeepMind 发布升级版 Gemini 2.5 Flash Native Audio,推出实时语音翻译

    Google DeepMind 发布面向实时语音 Agent 的更新版 Gemini 2.5 Flash Native Audio,提升函数调用、指令遵循与多轮对话能力,在 ComplexFuncBench Audio 上得分 71.5%,开发者指令遵循率从 84% 升至 90%。

    推荐理由:官方给出了函数调用、指令遵循的具体提升数据和落地入口,读者可以据此评估现有语音 Agent 是否值得升级。

12月12日周五
12月11日周四
  1. Google DeepMind39

    Google DeepMind 深化与英国 AI Security Institute 的合作

    Google DeepMind 与英国 AI Security Institute(AISI)签署新谅解备忘录,将合作从模型测试扩展到更基础的安全研究。双方将共享专有模型与数据、联合发布报告,重点研究方向包括监测 AI 的链式推理(CoT)过程、研究社会情感对齐问题,以及通过模拟任务评估 AI 对经济系统的长期影响。

  2. Google Research36

    Google 发布 Urania:面向 AI 聊天机器人使用洞察的差分隐私框架

    Google Research 在 COLM 2025 发表 Urania 框架,用差分隐私(DP)从 LLM 聊天机器人对话中提取洞察,提供数学化的端到端隐私保证。框架通过 DP 聚类、DP 关键词提取(三种方法生成关键词)和仅基于匿名关键词的 LLM 摘要生成,确保单条对话不影响输出。评测显示更强隐私设置会降低摘要粒度,但 LLM 评估者最多 70% 的情况更偏好该 DP 框架生成的摘要。

12月10日周三
12月9日周二
12月5日周五
  1. Google Research47

    Google Research 发布 Titans 架构与 MIRAS 框架,让 AI 拥有长期记忆

    Google Research 在两篇新论文中推出 Titans 架构和 MIRAS 理论框架,将 RNN 的速度与 Transformer 的精度结合。Titans 用多层感知机作为神经长期记忆模块,通过“惊喜度量”(surprise metric)在运行时选择性存储意外信息,并辅以动量和自适应遗忘机制,实现无需离线重训练的测试时记忆。

12月4日周四
  1. Google Research37

    Google 发布 Massive Sound Embedding Benchmark(MSEB):面向听觉智能的新基准

    Google Research 发布声音嵌入基准 MSEB,已在 NeurIPS 2025 上展示。该基准统一评估检索、推理、分类、转写、分割、聚类、重排序、重构 8 项听觉能力,核心数据集 SVQ 包含 177,352 条口语查询,覆盖 26 个地区和 17 种语言,已在 Hugging Face 开源。初始实验显示,现有声音表示远非通用,全部 8 项任务仍存在较大性能提升空间。

11月26日周三
  1. Google DeepMind47

    AlphaFold 五年影响力回顾

    AlphaFold 2 于 2020 年在 CASP14 比赛中高精度解决蛋白质结构预测难题,五年间推动全球生物科学发现,并于 2024 年获诺贝尔化学奖。其免费的 AlphaFold Protein Database 已被 190 多个国家超过 300 万研究者使用,相关研究被引用超 35,000 篇论文。