Google Research:教 LLM 像贝叶斯派一样推理
Google Research 通过“Bayesian teaching”监督微调,让 LLM 模仿 Bayesian Assistant 的最优贝叶斯推理预测,弥补其默认简单启发式的不足。在简化航班推荐任务中,各系列 LLM 原本表现明显差于 Bayesian Assistant,且常在单轮交互后停滞;训练后不仅显著提升推荐任务表现,还能泛化到其他任务。
Google Research 通过“Bayesian teaching”监督微调,让 LLM 模仿 Bayesian Assistant 的最优贝叶斯推理预测,弥补其默认简单启发式的不足。在简化航班推荐任务中,各系列 LLM 原本表现明显差于 Bayesian Assistant,且常在单轮交互后停滞;训练后不仅显著提升推荐任务表现,还能泛化到其他任务。
Google DeepMind 发布 Gemini 3.1 Flash-Lite,定位 Gemini 3 系列中最快、最具成本效益的模型,已在 Google AI Studio 和 Vertex AI 以 preview 形式推出。
推荐理由:官方公布定价与实测对比数据,开发者可据此评估高并发场景下换用该模型的速度与成本收益。
Google DeepMind 发布 Nano Banana 2(Gemini 3.1 Flash Image),以 Flash 速度提供 Pro 级世界知识、精准文本渲染、最多 5 个角色的主体一致性和 512px 到 4K 的生产级规格。
推荐理由:官方公告列出了能力细节、订阅者保留路径和各产品开放范围,读者可据此判断是否切换工作流。
Google DeepMind 发布 Gemini 3.1 Pro,在 ARC-AGI-2 上取得 77.1% 的 verified 成绩,推理表现是 3 Pro 的两倍以上。
推荐理由:官方公布 ARC-AGI-2 得分并覆盖消费端与开发者端入口,读者可以直接对照现有工作流评估升级。
Google DeepMind 在 Gemini 应用中以 beta 形式上线最新音乐生成模型 Lyria 3,用户输入文字或上传照片即可生成 30 秒带歌词曲目。
推荐理由:官方介绍了 Lyria 3 的三项能力改进和 SynthID 音频验证入口,读者可据此了解 Gemini 音乐生成与识别 AI 内容的新玩法。
Google Research 发布 MapTrace,这是面向多模态大语言模型(MLLM)地图路径追踪任务的新任务、数据集与合成数据生成管线。
Google DeepMind 与印度政府机构和本地机构建立新的 National Partnerships for AI 合作,向印度研究人员开放 AlphaGenome、AI Co-scientist、Earth AI 等前沿 AI for Science 模型。
Google DeepMind 发布 Gemini 3 Deep Think 重大升级,面向科学、研究和工程挑战的专用推理模式。
推荐理由:原文给出 Deep Think 多项基准成绩和 API 开放入口,读者可以据此评估它在科研与工程场景的可用性。
Google Research 在 ACM UIST 2025 上推出开源原型框架 DialogLab,用于编写、模拟和测试动态的人-AI 群组对话。框架通过“author-test-verify”三阶段工作流,将社交设置与对话时间推进解耦,提供拖放画布、human control 模式和可视化验证仪表盘。
Google Research 与 Google DeepMind 在 NeurIPS 2025 工作坊论文中展示,以鸟类等陆生动物声音训练的生物声学基础模型 Perch 2.0,虽未使用水下音频,仍能通过嵌入向量迁移学习对鲸类发声进行分类。
Google DeepMind 发布两篇论文,介绍 Gemini Deep Think 在专家指导下解决数学、物理和计算机科学的专业研究问题。其数学研究智能体 Aletheia 配备自然语言验证器并可承认失败,在 IMO-ProofBench Advanced 上最高得分 90%,并自主解决 Bloom's Erdős 猜想数据库中的四个开放问题,包括 Erdős-1051。
推荐理由:原文给出两篇论文的具体成果和方法细节,读者可以了解 AI 辅助科研的实际边界与协作模式。
Google 提出原生自适应界面(NAI)框架,用多模态 AI 让应用 UI 从静态导航转向智能体驱动的动态模块,服务全球 13 亿残障人士。
Google Research 提出 Sequential Attention,一种用于特征选择等子集选择问题的贪心算法,利用注意力分数逐步选出最有价值的组件。它将选择过程集成到单次模型训练中,避免了传统贪心方法每步重新训练的高昂开销,以极小代价应用于大规模模型。该方法在多个神经网络基准上取得 SOTA 结果,并支持并行评估候选、提升可解释性。
Google Research 宣布与 Included Health 合作,待 IRB 批准后启动一项全国范围、经参与者知情同意的随机对照研究,在真实虚拟诊疗流程中评估其对话式 AI。研究基于 AMIE 诊断推理、个人健康智能体(PHA)和信息导航等前期工作,此前与 Beth Israel Deaconess Medical Center 的单中心可行性研究已观察到安全性方面的积极迹象。
Google DeepMind 推出实验原型 Project Genie,即日起向美国 18 岁以上的 Google AI Ultra 订阅用户开放。
推荐理由:原文给出了 Project Genie 的三项核心能力、底层模型和明确的限制清单,读者可以据此判断世界模型的当前可用边界。
Google Research 发布论文《Towards a Science of Scaling Agent Systems》,通过 180 种智能体配置的受控评测,挑战了“智能体越多越好”的假设。
推荐理由:原文用 180 种配置给出多智能体系统何时有效何时退化的量化规律,为架构选择提供了可依据的任务属性判断方法。
Google Research 发布 ATLAS(Adaptive Transfer Scaling Laws),迄今最大规模公开多语言预训练研究,覆盖 774 次训练、10M–8B 参数模型、400+ 语言数据和 48 语言评测。
推荐理由:原文给出多语言训练的跨语言迁移矩阵和预训练与微调的token分界点,开发者可据此规划语言混合与算力预算。
Hugging Face 团队推出 Alyah(意为阿联酋方言中的"北极星"),一个评测阿拉伯语大模型阿联酋方言能力的基准,包含 1,173 个由母语者人工采集的多选题样本,覆盖问候语、诗歌、历史遗产和方言语言等类别。
Google Research 在 NeurIPS 2025 上提出 GIST(Greedy Independent Set Thresholding)算法,用于训练数据子集选择,兼顾数据多样性与效用。它将问题分解为一系列最大独立集近似问题,并首次为多样性-效用权衡提供可证明的强保证:所得子集的价值至少为最优解的一半。GIST 在图像分类等任务上超越现有 SOTA 基准。
Google Research 在 EMNLP 2025 发表的论文提出一种两阶段分解方法,让小型多模态 LLM 在设备端理解用户 UI 交互轨迹:先逐屏总结交互,再从总结序列提取意图。
Google DeepMind 发布 D4RT(Dynamic 4D Reconstruction and Tracking),用统一的 encoder-decoder Transformer 框架从普通视频重建动态 3D 场景并追踪时空运动。
Google Research 展示搭载 TCN 架构多输出深度学习模型,仅凭 Pixel Watch 50 Hz IMU 信号和用户身高,即可直接估计步速、步长、双支撑时间、摆动/站立时间等时空步态指标。在 246 名参与者、约 70,000 个步行片段的验证中,多数指标 Pearson r>0.80、ICC>0.80,与手机方案性能相当,且无显著差异(p>0.05)。
Google Research 基于Android Auto的匿名数据验证了急刹车事件(HBE,减速超过 -3m/s²)与路段实际事故率呈显著正相关。分析加州和弗吉尼亚州 10 年事故数据发现,观测到 HBE 的路段数量是记录到事故的 18 倍;加州一条 HBE 率约为州均高速 70 倍的匝道路段位列全路段前 1%。
Google DeepMind 更新 Veo 3.1 Ingredients to Video,提升基于参考图生成视频的表现力、角色身份一致性和背景与对象一致性。
Google 发布在 Science Advances 的论文,介绍 NeuralGCM 通过直接在 2001 至 2018 年 NASA 卫星降水观测上训练,改进全球降水模拟能力。
Google 回顾 2025 年在 Google、Google DeepMind 和 Google Research 取得的研究进展:3 月发布 Gemini 2.5。
Google Research 发布年度回顾,介绍 2025 年在 AI、量子计算与科学发现方面的研究进展。Gemini 3 成为其迄今最强、事实性最好的 LLM,在 SimpleQA Verified 与新发布的 FACTS 基准上达到 SOTA,并在 Gemini 3 中引入可动态生成交互界面的 generative UI;Gemma 多语言扩展至 140+ 种语言。
Google DeepMind 发布 Gemini 3 Flash,将 Gemini 3 Pro 级推理能力与 Flash 级速度和成本结合。
推荐理由:官方给出关键基准分数、价格和开放渠道,读者可以据此比较它与大模型在速度成本上的取舍。
Google DeepMind 发布开源可解释性工具套件 Gemma Scope 2,覆盖 Gemma 3 从 270M 到 27B 的全部模型尺寸,结合稀疏自编码器(SAE)与 transcoder 分析模型内部行为。
Google Research 在 STOC 2026 试点 Paper Assistant Tool(PAT),基于 Gemini 2.5 Deep Think 在提交后 24 小时内为理论计算机科学论文提供自动反馈。PAT 识别出计算错误、不等式误用和证明逻辑漏洞等问题,97% 的受访作者认为反馈有用并愿意再次使用,88% 希望在整个研究过程中持续使用;工具定位是辅助而非替代同行评审。
推荐理由:官方报告了 STOC 2026 投稿试点中的实测数据与作者反馈,读者可据此了解 AI 辅助审稿在理论数学写作中的实际表现。
Google DeepMind 发布面向实时语音 Agent 的更新版 Gemini 2.5 Flash Native Audio,提升函数调用、指令遵循与多轮对话能力,在 ComplexFuncBench Audio 上得分 71.5%,开发者指令遵循率从 84% 升至 90%。
推荐理由:官方给出了函数调用、指令遵循的具体提升数据和落地入口,读者可以据此评估现有语音 Agent 是否值得升级。
Google 联合 SisonkeBiotik、Ro'ya 和 DS-I Africa 举办全非健康数据科学 Ideathon,参赛团队基于 Google 开源健康模型 MedGemma、TxGemma 和 MedSigLIP 解决现实健康挑战,从 30 多份提交中选出六支决赛队伍。
Google DeepMind 与英国 AI Security Institute(AISI)签署新谅解备忘录,将合作从模型测试扩展到更基础的安全研究。双方将共享专有模型与数据、联合发布报告,重点研究方向包括监测 AI 的链式推理(CoT)过程、研究社会情感对齐问题,以及通过模拟任务评估 AI 对经济系统的长期影响。
Google Research 在 COLM 2025 发表 Urania 框架,用差分隐私(DP)从 LLM 聊天机器人对话中提取洞察,提供数学化的端到端隐私保证。框架通过 DP 聚类、DP 关键词提取(三种方法生成关键词)和仅基于匿名关键词的 LLM 摘要生成,确保单条对话不影响输出。评测显示更强隐私设置会降低摘要粒度,但 LLM 评估者最多 70% 的情况更偏好该 DP 框架生成的摘要。
Google DeepMind 于 2025 年 12 月 10 日宣布深化与英国政府的合作,涵盖科学发现、教育、公共服务现代化与国家安全。
Google DeepMind 与 Kaggle 于 2025 年 12 月 9 日发布 FACTS Benchmark Suite,在原 FACTS Grounding 基础上新增 Parametric、Search 和 Multimodal 三个基准,共 3513 条公开样例,并保留私有评测集由 Kaggle 托管公开排行榜。
Google Research 在两篇新论文中推出 Titans 架构和 MIRAS 理论框架,将 RNN 的速度与 Transformer 的精度结合。Titans 用多层感知机作为神经长期记忆模块,通过“惊喜度量”(surprise metric)在运行时选择性存储意外信息,并辅以动量和自适应遗忘机制,实现无需离线重训练的测试时记忆。
Google DeepMind 介绍 Michigan State University 的 Berkley Walker 团队利用 AlphaFold 预测光合作用关键酶 glycerate kinase(GLYK)的 3D 结构。
Google Research 发布声音嵌入基准 MSEB,已在 NeurIPS 2025 上展示。该基准统一评估检索、推理、分类、转写、分割、聚类、重排序、重构 8 项听觉能力,核心数据集 SVQ 包含 177,352 条口语查询,覆盖 26 个地区和 17 种语言,已在 Hugging Face 开源。初始实验显示,现有声音表示远非通用,全部 8 项任务仍存在较大性能提升空间。
AlphaFold 2 于 2020 年在 CASP14 比赛中高精度解决蛋白质结构预测难题,五年间推动全球生物科学发现,并于 2024 年获诺贝尔化学奖。其免费的 AlphaFold Protein Database 已被 190 多个国家超过 300 万研究者使用,相关研究被引用超 35,000 篇论文。