OpenAI 推出 CoT-Control:推理模型难以控制自己的思维链,而这反而是好事
OpenAI 推出 CoT-Control,发现推理模型难以控制自己的思维链(CoT)。这一局限使思维链保持可被监控的状态,强化了可监控性作为 AI 安全保障手段的价值。
OpenAI 推出 CoT-Control,发现推理模型难以控制自己的思维链(CoT)。这一局限使思维链保持可被监控的状态,强化了可监控性作为 AI 安全保障手段的价值。
Google Research 通过“Bayesian teaching”监督微调,让 LLM 模仿 Bayesian Assistant 的最优贝叶斯推理预测,弥补其默认简单启发式的不足。在简化航班推荐任务中,各系列 LLM 原本表现明显差于 Bayesian Assistant,且常在单轮交互后停滞;训练后不仅显著提升推荐任务表现,还能泛化到其他任务。
IBM Research 与 UC Berkeley 将 MAST(多智能体系统失败分类法)应用于 ITBench,标注了 310 条由 Gemini-3-Flash、Kimi-K2 和 GPT-OSS-120B 产生的 SRE 执行轨迹,把成功率之外的黑盒失败转成结构化失败签名。
推荐理由:原文把基准的单一成功率拆解为结构化失败模式,并针对三类模型给出对应的工程修复方向。
OpenAI 与 Paradigm 联合推出 EVMbench,一个评估 AI 智能体能否检测、修补和利用高危智能合约漏洞的评测基准。该基准聚焦智能体在智能合约安全场景下的实际能力。
Google Research 发布 MapTrace,这是面向多模态大语言模型(MLLM)地图路径追踪任务的新任务、数据集与合成数据生成管线。
Google Research 在 ACM UIST 2025 上推出开源原型框架 DialogLab,用于编写、模拟和测试动态的人-AI 群组对话。框架通过“author-test-verify”三阶段工作流,将社交设置与对话时间推进解耦,提供拖放画布、human control 模式和可视化验证仪表盘。
Google Research 与 Google DeepMind 在 NeurIPS 2025 工作坊论文中展示,以鸟类等陆生动物声音训练的生物声学基础模型 Perch 2.0,虽未使用水下音频,仍能通过嵌入向量迁移学习对鲸类发声进行分类。
Google Research 提出 Sequential Attention,一种用于特征选择等子集选择问题的贪心算法,利用注意力分数逐步选出最有价值的组件。它将选择过程集成到单次模型训练中,避免了传统贪心方法每步重新训练的高昂开销,以极小代价应用于大规模模型。该方法在多个神经网络基准上取得 SOTA 结果,并支持并行评估候选、提升可解释性。
Google Research 发布论文《Towards a Science of Scaling Agent Systems》,通过 180 种智能体配置的受控评测,挑战了“智能体越多越好”的假设。
推荐理由:原文用 180 种配置给出多智能体系统何时有效何时退化的量化规律,为架构选择提供了可依据的任务属性判断方法。
Google Research 发布 ATLAS(Adaptive Transfer Scaling Laws),迄今最大规模公开多语言预训练研究,覆盖 774 次训练、10M–8B 参数模型、400+ 语言数据和 48 语言评测。
推荐理由:原文给出多语言训练的跨语言迁移矩阵和预训练与微调的token分界点,开发者可据此规划语言混合与算力预算。
Hugging Face 团队推出 Alyah(意为阿联酋方言中的"北极星"),一个评测阿拉伯语大模型阿联酋方言能力的基准,包含 1,173 个由母语者人工采集的多选题样本,覆盖问候语、诗歌、历史遗产和方言语言等类别。
Google Research 在 NeurIPS 2025 上提出 GIST(Greedy Independent Set Thresholding)算法,用于训练数据子集选择,兼顾数据多样性与效用。它将问题分解为一系列最大独立集近似问题,并首次为多样性-效用权衡提供可证明的强保证:所得子集的价值至少为最优解的一半。GIST 在图像分类等任务上超越现有 SOTA 基准。
Google Research 在 EMNLP 2025 发表的论文提出一种两阶段分解方法,让小型多模态 LLM 在设备端理解用户 UI 交互轨迹:先逐屏总结交互,再从总结序列提取意图。
Hugging Face 推出 AssetOpsBench,一个面向工业资产运维(如冷水机组、空气处理机组)的智能体评测基准,从异常检测、故障诊断、KPI 预测、工单摘要等任务评估智能体。
Google Research 展示搭载 TCN 架构多输出深度学习模型,仅凭 Pixel Watch 50 Hz IMU 信号和用户身高,即可直接估计步速、步长、双支撑时间、摆动/站立时间等时空步态指标。在 246 名参与者、约 70,000 个步行片段的验证中,多数指标 Pearson r>0.80、ICC>0.80,与手机方案性能相当,且无显著差异(p>0.05)。
Google Research 基于Android Auto的匿名数据验证了急刹车事件(HBE,减速超过 -3m/s²)与路段实际事故率呈显著正相关。分析加州和弗吉尼亚州 10 年事故数据发现,观测到 HBE 的路段数量是记录到事故的 18 倍;加州一条 HBE 率约为州均高速 70 倍的匝道路段位列全路段前 1%。
Berkeley AI Research 在 NeurIPS 2025 论文中提出一个基于信息含量的成像系统评估与优化框架,仅用噪声测量数据和噪声模型估计互信息。该指标在彩色摄影、射电天文、无透镜成像和显微成像四个领域预测解码器性能,优化后可匹配 SOTA 端到端方法,同时内存和计算量更低,且无需任务专属解码器设计。
Google Research 发布年度回顾,介绍 2025 年在 AI、量子计算与科学发现方面的研究进展。Gemini 3 成为其迄今最强、事实性最好的 LLM,在 SimpleQA Verified 与新发布的 FACTS 基准上达到 SOTA,并在 Gemini 3 中引入可动态生成交互界面的 generative UI;Gemma 多语言扩展至 140+ 种语言。
OpenAI 推出面向思维链(chain-of-thought)可监测性的新框架与评估套件,覆盖 13 项评估、24 个环境。研究结果显示,监测模型内部推理远比只监测输出更有效,为 AI 能力增强下的可扩展控制提供了有前景的路径。
OpenAI 推出 FrontierScience 基准,用于测试 AI 在物理、化学、生物学领域的推理能力,衡量其迈向真实科学研究水平的进展。
OpenAI 推出一个真实世界评测框架,衡量 AI 能否加速湿实验室中的生物研究。团队用 GPT-5 优化分子克隆实验方案,同时探讨了 AI 辅助实验的潜力与风险。
Google Research 在 COLM 2025 发表 Urania 框架,用差分隐私(DP)从 LLM 聊天机器人对话中提取洞察,提供数学化的端到端隐私保证。框架通过 DP 聚类、DP 关键词提取(三种方法生成关键词)和仅基于匿名关键词的 LLM 摘要生成,确保单条对话不影响输出。评测显示更强隐私设置会降低摘要粒度,但 LLM 评估者最多 70% 的情况更偏好该 DP 框架生成的摘要。
Google DeepMind 与 Kaggle 于 2025 年 12 月 9 日发布 FACTS Benchmark Suite,在原 FACTS Grounding 基础上新增 Parametric、Search 和 Multimodal 三个基准,共 3513 条公开样例,并保留私有评测集由 Kaggle 托管公开排行榜。
Google Research 在两篇新论文中推出 Titans 架构和 MIRAS 理论框架,将 RNN 的速度与 Transformer 的精度结合。Titans 用多层感知机作为神经长期记忆模块,通过“惊喜度量”(surprise metric)在运行时选择性存储意外信息,并辅以动量和自适应遗忘机制,实现无需离线重训练的测试时记忆。
Google Research 发布声音嵌入基准 MSEB,已在 NeurIPS 2025 上展示。该基准统一评估检索、推理、分类、转写、分割、聚类、重排序、重构 8 项听觉能力,核心数据集 SVQ 包含 177,352 条口语查询,覆盖 26 个地区和 17 种语言,已在 Hugging Face 开源。初始实验显示,现有声音表示远非通用,全部 8 项任务仍存在较大性能提升空间。
OpenAI 研究人员正在测试一种名为“忏悔(confessions)”的方法,训练模型主动承认自己的错误或不当行为,以提升 AI 的诚实性、透明度和模型输出的可信度。
密苏里大学研究人员结合冷冻电镜与 AlphaFold,解析了'坏胆固醇'LDL 核心蛋白 apoB100 的结构,该蛋白困扰科学界约 50 年。模型显示 apoB100 形成包裹 LDL 颗粒的笼状外壳和维持颗粒完整性的带状结构,为高胆固醇和动脉粥样硬化性心血管疾病(ASCVD)的预防、诊断与治疗提供新方向。
Google Research 发布一个轻量级线性回归模型,预测特定时间后电动车充电桩可用的概率。团队在加州和德国的真实充电网络数据上训练,以一天中各小时为特征,在 30 和 60 分钟预测窗口、100 座随机选取的站点上评估,表现优于"保持当前状态"基线。该简单模型依赖易获取的特征即可实现低延迟部署,有助于减少里程焦虑。
Hugging Face 的 Open ASR Leaderboard 新增多语言与长音频转写赛道,目前对比 18 个机构的 60 多个开源与闭源模型,覆盖 11 个数据集。
OpenAI 正在探索机制可解释性,以理解神经网络的推理方式。其新的稀疏模型方法有望让 AI 系统更透明,支持更安全、更可靠的行为。
Google Quantum AI 与 Stanford、MIT、Caltech 合作者在 Nature 论文中提出 Decoded Quantum Interferometry(DQI),利用量子干涉并结合解码算法,为某些优化问题寻找近似最优解。
Google DeepMind 在 Nature 发表论文,分析 AI 视觉模型组织视觉世界的方式与人类不同,并提出一种对齐方法。该方法基于预训练模型 SigLIP-SO400M 和包含数百万条人类“找出不同项”判断的 THINGS 数据集,训练教师模型后生成百万图像规模的新数据集 AligNet,再用其微调学生模型。对齐后的模型内部表征按类别清晰组织,鲁棒性和泛化能力得到提升。
Google Research 在 NeurIPS 2025 发表 Nested Learning 论文,将机器学习模型视为多层嵌套的优化问题,统一模型架构与优化算法两个层面。
推荐理由:原文提出把模型架构与优化算法统一为嵌套优化问题的新范式,并给出 Hope 架构的实验验证,对持续学习方向有方法层面的参考价值。
Google Research 推出 DS-STAR 数据科学智能体,通过数据文件分析模块、LLM 判官验证和顺序规划迭代三项创新,支持 JSON、非结构化文本等异构数据格式。
Google DeepMind 发布三项生物圈研究:与 World Resources Institute 合作建立基于 vision transformers 的森林砍伐风险预测模型,分辨率达 1km²、预测可细至 30 米,覆盖 2000-2024 年,并发布预测基准数据集。
Google Research 与 World Resources Institute 合作发布 ForestCast,一个基于纯卫星数据、用 vision transformers 预测森林砍伐风险的深度学习模型,准确度可持平或超过依赖道路等专用输入的现有方法。
Google 发布预印论文,提出 Project Suncatcher 计划,设想在晨昏太阳同步低地球轨道部署搭载 TPU、以自由空间光链路互联的太阳能卫星星座来扩展 AI 算力。
推荐理由:Google 官方给出太空 AI 算力设想的关键数据与验证进展,读者可据此了解星载 TPU、星间光链路与发射成本的具体可行性分析。
这篇 Berkeley AI Research 博客介绍一种基于分治而非 TD learning 的 off-policy RL 价值学习范式。
Google Research 在 UIST'25 上发布 StreetReaderAI,一个基于 Gemini 的无障碍街景概念验证原型,可为盲人和低视力用户提供实时 AI 场景描述与对话导航。
Google 发布 Google Earth AI 相关技术论文,介绍新的 Imagery 与 Population 基础模型,以及由 Gemini 驱动的 Geospatial Reasoning 智能体,用于多步地理空间问答。
推荐理由:官方同步放出技术论文和评测数字,读者可以据此了解跨模态地理空间推理的实际能力边界与应用案例。