Google DeepMind 发布 Gemini 3 Deep Think 重大升级,HLE 48.4%、ARC-AGI-2 84.6%
Google DeepMind 发布 Gemini 3 Deep Think 重大升级,面向科学、研究和工程挑战的专用推理模式。
推荐理由:原文给出 Deep Think 多项基准成绩和 API 开放入口,读者可以据此评估它在科研与工程场景的可用性。
Google 与 DeepMind 的 AI 动态:Gemini 系列、Veo 视频模型、研究成果与产品生态的持续追踪。
Google DeepMind 发布 Gemini 3 Deep Think 重大升级,面向科学、研究和工程挑战的专用推理模式。
推荐理由:原文给出 Deep Think 多项基准成绩和 API 开放入口,读者可以据此评估它在科研与工程场景的可用性。
Google DeepMind 发布两篇论文,介绍 Gemini Deep Think 在专家指导下解决数学、物理和计算机科学的专业研究问题。其数学研究智能体 Aletheia 配备自然语言验证器并可承认失败,在 IMO-ProofBench Advanced 上最高得分 90%,并自主解决 Bloom's Erdős 猜想数据库中的四个开放问题,包括 Erdős-1051。
推荐理由:原文给出两篇论文的具体成果和方法细节,读者可以了解 AI 辅助科研的实际边界与协作模式。
Google DeepMind 推出实验原型 Project Genie,即日起向美国 18 岁以上的 Google AI Ultra 订阅用户开放。
推荐理由:原文给出了 Project Genie 的三项核心能力、底层模型和明确的限制清单,读者可以据此判断世界模型的当前可用边界。
Google Research 发布论文《Towards a Science of Scaling Agent Systems》,通过 180 种智能体配置的受控评测,挑战了“智能体越多越好”的假设。
推荐理由:原文用 180 种配置给出多智能体系统何时有效何时退化的量化规律,为架构选择提供了可依据的任务属性判断方法。
Google Research 发布 ATLAS(Adaptive Transfer Scaling Laws),迄今最大规模公开多语言预训练研究,覆盖 774 次训练、10M–8B 参数模型、400+ 语言数据和 48 语言评测。
推荐理由:原文给出多语言训练的跨语言迁移矩阵和预训练与微调的token分界点,开发者可据此规划语言混合与算力预算。
Google DeepMind 发布 Gemini 3 Flash,将 Gemini 3 Pro 级推理能力与 Flash 级速度和成本结合。
推荐理由:官方给出关键基准分数、价格和开放渠道,读者可以据此比较它与大模型在速度成本上的取舍。
Google Research 在 STOC 2026 试点 Paper Assistant Tool(PAT),基于 Gemini 2.5 Deep Think 在提交后 24 小时内为理论计算机科学论文提供自动反馈。PAT 识别出计算错误、不等式误用和证明逻辑漏洞等问题,97% 的受访作者认为反馈有用并愿意再次使用,88% 希望在整个研究过程中持续使用;工具定位是辅助而非替代同行评审。
推荐理由:官方报告了 STOC 2026 投稿试点中的实测数据与作者反馈,读者可据此了解 AI 辅助审稿在理论数学写作中的实际表现。
Google DeepMind 发布面向实时语音 Agent 的更新版 Gemini 2.5 Flash Native Audio,提升函数调用、指令遵循与多轮对话能力,在 ComplexFuncBench Audio 上得分 71.5%,开发者指令遵循率从 84% 升至 90%。
推荐理由:官方给出了函数调用、指令遵循的具体提升数据和落地入口,读者可以据此评估现有语音 Agent 是否值得升级。
Google DeepMind 宣布在 Gemini app 中支持验证图片是否由 Google AI 生成或编辑,基于 SynthID 数字水印技术,用户上传图片询问即可检测。
推荐理由:原文说明了 Gemini app 内用 SynthID 验证 AI 图片的具体用法,以及后续扩展到视频音频和 C2PA 的计划。
Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image),基于 Gemini 3 Pro 的高保真图像生成与编辑模型,已开始在 Google AI Studio 和 Vertex AI 面向付费预览推出。
推荐理由:官方发布文给出了模型能力细节、2K/4K 分辨率、接入渠道和定价定位,开发者可据此评估是否切换或叠加使用。
Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image),基于 Gemini 3 Pro 的新一代图像生成与编辑模型。
推荐理由:官方发布新图像模型,列出文本渲染、多语言、4K 分辨率等具体能力变化和各产品入口,读者可以对照评估使用方式。
Google 描述一个端到端语音到语音翻译(S2ST)模型,将传统级联方案 4–5 秒的延迟降至 2 秒,并以原说话人音色直接输出翻译音频。
推荐理由:原文给出了模型架构、延迟数据与部署位置,读者可以了解端到端语音翻译与级联方案的差异及落地方式。
Google DeepMind 发布 Gemini 3,称 Gemini 3 Pro 为其最智能模型,在各大基准上超越此前的 2.5 Pro。
推荐理由:官方发布给出了 Gemini 3 Pro 的基准成绩、API 定价和新工具入口,开发者可以直接评估是否迁移到现有编码与智能体工作流。
Google DeepMind 发布 Gemini 3,先以 Gemini 3 Pro 预览版形式推出,并预告增强推理模式 Gemini 3 Deep Think。
推荐理由:官方发布给出完整基准成绩和覆盖入口,读者可据此判断 Gemini 3 Pro 的推理与编码能力以及它如何嵌入现有工具链。
Google DeepMind 推出智能体开发平台 Google Antigravity,包含 AI IDE 式 Editor 界面和面向异步协作的 Manager 界面,支持智能体自主规划并执行端到端软件任务。
推荐理由:官方宣布了 Antigravity 的产品形态、免费预览和可用模型,读者可据此评估它对现有开发流程的影响。
Google 发布生成式 UI 实现,可按提示词动态生成网页、游戏、工具等定制交互界面,相关论文为 Generative UI: LLMs are Effective UI Generators。
推荐理由:原文介绍了生成式 UI 的实现原理、产品入口和人评结果,读者可以了解这一交互范式如何落地到现有产品。
Google DeepMind 与 Google Research 发布 WeatherNext 2 天气预报模型,生成预报速度快 8 倍,分辨率最高达 1 小时。
推荐理由:Google DeepMind 官方介绍了 WeatherNext 2 的技术细节、性能对比数据和开放获取渠道,读者可以据此评估其在天气预报场景的可用性。
Google DeepMind 发布 SIMA 2,将 Gemini 模型嵌入智能体核心,使其从跟随指令进化为能思考目标、与用户对话并自我改进的通用游戏智能体。
推荐理由:官方介绍 SIMA 2 如何借 Gemini 从执行指令走向推理与自改进,读者可了解具身智能体训练路径。
Google Research 在 NeurIPS 2025 发表 Nested Learning 论文,将机器学习模型视为多层嵌套的优化问题,统一模型架构与优化算法两个层面。
推荐理由:原文提出把模型架构与优化算法统一为嵌套优化问题的新范式,并给出 Hope 架构的实验验证,对持续学习方向有方法层面的参考价值。
Google 发布预印论文,提出 Project Suncatcher 计划,设想在晨昏太阳同步低地球轨道部署搭载 TPU、以自由空间光链路互联的太阳能卫星星座来扩展 AI 算力。
推荐理由:Google 官方给出太空 AI 算力设想的关键数据与验证进展,读者可据此了解星载 TPU、星间光链路与发射成本的具体可行性分析。