Google DeepMind 发布 Gemini 4 Argon,输出上限扩至 1M tokens
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络防御者开放,后续面向开发者、企业和消费者推出。
推荐理由:官方公布的能力、价格与安全机制信息完整,读者可以据此判断 Gemini 4 Argon 在编码、知识工作和网防上的实际变化。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络防御者开放,后续面向开发者、企业和消费者推出。
推荐理由:官方公布的能力、价格与安全机制信息完整,读者可以据此判断 Gemini 4 Argon 在编码、知识工作和网防上的实际变化。
Google DeepMind 推出 SynthID Bio,将水印技术引入合成生物学,在保持蛋白质生物功能的同时嵌入可验证签名。
推荐理由:原文给出水印嵌入方式与湿实验结果,读者可以了解在蛋白质设计层建立生物安全验证机制的可复用思路。
Google Research 提出 Diffusion Controller 框架,将去噪生成过程重构为连续控制问题,用轻量级“转向阻尼”网络在冻结基础模型的情况下引导生成方向。
Google Research 发布 AI 视频 Co-Director 研究,在 Gemini 与 Veo 之上构建统一多智能体框架,通过全局优化与世界状态追踪生成连贯的分钟级多镜头视频。
Google DeepMind 推出 Gemini 3.8 Live with Live Avatar,将低延迟流式视频与原生实时对话结合,让模型具备唇形同步、自然表情和流畅轮次切换的动态视觉形象。
NVIDIA 与 Google DeepMind、EMBL-EBI 等机构合作,通过 AlphaFold Database 开放发布超过 2,800 种病毒蛋白复合物的预测 3D 结构。
Google Private AI Compute 团队宣布为其平台增加私密的服务端持久 AI 记忆能力。用户数据保存在云端加密存储中,解密密钥仅存于个人设备,模型在硬件隔离的 secure enclave 中临时解密处理后再加密,连 Google 也无法访问。配套措施包括更新技术白皮书、防篡改的公开软件记录及第三方网络安全公司独立审计结果。
Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持用自然语言提示词在 100 多种语言和方言中定制角色声音,可从 30 秒音频样本复刻声音,并提供 2000 多个现成声音。
推荐理由:官方介绍了两款 TTS 模型的定制能力、基准成绩和开放渠道,开发者可以据此评估语音生成方案的选型。
Google Research 推出 MilleMiglia,一个用 C++ 编写的实例生成器,可为中英里(middle-mile)物流网络生成贴近现实且保护隐私的基准数据,源代码与文档已在 GitHub 开放。
Google Research 推出一项研究实验,让教师利用生成式 UI(GenUI)动态创建定制化、有引导的教育模拟互动内容。团队已发布 30 多个面向初高中 STEM 学科的英文学习互动示例,全部由 AI 生成并经教师审核。使用 Google Workspace for Education 的学校可通过 Google for Education Pilot Program 报名提供反馈。
Emerald AI、Google 与 NVIDIA 宣布成立 AI Energy Management Alliance(AEMA),推动数据中心根据电网状况动态调节用电,使 AI 基础设施与电网协同。
Google Research 提出 Retrieve-for-Train 框架,通过离线强化学习发现符合奖励的 query fan-out 并编译为监督信号,绕过推理时的思考 token 开销。
Google DeepMind 于 2026 年 9 月 15 日发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking 两款语音对话模型。
推荐理由:官方公布了两个语音模型的能力定位、多项基准成绩和可用入口,读者可以据此评估是否接入自己的语音应用。
Google Research 在 ACL 2026 提出 ToolGrad,先生成真实工具调用链再标注用户查询的“answer-first”范式,替代传统 DFS 探索式数据生成,通过 propose、execute、select、update 四个模块迭代构建 API 工作流。
Google DeepMind 发布 AlphaGenome Atlas 平台,收录人类基因组约 90 亿个单核苷酸变体的分子效应预测,数据集达 1 PB,超过 AlphaFold 数据库 30 倍以上。
推荐理由:平台把 90 亿个单核苷酸变体的预测免费开放,配合 AVI 评分与案例结果,研究者在排序罕见病变体时可省去大量实验验证。
Google Research 评估了将 UK Biobank 欧洲人群 GWAS 训练的多基因风险评分(PRS)迁移到 Biobank Japan 近 20 万日本人群样本的效果,涵盖 BMI、血压、HDL、LDL、血糖等 8 个临床性状。
Google 与 HHMI Janelia、MRC 分子生物学实验室及剑桥大学等合作,在 Cell 发表雄性果蝇大脑和中央神经系统完整连接组,包含超过 166,000 个神经元和 1.25 亿个突触连接,是迄今按神经元数量计最大的脑图谱。
推荐理由:原文给出雄性果蝇全脑连接组的规模、验证方式和开源查看工具,也说明雌雄对照可用于研究性行为与个体差异。
Google DeepMind 与 Google Research 发布 WeatherNext 3,据 Brightband 独立实时评测为其迄今最先进、最准确的全球天气 AI 模型。
推荐理由:官方原文给出分辨率、更新频率与降水精度等具体指标,读者可据此评估其对天气预报和清洁能源场景的实际改变。
Google DeepMind 推出 Fairwind 计划,向政府机构和受信任的合作伙伴开放先进的网络防御能力。该计划将 Gemini 3.8 Flash Cyber 模型与 CodeMender 结合,可自主查找、验证并修复漏洞,在几分钟内生成就绪的补丁,初始访问面向政府、关键基础设施运营商和核心技术平台。
Google DeepMind 发布 Gemini 3.8 Flash 和 3.8 Flash Cyber,称其为迄今最佳推理与编码模型,定价与 3.7 Flash 相同(每百万输入 token $0.75、输出 $3.75)。
推荐理由:官方公布了两个变体的基准数字、定价和 Cyber 版的申请入口,读者可据此评估升级成本与实际收益。
Google 与 NASA JPL 在 PNAS 发表 MAPL-EMIT,一个基于 Swin-S 视觉 transformer 的框架,可自动检测、量化和定位 EMIT 高光谱数据中的甲烷羽流。
Google DeepMind 发布 agentic video understanding,覆盖 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite。
推荐理由:官方说明动态检索视频相比固定帧率处理的效率与精度变化,并给出 API 开启方式,适合评估长视频分析成本的开发者。
Google Research 发布时间序列基础模型 TimesFM-3,参数量 3.3 亿,预训练语料超过 1 万亿时间点,原生支持零样本多变量预测。模型可同时预测多个目标序列,支持过去协变量与过去-未来协变量,通过交替注意力与 Contiguous Patch Masking 在单次前向传播中完成整段预测,每步输出第 10 到第 90 百分位共 9 个分位数。
Google 在 Earth AI 计划下推出实验性研究能力行星预测引擎(PPE),可从自然语言查询出发自主完成数据发现、清洗、特征工程、模型训练与评估。
Google DeepMind 发布 Gemini Omni 1.1 Flash,通过 Gemini API 和 Google AI Studio 面向开发者提供更可控的生成视频能力。
推荐理由:官方发布了能力细节和 API 用法,开发者可以据此评估它在视频生成工作流中的可控性和成本。
Google DeepMind 推出针对专有前沿模型的首个双盲评测,将外部评测限制在密码学安全的“盒子”环境中,防止模型提前看到测试题导致基准污染。此次与 Singapore AI Safety Institute、OpenMined、AVERI 和 MLCommons 合作,对一个 Gemini Flash Lite 模型在隐私保护环境下测试机密基准。
Google Research 推出 GlucoFM,一个面向连续血糖监测(CGM)数据的自监督基础模型,采用双流编码器将慢速血糖趋势与短期偏差分离,并以潜在预测目标学习日上下文与时间演化。
Google DeepMind 推出 Gemini 3.5 Transcribe,定位为更精确的智能语音转写模型,能清除填充词、自动排版、支持自定义词表和 85 种以上语言。
推荐理由:官方发布文给出模型的能力细节、两项 API 入口和与 Chirp 3 的 WER 与延迟对比,开发者可据此评估语音转写方案选型。
Google 在 CHI 2026 发表研究原型 AgentHands,为 XR 中的 AI 智能体生成与语音同步的手势,使对话具备空间 grounding。系统通过眼动注视与场景重建注册物体 3D 边界框,由后端 LLM 在回复中内嵌 GestureEvents,并在头显端用词级时间戳与 TTS 同步播放动画。
Google DeepMind 梳理了自 2010 年成立以来以游戏驱动的 AI 研究历程:DQN 从原始像素学会 49 款 Atari 2600 游戏,AlphaGo 于 2016 年击败李世石,AlphaZero 通用化至国际象棋、将棋和围棋,MuZero 无需规则即可学习,AlphaStar 在 2019 年达到 StarCraft II 宗师级。
Google Research 推出 Mobility-Embedded POIs(ME-POIs)框架,将匿名聚合的移动模式与文本嵌入融合,帮助语言模型捕捉地点的时间活动节奏。
Google Research 推出研究性深度学习框架 PhotoScan,从标准 2D 手机照片估算体脂率、A/G 比和 V/S 比等身体成分指标。
Google DeepMind 发布 Gemini 3.7 Flash,定位为其最智能的编码与智能体主力模型,距 Gemini 3.6 Flash 发布仅三周。
推荐理由:官方给出了具体基准对比和减半的引入价,读者可以据此评估 Flash 系列在编码和智能体场景的性价比变化。
Google DeepMind 发布多语言手语转文本(SL2T)翻译模型,首次将手语 AI 带入消费产品,支持在 Pixel 11 的 Gboard 和 Live Transcribe 中以美式手语(ASL)输入英文。
推荐理由:原文介绍了 SL2T 的训练数据、隐私设计与基准成绩,并说明其落地产品形态,读者可以了解手语翻译模型的可行路径。
Google Research 提出 knowledge profiling 行为框架和 WikiProfile 基准(2,150 条 Wikipedia 事实,各配 10 个任务),评估 13 个 LLM 约 450 万条回复。
推荐理由:Google 用知识画像框架把事实错误拆成编码与召回两类,指出前沿模型瓶颈在召回,并量化 thinking 的恢复作用。
Google Research 发布 AMIE (Video),基于 Gemini 和 Project Astra 的实时视频问诊系统,采用 Talker、Planner、Perception 三个智能体并行工作的异步多智能体架构。
推荐理由:原文给出研究架构、随机对照规模和关键结果,读者可以了解视频问诊 AI 与真人医生对比的具体依据和局限。
Google DeepMind 在 Nature 发表论文并开源 WeatherNext 2 和 WeatherNext Cyclones 模型,单一 AI 模型即可预测气旋路径、强度和风结构,平均多出超过 24 小时的预报提前量,相当于过去 20 年趋势下约十年的气象进步。
推荐理由:Google DeepMind 官方发布并开源了模型权重,读者可以结合 Nature 论文数据评估其对气旋预报工作流的实际改进。
Google Research 提出 Chain-of-Evidence(CoE)可验证性框架,并发布原生维护证据链的自主科研原型 Science One Framework,配套 CoE Audit 自动审计指标。
Google DeepMind 发布 Gemini Robotics ER 2,定位为机器人的高层具身推理大脑,可编排 VLA 模型、导航 API 等底层工具完成多步任务。
推荐理由:官方发布详细列出了视频理解、进度追踪、多机协作的量化指标与获取入口,读者可据此评估机器人任务编排能力的变化。
Google DeepMind 发布最新音乐生成模型 Lyria 3.5,已在 Google Flow Music 中开放使用。该模型在音乐性上带来更丰富自然的旋律结构,歌词生成质量和提示词遵循度提升,人声更具表现力且发音更准确,并支持更方便地控制输出节奏和时长。