Google DeepMind 发布 Gemini 3.5,首发 3.5 Flash
Google DeepMind 发布 Gemini 3.5 模型系列,首个型号 3.5 Flash 当天全量开放,3.5 Pro 预计下月推出。
推荐理由:官方正文给出具体基准分数、速度对比和开放渠道,读者可据此评估 3.5 Flash 在智能体与编码场景的实用性。
Google 与 DeepMind 的 AI 动态:Gemini 系列、Veo 视频模型、研究成果与产品生态的持续追踪。
Google DeepMind 发布 Gemini 3.5 模型系列,首个型号 3.5 Flash 当天全量开放,3.5 Pro 预计下月推出。
推荐理由:官方正文给出具体基准分数、速度对比和开放渠道,读者可据此评估 3.5 Flash 在智能体与编码场景的实用性。
Google DeepMind 在 Nature 发表 Co-Scientist 研究,推出基于 Gemini 的多智能体 AI 系统,通过生成、辩论和进化假设迭代产生科研新假设,并通过 Hypothesis Generation 实验工具向个人研究者开放,未来几周开始推出,可在 labs.google/science 注册。
推荐理由:官方发布完整介绍了 Co-Scientist 的多智能体架构、验证机制和多所高校实验室的实际应用结果,还给出了个人研究者注册入口。
Google DeepMind 汇总 Gemini 驱动的编码智能体 AlphaEvolve 一年来的应用成果,并通过 Google Cloud 将其带给商业客户。
推荐理由:官方汇总了 AlphaEvolve 在医疗、电网、数学和商业客户中的具体成果数字,读者可以据此评估这类算法进化智能体的实际落地范围。
Google DeepMind 宣布 AI co-clinician 研究计划,探索在医生监督下辅助患者照护的 AI 智能体。在 98 个真实初级诊疗问题的盲评中 97 例零严重错误,在 RxQA 开放式用药问答上超越现有前沿模型;在 120 次远程医疗模拟会诊中,专家医生整体表现仍优于该系统,但在 140 项评估中有 68 项达到或超过初级保健医生水平,目前定位为辅助工具而非替代临床判断。
推荐理由:原文同时给出医生端与患者端的评估设计和结果,读者可以据此了解该系统当前的真实边界与局限。
Google Research 介绍自 9 月预印本发布 Empirical Research Assistance(ERA)以来,其科学家与学术合作者将其应用于真实科研的四个成果。
推荐理由:文章展示了 ERA 在疫情预测、宇宙学、气候遥感和神经回路四个真实科研场景的应用结果,可了解 LLM 辅助科研的具体形态。
Hugging Face 发布教程,指导开发者在 Manifest V3 约束下用 Transformers.js 在 Chrome 扩展中运行本地 AI,并复刻其 Gemma 4 Browser Assistant 架构。
推荐理由:作者基于自家 Gemma 4 浏览器扩展拆解 MV3 下运行 Transformers.js 的架构决策,给出可直接迁移的运行时划分与消息契约设计。
Google 宣布将一种新的照片视角重构方法作为 Google Photos Auto frame 功能上线,用 ML 模型估计 3D 点图和相机参数,再由生成式扩散模型补全新视角下未拍摄到的区域。方法分 3D 场景与相机估计、生成式修补两阶段,可自动矫正广角前摄的透视畸变,对含人物的合格照片提供一键重构视角的备选结果。
推荐理由:原文解释了将照片当作 3D 场景重建并重定位虚拟相机的两阶段方法,读者可以了解生成式修图与经典裁剪的区别。
Google DeepMind 推出文本转语音模型 Gemini 3.1 Flash TTS,在 Artificial Analysis TTS 排行榜获得 Elo 1,211 分,支持原生多说话人对话和 70+ 种语言。
推荐理由:官方发布新 TTS 模型,给出 Elo 分数、多说话人和音频标签等具体能力与开放入口,便于评估语音应用场景。
Google DeepMind 发布 Gemma 4 开源模型,基于 Gemini 3 技术,主打高级推理和智能体工作流。提供 E2B、E4B、26B MoE(推理时仅激活 3.8B 参数)和 31B Dense 四种尺寸,31B 在 Arena AI 文本排行榜上位列全球开源模型第 3,采用 Apache 2.0 许可,支持 128K-256K 上下文窗口、原生多模态和 140+ 语言。
推荐理由:原文给出了四个尺寸、基准排名和部署细节,读者可以据此判断在本地和端侧硬件上的可用性。
Google DeepMind 发布 Gemma 4 多模态模型系列,共五个尺寸(E2B、E4B、12B Unified、31B、26B A4B MoE),采用 Apache 2.0 许可,支持图像、文本和音频输入,上下文窗口最高 256K。
推荐理由:Hugging Face 官方详解 Gemma 4 架构、多模态能力与全生态部署方式,还覆盖 DiffusionGemma 和推理加速等上手细节。
Google DeepMind 发布由 Gemini 驱动的 AI 指针实验项目,提出维持心流、展示即告知、善用 this/that、把像素变成可操作实体四项交互原则,让用户通过指向和语音代替复杂提示词。
推荐理由:原文给出了AI指针的四项交互原则和落地场景,读者可以据此了解指向加语音如何替代复杂提示词。
Google DeepMind 发布实时语音模型 Gemini 3.1 Flash Live,称其为迄今最高质量的音频模型,延迟更低、对话更自然。在 ComplexFuncBench Audio 上得分 90.8%,在开启 thinking 的 Scale AI Audio MultiChallenge 上得分 36.1%,均领先前代模型。
推荐理由:官方给出两项音频基准分数和多产品开放入口,读者可以据此评估它对语音智能体开发的实际改进。
Google DeepMind 发布关于 AI 有害操纵的新研究,称建立了首个经实证验证的评估工具包,用于测量 AI 以负面和欺骗性方式改变人类思想与行为的能力,并公开运行人类被试研究所需的全部材料。
推荐理由:原文给出覆盖三国万余名参与者的实验设计和效能与倾向双维度框架,为理解和测量 AI 有害操纵风险提供了可复用的方法入口。
Google Research 联合多家 NHS 机构开展 AIMS 研究,在 Nature Cancer 发表两项研究评估 AI 乳腺癌检测系统。
推荐理由:两项 Nature Cancer 研究同时给出大规模独立性能数据和真实双读工作流对比,读者能看到 AI 替代第二阅片人的收益与人工仲裁推翻 AI 的具体代价。
Google Research 宣布在 Flood Hub 上推出城市山洪预报,利用新的 AI 方法可提前最多 24 小时预测城市山洪风险。该模型基于 Groundsource 方法,用 Gemini 分析公开新闻报道构建历史山洪事件数据集,并采用 LSTM 架构的 RNN 训练,仅依赖全球天气产品运行。
推荐理由:原文给出用 Gemini 从新闻构建训练数据并让南半球达到接近发达国家的预报精度,读者可了解 AI 预警如何弥合警告缺口。
Google 与 Beth Israel Deaconess Medical Center 合作完成 AMIE 的前瞻性单中心可行性研究,100 名成人患者在门诊就诊前与 AMIE 进行问诊对话,由医生实时监督,全程未触发任何安全中止。
推荐理由:原文给出真实门诊环境下的安全性、诊断与患者反馈数据,读者可以据此评估对话式医疗 AI 落地临床的现状与局限。
Google DeepMind 发布 Gemini 3.1 Flash-Lite,定位 Gemini 3 系列中最快、最具成本效益的模型,已在 Google AI Studio 和 Vertex AI 以 preview 形式推出。
推荐理由:官方公布定价与实测对比数据,开发者可据此评估高并发场景下换用该模型的速度与成本收益。
Google DeepMind 发布 Nano Banana 2(Gemini 3.1 Flash Image),以 Flash 速度提供 Pro 级世界知识、精准文本渲染、最多 5 个角色的主体一致性和 512px 到 4K 的生产级规格。
推荐理由:官方公告列出了能力细节、订阅者保留路径和各产品开放范围,读者可据此判断是否切换工作流。
Google DeepMind 发布 Gemini 3.1 Pro,在 ARC-AGI-2 上取得 77.1% 的 verified 成绩,推理表现是 3 Pro 的两倍以上。
推荐理由:官方公布 ARC-AGI-2 得分并覆盖消费端与开发者端入口,读者可以直接对照现有工作流评估升级。
Google DeepMind 在 Gemini 应用中以 beta 形式上线最新音乐生成模型 Lyria 3,用户输入文字或上传照片即可生成 30 秒带歌词曲目。
推荐理由:官方介绍了 Lyria 3 的三项能力改进和 SynthID 音频验证入口,读者可据此了解 Gemini 音乐生成与识别 AI 内容的新玩法。