Google 推出 Gemini for Science:面向科学发现的 AI 实验与工具
Google 发布 Gemini for Science,包含 Google Labs 上三个实验性工具和 Google Antigravity 中的 Science Skills。
Google 发布 Gemini for Science,包含 Google Labs 上三个实验性工具和 Google Antigravity 中的 Science Skills。
剑桥大学 Clare Bryant 教授使用 Google DeepMind 的 Co-Scientist 研究病原体跨物种传播(如禽流感和人流感)时引发脓毒症等重症的分子开关。
Google DeepMind 的 AI 工具 Co-Scientist 正被 Calico Life Sciences 用于衰老研究,帮助整合零散的生物学发现并生成可检验的假设。Calico 团队利用它提出了关于整合应激反应(ISR)如何受代谢调控的新假设,并借助它优化实验设计。相关实验带来对 ISR 在健康与疾病中作用的新发现,团队计划发表结果。
爱丁堡大学 Filippo Menolascina 团队使用 Co-Scientist 研究 MASH(代谢功能障碍相关脂肪性肝炎),梳理文献并筛选候选联合疗法。系统针对为何药物 resmetirom 只对部分患者有效这一问题,提出 NLRP3 炎性小体是连接炎症与代谢的分子桥梁的假设,该假设后来经实验验证,或可推动靶向双重疗法。
MIT 的 Ritu Raman 与波士顿儿童医院的 Ryan Flynn 借助 Google DeepMind 的 Co-Scientist 跨领域合作研究 ALS。Co-Scientist 帮助 Raman 快速梳理原本需数月的庞杂文献,生成可检验的假设并按可行性与风险收益排序。双方正据此寻找可靶向 ALS 的 RNA 新机制,乃至潜在的 RNA 药物。
Google DeepMind 发布 Gemini 3.5 模型系列,首个型号 3.5 Flash 当天全量开放,3.5 Pro 预计下月推出。
推荐理由:官方正文给出具体基准分数、速度对比和开放渠道,读者可据此评估 3.5 Flash 在智能体与编码场景的实用性。
Google DeepMind 在 Nature 发表 Co-Scientist 研究,推出基于 Gemini 的多智能体 AI 系统,通过生成、辩论和进化假设迭代产生科研新假设,并通过 Hypothesis Generation 实验工具向个人研究者开放,未来几周开始推出,可在 labs.google/science 注册。
推荐理由:官方发布完整介绍了 Co-Scientist 的多智能体架构、验证机制和多所高校实验室的实际应用结果,还给出了个人研究者注册入口。
Berkeley AI Research 发布对并行推理领域的综述分析,主张让模型自主决定何时分解任务、并行多少线程以及如何协调。文章指出串行推理 token 线性增长会导致上下文过载(context-rot)和长达数十分钟的延迟,并评述了 ParaThinker、GroupThink、Hogwild! Inference 等近期方法,指出现有方法的并行结构仍由外部固定设定,而非模型自适应决定。
Google Research 介绍自 9 月预印本发布 Empirical Research Assistance(ERA)以来,其科学家与学术合作者将其应用于真实科研的四个成果。
推荐理由:文章展示了 ERA 在疫情预测、宇宙学、气候遥感和神经回路四个真实科研场景的应用结果,可了解 LLM 辅助科研的具体形态。
IBM Granite 团队发布 Granite 4.1 系列 dense 模型,含 3B、8B、30B 三个规模,在约 15T tokens 上训练,上下文经长文本扩展达 512K,均以 Apache 2.0 许可开源。
推荐理由:原文完整披露了五阶段预训练、SFT 质控和四阶段 RL 的训练配方,8B 稠密模型对标上一代 32B-A9B MoE 的结果也可供选型参考。
Google DeepMind 与韩国科学技术信息通信部(MSIT)宣布建立合作伙伴关系,属于其 National Partnerships for AI 计划的一部分。
DeepSeek 发布 V4,在 Hub 上开源 DeepSeek-V4-Pro(1.6T 总参数 / 49B 激活)和 DeepSeek-V4-Flash(284B 总参数 / 13B 激活)两个 instruct 及对应 base 检查点,均支持 1M token 上下文。
推荐理由:文章拆解了 V4 为长上下文与 Agent 场景做的架构与后训练设计,读者可据此评估开源模型跑长任务的部署成本。
OpenAI 发布 GPT-5.5,面向编程、研究和数据分析等复杂任务,支持跨工具使用。
Google Research 推出 Simula,一个推理优先的合成数据生成框架,无需种子数据,将数据集构建分解为全局多样性、局部多样性、复杂化和质量检查四个可控维度。
OpenAI 发布前沿推理模型 GPT-Rosalind,专为加速药物研发、基因组学分析、蛋白质推理和科研工作流而构建。该模型面向生命科学研究场景,旨在提升相关科研工作的效率。
Google DeepMind 发布 Gemma 4 开源模型,基于 Gemini 3 技术,主打高级推理和智能体工作流。提供 E2B、E4B、26B MoE(推理时仅激活 3.8B 参数)和 31B Dense 四种尺寸,31B 在 Arena AI 文本排行榜上位列全球开源模型第 3,采用 Apache 2.0 许可,支持 128K-256K 上下文窗口、原生多模态和 140+ 语言。
推荐理由:原文给出了四个尺寸、基准排名和部署细节,读者可以据此判断在本地和端侧硬件上的可用性。
Google Research 推出 TurboQuant 压缩算法(将发表于 ICLR 2026),通过 PolarQuant 高质量压缩与仅 1 bit 的 QJL 零开销纠错两步,实现大幅模型压缩且零精度损失,同时支持 KV cache 压缩与向量搜索。
Google DeepMind 发布论文《Measuring Progress Toward AGI: A Cognitive Taxonomy》,基于心理学与认知科学研究提出包含感知、学习、推理、元认知等 10 项认知能力的分类框架,并给出对照人类基线的三阶段评估协议。
H Company 发布多模态计算机使用模型 Holotron-12B,基于 NVIDIA Nemotron-Nano-2 VL 后训练约 140 亿 token,已在 Hugging Face 以 NVIDIA Open Model License 开放。
Mistral 发布 Mistral Small 4,首次将 Magistral 的推理、Pixtral 的多模态和 Devstral 的编码能力统一到单一模型,采用 Apache 2.0 许可开源。
推荐理由:官方宣布 Small 家系统一推理、多模态与编码能力,并给出架构参数和推理效率对比,便于评估开源部署性价比。
Google Research 与 Cornell、Harvard 合作在 PNAS 发表论文,让 12 位高温超导专家出 67 道题并盲评 GPT-4o、Perplexity、Claude 3.5、Gemini Advanced Pro 1.5、NotebookLM 和自建 RAG 系统的回答。
Mistral 发布 Leanstral,称其为首个面向 Lean 4 的开源代码智能体,权重采用 Apache 2.0 许可证,提供 120B-A6B 稀疏架构(6B 激活参数),并集成于 Mistral Vibe 及免费 API 端点 labs-leanstral-2603。
Google 与 Beth Israel Deaconess Medical Center 合作完成 AMIE 的前瞻性单中心可行性研究,100 名成人患者在门诊就诊前与 AMIE 进行问诊对话,由医生实时监督,全程未触发任何安全中止。
推荐理由:原文给出真实门诊环境下的安全性、诊断与患者反馈数据,读者可以据此评估对话式医疗 AI 落地临床的现状与局限。
AlphaGo 击败围棋世界冠军十周年之际,Google DeepMind 回顾其影响:2016 年对弈李世石(Lee Sae Dol)时"第 37 手"成为 AI 标志性时刻,围棋盘上共有 10^170 种可能局面。
Hugging Face LeRobot 发布 v0.5.0,合并超过 200 个 PR、新增 50 多位贡献者。
推荐理由:官方完整发布说明覆盖硬件、策略、数据集和代码库四大方向,读者可据此评估升级对机器人训练与部署的实际影响。
OpenAI 推出 CoT-Control,发现推理模型难以控制自己的思维链(CoT)。这一局限使思维链保持可被监控的状态,强化了可监控性作为 AI 安全保障手段的价值。
OpenAI 发布 GPT-5.4,称其为面向专业工作最强、最高效的前沿模型。新模型在编码、计算机使用和工具搜索上达到 SOTA,并提供 1M-token 上下文窗口。
推荐理由:OpenAI 官方给出 GPT-5.4 的能力定位与 1M-token 上下文,可据此判断其在专业工作场景中的可用性。
Google Research 通过“Bayesian teaching”监督微调,让 LLM 模仿 Bayesian Assistant 的最优贝叶斯推理预测,弥补其默认简单启发式的不足。在简化航班推荐任务中,各系列 LLM 原本表现明显差于 Bayesian Assistant,且常在单轮交互后停滞;训练后不仅显著提升推荐任务表现,还能泛化到其他任务。
一篇新预印本论文将单负振幅扩展到引力子,借助 GPT-5.2 Pro 推导并验证了量子引力中非零的引力子树级振幅。该结果展示了 GPT-5.2 Pro 在理论物理推导与验证中的辅助作用。
Google DeepMind 发布 Gemini 3.1 Flash-Lite,定位 Gemini 3 系列中最快、最具成本效益的模型,已在 Google AI Studio 和 Vertex AI 以 preview 形式推出。
推荐理由:官方公布定价与实测对比数据,开发者可据此评估高并发场景下换用该模型的速度与成本收益。
OpenAI 分享其 AI 模型对 First Proof 数学挑战的证明尝试,在专家级数学问题上测试研究级推理能力。相关证明过程已公开,用于检验模型在研究级难题上的推理表现。
Google DeepMind 发布 Gemini 3.1 Pro,在 ARC-AGI-2 上取得 77.1% 的 verified 成绩,推理表现是 3 Pro 的两倍以上。
推荐理由:官方公布 ARC-AGI-2 得分并覆盖消费端与开发者端入口,读者可以直接对照现有工作流评估升级。
OpenAI 发布预印本,显示 GPT-5.2 提出了一个新的 gluon amplitude(胶子振幅)公式,该公式随后由 OpenAI 与学术合作者正式证明和验证。
推荐理由:模型提出的新物理公式经学术合作者证明与验证,可作为前沿模型科研能力的具体例证。
Google DeepMind 发布 Gemini 3 Deep Think 重大升级,面向科学、研究和工程挑战的专用推理模式。
推荐理由:原文给出 Deep Think 多项基准成绩和 API 开放入口,读者可以据此评估它在科研与工程场景的可用性。
Google DeepMind 发布两篇论文,介绍 Gemini Deep Think 在专家指导下解决数学、物理和计算机科学的专业研究问题。其数学研究智能体 Aletheia 配备自然语言验证器并可承认失败,在 IMO-ProofBench Advanced 上最高得分 90%,并自主解决 Bloom's Erdős 猜想数据库中的四个开放问题,包括 Erdős-1051。
推荐理由:原文给出两篇论文的具体成果和方法细节,读者可以了解 AI 辅助科研的实际边界与协作模式。
OpenAI 发布 GPT-5.3-Codex,称其为迄今最强的智能体编码模型。它结合了 GPT-5.2-Codex 的前沿编码能力与 GPT-5.2 的推理和专业知识能力。
Google Research 提出 Sequential Attention,一种用于特征选择等子集选择问题的贪心算法,利用注意力分数逐步选出最有价值的组件。它将选择过程集成到单次模型训练中,避免了传统贪心方法每步重新训练的高昂开销,以极小代价应用于大规模模型。该方法在多个神经网络基准上取得 SOTA 结果,并支持并行评估候选、提升可解释性。
Google Research 宣布与 Included Health 合作,待 IRB 批准后启动一项全国范围、经参与者知情同意的随机对照研究,在真实虚拟诊疗流程中评估其对话式 AI。研究基于 AMIE 诊断推理、个人健康智能体(PHA)和信息导航等前期工作,此前与 Beth Israel Deaconess Medical Center 的单中心可行性研究已观察到安全性方面的积极迹象。
Hugging Face 团队推出 Alyah(意为阿联酋方言中的"北极星"),一个评测阿拉伯语大模型阿联酋方言能力的基准,包含 1,173 个由母语者人工采集的多选题样本,覆盖问候语、诗歌、历史遗产和方言语言等类别。
Hugging Face 团队探索以 GPT-OSS(性能对标 OpenAI o3-mini 和 o4-mini)作为智能体应用骨干模型,用 verl 框架开展智能体强化学习训练。