Google DeepMind 推出 SynthID Bio,为 AI 生成的蛋白质添加可验证水印
Google DeepMind 推出 SynthID Bio,将水印技术引入合成生物学,在保持蛋白质生物功能的同时嵌入可验证签名。
推荐理由:原文给出水印嵌入方式与湿实验结果,读者可以了解在蛋白质设计层建立生物安全验证机制的可复用思路。
Google DeepMind 推出 SynthID Bio,将水印技术引入合成生物学,在保持蛋白质生物功能的同时嵌入可验证签名。
推荐理由:原文给出水印嵌入方式与湿实验结果,读者可以了解在蛋白质设计层建立生物安全验证机制的可复用思路。
Google Research 提出 Diffusion Controller 框架,将去噪生成过程重构为连续控制问题,用轻量级“转向阻尼”网络在冻结基础模型的情况下引导生成方向。
Hugging Face 论文提出 ProvenanceGuard,一个针对 MCP 智能体的生成后验证层,专门检测「跨来源混淆」——事实存在但被归因到错误来源的回答,且无需重新训练 Agent,流程含声明分解、来源路由、支持性校验、归因比对与 RARR 式修复。
Google Research 发布 AI 视频 Co-Director 研究,在 Gemini 与 Veo 之上构建统一多智能体框架,通过全局优化与世界状态追踪生成连贯的分钟级多镜头视频。
Microsoft Research 的研究挑战了机器人 AI 推理必须完全依赖机载 GPU 的假设,显示卸载到边缘或云端 GPU 可提升任务成功率、响应速度和精度。
Microsoft Research 的逆合成模型 RetroChimera 发表于 Nature,结合 Transformer 架构的 R-SMILES 2 与基于 GNN 的 NeuralLoc 两个子模型,用 learning-to-rank 集成策略生成合成路线。
Google Research 推出 MilleMiglia,一个用 C++ 编写的实例生成器,可为中英里(middle-mile)物流网络生成贴近现实且保护隐私的基准数据,源代码与文档已在 GitHub 开放。
Google Research 提出 Retrieve-for-Train 框架,通过离线强化学习发现符合奖励的 query fan-out 并编译为监督信号,绕过推理时的思考 token 开销。
Google Research 在 ACL 2026 提出 ToolGrad,先生成真实工具调用链再标注用户查询的“answer-first”范式,替代传统 DFS 探索式数据生成,通过 propose、execute、select、update 四个模块迭代构建 API 工作流。
Google Research 评估了将 UK Biobank 欧洲人群 GWAS 训练的多基因风险评分(PRS)迁移到 Biobank Japan 近 20 万日本人群样本的效果,涵盖 BMI、血压、HDL、LDL、血糖等 8 个临床性状。
Google 与 HHMI Janelia、MRC 分子生物学实验室及剑桥大学等合作,在 Cell 发表雄性果蝇大脑和中央神经系统完整连接组,包含超过 166,000 个神经元和 1.25 亿个突触连接,是迄今按神经元数量计最大的脑图谱。
推荐理由:原文给出雄性果蝇全脑连接组的规模、验证方式和开源查看工具,也说明雌雄对照可用于研究性行为与个体差异。
H Company 发布 NeoMME 系列 260M 和 800M 多语言多模态编码器,用单个双向 Transformer 处理文本和 32×32 图像 patch,从零以掩码离散扩散目标训练,无需独立视觉塔或因果语言模型。
Hugging Face 推出 BenchMIRT,一种基于多维 IRT 的方法,用于在题目层面审计 LLM 基准的真实测量内容。该方法基于 100 个 LLM、16 个基准和超过 34K 道题的结果训练,未事先标注即独立恢复出安全与通用推理两个维度。分析发现 BBQ 和 WMDP 得分与通用推理的关联强于安全,HarmBench 的版权类题目也更偏向通用推理。
Google 与 NASA JPL 在 PNAS 发表 MAPL-EMIT,一个基于 Swin-S 视觉 transformer 的框架,可自动检测、量化和定位 EMIT 高光谱数据中的甲烷羽流。
Google 在 Earth AI 计划下推出实验性研究能力行星预测引擎(PPE),可从自然语言查询出发自主完成数据发现、清洗、特征工程、模型训练与评估。
Google DeepMind 推出针对专有前沿模型的首个双盲评测,将外部评测限制在密码学安全的“盒子”环境中,防止模型提前看到测试题导致基准污染。此次与 Singapore AI Safety Institute、OpenMined、AVERI 和 MLCommons 合作,对一个 Gemini Flash Lite 模型在隐私保护环境下测试机密基准。
Google 在 CHI 2026 发表研究原型 AgentHands,为 XR 中的 AI 智能体生成与语音同步的手势,使对话具备空间 grounding。系统通过眼动注视与场景重建注册物体 3D 边界框,由后端 LLM 在回复中内嵌 GestureEvents,并在头显端用词级时间戳与 TTS 同步播放动画。
Multiverse Computing 发布 Quantization-Aware Healing(QAH)方法,将 GPT-OSS 120B 压缩到 60B 参数并量化为 MXFP4 后,模型在 9 项基准中的 7 项超过其 bfloat16 全精度版本,AA-LCR 提升 7.4 分、AIME 2025 提升 5.6 分。
Google Research 推出 Biomarker Discovery Framework,一个在人类监督下以迭代研究循环优先排序候选生物标志物的多智能体系统。
Google Research 推出 Mobility-Embedded POIs(ME-POIs)框架,将匿名聚合的移动模式与文本嵌入融合,帮助语言模型捕捉地点的时间活动节奏。
Hugging Face 发布新研究,用三项探针测试量化 ASR 模型的基准优化(benchmaxxing)现象。评估 11 个开源模型发现,多个高分模型会复现 VoxPopuli 和 LibriSpeech 的错误参考转录,甚至在相关词被静音时恢复被删除的数字,或按基准期望切换拼写变体;部分模型还能借助声学线索识别测试集。
推荐理由:研究用三种探针量化了 ASR 模型对公开基准的过拟合,并给出选用模型与设计基准的具体建议。
IBM Research 在 Hugging Face 博客发布 ALTK-Evolve 研究,在 AppWorld 上测试八种模型后提出智能体记忆应按模型能力校准注入剂量,而非全量累积。
Google Research 推出研究性深度学习框架 PhotoScan,从标准 2D 手机照片估算体脂率、A/G 比和 V/S 比等身体成分指标。
Microsoft Research 推出 MindTopo 基准,评估多模态大模型在连通性、包围、顺序、分离与绳结五类拓扑概念上的推理与规划能力。测试显示,各类专有和开源模型在静态推理上明显优于交互式规划任务,且均远低于人类水平,错误多出现在多步规划中丢失结构关系或提出违反物理约束的动作。该基准可为机器人和交互环境中需要保持拓扑结构的智能体研究提供诊断工具。
Google Research 提出 knowledge profiling 行为框架和 WikiProfile 基准(2,150 条 Wikipedia 事实,各配 10 个任务),评估 13 个 LLM 约 450 万条回复。
推荐理由:Google 用知识画像框架把事实错误拆成编码与召回两类,指出前沿模型瓶颈在召回,并量化 thinking 的恢复作用。
Google Research 发布 AMIE (Video),基于 Gemini 和 Project Astra 的实时视频问诊系统,采用 Talker、Planner、Perception 三个智能体并行工作的异步多智能体架构。
推荐理由:原文给出研究架构、随机对照规模和关键结果,读者可以了解视频问诊 AI 与真人医生对比的具体依据和局限。
Hugging Face 论文提出两项系统改动来降低 LLM 知识蒸馏成本:离线缓存 teacher 的 top-100 logits,以及将输出投影融合进损失的 fused chunked KL loss,避免构建全词表 × 序列长度矩阵。
Google DeepMind 在 Nature 发表论文并开源 WeatherNext 2 和 WeatherNext Cyclones 模型,单一 AI 模型即可预测气旋路径、强度和风结构,平均多出超过 24 小时的预报提前量,相当于过去 20 年趋势下约十年的气象进步。
推荐理由:Google DeepMind 官方发布并开源了模型权重,读者可以结合 Nature 论文数据评估其对气旋预报工作流的实际改进。
Google Research 提出 Chain-of-Evidence(CoE)可验证性框架,并发布原生维护证据链的自主科研原型 Science One Framework,配套 CoE Audit 自动审计指标。
UC Berkeley BAIR 团队提出 ABBEL 框架,用自然语言信念状态替代完整交互历史作为 LLM 智能体的工作上下文,并通过 belief grading 监督摘要内容。
Google Research 发布 SymptomAI 研究论文,在 n=13,917 的随机化全国性研究中让参与者与五种 Gemini Flash 2.0 症状评估智能体对话,生成鉴别诊断(DDx)。
推荐理由:原文给出随机化万人规模研究中 SymptomAI 与真实临床医生 DDx 的对比结果,以及可穿戴生理数据的相关性分析,读者可据此评估对话式症状评估的现状。
Google Research 在 Nature 发表《Reinforcement learning control of quantum error correction》,展示一个强化学习框架,让智能体利用量子纠错的检测事件在计算过程中持续调整数千个控制参数,无需中断计算来重新校准。
DharmaOCR 在巴西葡萄牙语 OCR 基准上以 0.925 的得分领先新发布的 Mistral OCR4(0.798)和 Unlimited-OCR(0.7587),分别高出约 13 分和 16 分以上。
Google Research 在 ICLR 2026 发表的论文《On the Interpolation Effect of Score Smoothing in Diffusion Models》指出,扩散模型的“创造力”源于神经网络训练对 score function 的平滑效应。
Google Research 提出 SensorFM,一种大型传感器基础模型,基于 500 万名参与者、超过一万亿分钟的多模态可穿戴数据自监督预训练。
Google Research 在《Nature Cities》发表首个大规模真实世界研究,通过修改 Google Maps 路由算法,在美国 10 个大城市引导不到 2% 的行程绕开拥堵路段。结果显示目标路段行驶速度中位数提升约 2%,油耗率下降 0.5%–1.0%,每城每年可减少数千吨 CO2e 排放,且导航用户与非用户均受益。
Hugging Face 推出开源基准 ScarfBench,用 Spring、Jakarta EE、Quarkus 间的迁移任务评测 AI 智能体,包含 34 个应用、102 个框架实现、204 个迁移任务、约 151K 行代码和 1,331 个专家编写测试。
Google Research 将建筑级屋顶反照率数据扩展至 9 个国家的 50 多座城市,包括伦敦、里约热内卢和纽约,并通过新的高分辨率 Heat Resilience Earth Engine App 开放访问。
Hugging Face 团队提出 DiScoFormer,单个 Transformer 模型经一次前向传播即可同时估计任意数据集分布的密度和 score,无需针对新分布重训练。
Google Research 在 CIDR 发表 linear elastic caching,将缓存页淘汰建模为 ski rental 问题,用轻量级机器学习动态调整缓存大小以最小化 TCO。