Google DeepMind 试点全球首个双盲 AI 模型评测
Google DeepMind 推出针对专有前沿模型的首个双盲评测,将外部评测限制在密码学安全的“盒子”环境中,防止模型提前看到测试题导致基准污染。此次与 Singapore AI Safety Institute、OpenMined、AVERI 和 MLCommons 合作,对一个 Gemini Flash Lite 模型在隐私保护环境下测试机密基准。
Google DeepMind 推出针对专有前沿模型的首个双盲评测,将外部评测限制在密码学安全的“盒子”环境中,防止模型提前看到测试题导致基准污染。此次与 Singapore AI Safety Institute、OpenMined、AVERI 和 MLCommons 合作,对一个 Gemini Flash Lite 模型在隐私保护环境下测试机密基准。
Google Research 推出 GlucoFM,一个面向连续血糖监测(CGM)数据的自监督基础模型,采用双流编码器将慢速血糖趋势与短期偏差分离,并以潜在预测目标学习日上下文与时间演化。
Google DeepMind 推出 Gemini 3.5 Transcribe,定位为更精确的智能语音转写模型,能清除填充词、自动排版、支持自定义词表和 85 种以上语言。
推荐理由:官方发布文给出模型的能力细节、两项 API 入口和与 Chirp 3 的 WER 与延迟对比,开发者可据此评估语音转写方案选型。
OpenAI 发布新报告,探讨学生和教育者如何使用 ChatGPT 让学习更连续,获得课堂之外的支持。报告聚焦 AI 辅助学习如何延伸到课堂之外,帮助学习者随时随地持续学习。
OpenAI 公布了 Hugging Face 安全事件的调查发现,并介绍了加强 AI 模型安全、监控与对齐的相关措施。该事件及其后续加固步骤的细节由 OpenAI 官方披露。
Sentence Transformers v6.0 引入第四种模型类型 MultiVectorEncoder,支持 ColBERT 式后期交互检索及完整训练流程。
推荐理由:作者实测比较了六种训练起点和各训练超参,给出可在单张消费级 GPU 上数小时完成的完整多向量模型微调配方。
Google 在 CHI 2026 发表研究原型 AgentHands,为 XR 中的 AI 智能体生成与语音同步的手势,使对话具备空间 grounding。系统通过眼动注视与场景重建注册物体 3D 边界框,由后端 LLM 在回复中内嵌 GestureEvents,并在头显端用词级时间戳与 TTS 同步播放动画。
IBM 发布 Granite 4.2 推理模型家族,含 3B、8B、30B 三个稠密模型,以 Apache 2.0 许可开源。
推荐理由:IBM 官方公开 Granite 4.2 从预训练到多阶段 RL 的完整训练细节,读者可以借此了解推理模型的可复现构建路径。
Multiverse Computing 发布 Quantization-Aware Healing(QAH)方法,将 GPT-OSS 120B 压缩到 60B 参数并量化为 MXFP4 后,模型在 9 项基准中的 7 项超过其 bfloat16 全精度版本,AA-LCR 提升 7.4 分、AIME 2025 提升 5.6 分。
Hugging Face 在 Gradio 中推出 gr.Workflow,把 AI 应用的多步骤流水线描述为类型化节点图,并提供可拖拽画布,每个节点可运行、中间结果可见。
推荐理由:原文来自官方,给出 gr.Workflow 的节点图机制、多个可复制的在线示例和 REST API 用法,读者可以直接上手复用这套搭建 AI 流水线的方法。
OpenAI 推出面向 ChatGPT Work 和 Codex 的 Admin 插件。管理员可用它分析工作区使用情况、管理成员和权限、调整限额,并处理管理员请求。
Mistral 与 HUMAIN 宣布建立战略合作,在沙特阿拉伯及中东地区推进主权 AI,合作规模达数亿欧元,覆盖 AI 基础设施、先进模型开发与 AI 方案部署。双方将开发并本地化先进模型,初期聚焦网络安全与语音,并计划打造阿拉伯语表现优异的前沿模型。两家公司还将探索利用 HUMAIN 数据中心基础设施满足当地算力需求,并在沙特面向受监管行业制定联合市场策略。
METR 研究发现 AI 在网络安全领域带来重大加速、对数学研究是小幅加速,而对 AI 研究本身优化无可测加速。华盛顿大学、斯坦福等多校团队发布 SPADE 框架,通过自博弈共同进化环境生成与智能体能力,在 Qwen3-30B-A3B 上使游戏环境套件平均分达 58.3,较基座高 +8.1。
GPT‑5.6 现已在 Kiro 中可用,帮助开发者更高效地规划、构建、审查和测试软件,并提供更好的价格性能比。
Google Research 推出 Biomarker Discovery Framework,一个在人类监督下以迭代研究循环优先排序候选生物标志物的多智能体系统。
Google DeepMind 梳理了自 2010 年成立以来以游戏驱动的 AI 研究历程:DQN 从原始像素学会 49 款 Atari 2600 游戏,AlphaGo 于 2016 年击败李世石,AlphaZero 通用化至国际象棋、将棋和围棋,MuZero 无需规则即可学习,AlphaStar 在 2019 年达到 StarCraft II 宗师级。
Google Research 推出 Mobility-Embedded POIs(ME-POIs)框架,将匿名聚合的移动模式与文本嵌入融合,帮助语言模型捕捉地点的时间活动节奏。
Hugging Face 发布新研究,用三项探针测试量化 ASR 模型的基准优化(benchmaxxing)现象。评估 11 个开源模型发现,多个高分模型会复现 VoxPopuli 和 LibriSpeech 的错误参考转录,甚至在相关词被静音时恢复被删除的数字,或按基准期望切换拼写变体;部分模型还能借助声学线索识别测试集。
推荐理由:研究用三种探针量化了 ASR 模型对公开基准的过拟合,并给出选用模型与设计基准的具体建议。
Hugging Face 团队详解 Papers with Code 混合搜索架构:PostgreSQL 全文检索加 pgvector 语义召回,经加权 RRF 融合,语义向量用 Qwen/Qwen3-Embedding-0.6B 生成 256 维 Matryoshka 截断向量。
Liquid AI 为 LFM2.5 系列三个模型(LFM2.5-1.2B-Instruct、LFM2.5-2.6B、LFM2.5-8B-A1B)发布 DSpark 草稿模型检查点,采用投机解码在不改变输出质量的前提下大幅加速解码。
推荐理由:官方给出 DSpark 草稿模型的具体加速数据、质量等价原理和 llama.cpp 与 SGLang 的用法,端侧部署可直接迁移。
Microsoft Research 发布 Skala 1.1,训练数据较上一版增加 2.5 倍,在 GMTKN55 基准的 55 个类别中 32 项排名第一,加权平均误差 2.8 kcal/mol,并以 meta-GGA 的计算成本超越最昂贵的 global hybrid 泛函。
Mistral 发布 Agentic Search,为模型提供 search、open、navigate、read、grep 五个工具,在现有索引上执行多步检索循环以处理复杂文档。
推荐理由:原文给出 Agentic Search 在 FinanceBench 和 OfficeQA Pro 上的具体数字,读者可以对照自己场景估算检索收益。
IBM Research 在 Hugging Face 博客发布 ALTK-Evolve 研究,在 AppWorld 上测试八种模型后提出智能体记忆应按模型能力校准注入剂量,而非全量累积。
OpenAI 推出 ChatGPT for Teens,帮助青少年学习、培养批判性思维并自信地使用 AI。该版本内置更强的安全防护和健康使用功能,并为家长提供额外的控制选项。
Hugging Face 发布教程介绍 Sentence Transformers v6.0 新增的第四种模型类型 MultiVectorEncoder,用于 ColBERT 式 late interaction 检索。
推荐理由:官方教程详解 Sentence Transformers v6.0 新增 MultiVectorEncoder 的用法,涵盖 MaxSim 原理、索引成本与视觉文档检索实践。
Hugging Face 构建了一个约束感知 GPU 分配器,在 7 个基准场景中与 FIFO 调度器对比。相同硬件和负载下,利用率从 52–85% 提升至 72–88%,最高提升 33 个百分点;优先级加权产出每个场景均上升,增幅 24.6%–105.1%,平均 52%。最强案例是 8 GPU 的训练密集型负载:利用率从 53.6% 升至 87.0%,产出提升 105%。
DiG-bench 是一个包含 70 款隐藏规则游戏的基准,用于测试 AI 通过探索发现环境规则的能力,来自牛津、Princeton、MIT 等机构,作者包括 Juergen Schmidhuber。
Google Research 推出研究性深度学习框架 PhotoScan,从标准 2D 手机照片估算体脂率、A/G 比和 V/S 比等身体成分指标。
Hugging Face 发布 2026 年 1 至 8 月开源模型生态观察,Hub 公开模型仓库从 243 万增至 296 万,Qwen 衍生模型达 151,448 个,成为社区主要基座模型。
推荐理由:Hugging Face 用 Hub 下载、衍生模型和 Agent 流量等一手数据,刻画 2026 年开源模型生态的结构变化。
Strands Robots 推出流式数据环,在一个 Agent 内完成录制机器人演示、直接从 Hub 流式读取训练、再把 checkpoint 部署回硬件,全程保持 LeRobot 格式。
Google DeepMind 发布 Gemini 3.7 Flash,定位为其最智能的编码与智能体主力模型,距 Gemini 3.6 Flash 发布仅三周。
推荐理由:官方给出了具体基准对比和减半的引入价,读者可以据此评估 Flash 系列在编码和智能体场景的性价比变化。
Hugging Face 于 7 月 15 日至 8 月 2 日举办 ICML 2026 Open Reproductions 挑战赛,1,221 名社区成员用 Claude Code、Codex、Cursor 等智能体逐条复现论文,19 天内发布 6,816 份 Trackio logbook,覆盖 2,226 篇论文,约占会议的 34%。
推荐理由:原文基于一次大规模复现活动的第一手数据,给出可复现率、证伪案例和人类在 Agent 审稿中的角色判断。
Hugging Face 的 OlmoEarth Studio 现已支持计算并导出 OlmoEarth 开源基础模型的 embedding 向量,用于相似性搜索、分割等下游任务。
Microsoft Research 推出 MindTopo 基准,评估多模态大模型在连通性、包围、顺序、分离与绳结五类拓扑概念上的推理与规划能力。测试显示,各类专有和开源模型在静态推理上明显优于交互式规划任务,且均远低于人类水平,错误多出现在多步规划中丢失结构关系或提出违反物理约束的动作。该基准可为机器人和交互环境中需要保持拓扑结构的智能体研究提供诊断工具。
Google DeepMind 发布多语言手语转文本(SL2T)翻译模型,首次将手语 AI 带入消费产品,支持在 Pixel 11 的 Gboard 和 Live Transcribe 中以美式手语(ASL)输入英文。
推荐理由:原文介绍了 SL2T 的训练数据、隐私设计与基准成绩,并说明其落地产品形态,读者可以了解手语翻译模型的可行路径。
Google Research 提出 knowledge profiling 行为框架和 WikiProfile 基准(2,150 条 Wikipedia 事实,各配 10 个任务),评估 13 个 LLM 约 450 万条回复。
推荐理由:Google 用知识画像框架把事实错误拆成编码与召回两类,指出前沿模型瓶颈在召回,并量化 thinking 的恢复作用。
Google Research 发布 AMIE (Video),基于 Gemini 和 Project Astra 的实时视频问诊系统,采用 Talker、Planner、Perception 三个智能体并行工作的异步多智能体架构。
推荐理由:原文给出研究架构、随机对照规模和关键结果,读者可以了解视频问诊 AI 与真人医生对比的具体依据和局限。
Microsoft Research 发布研究模型 CARE-X,一个统一的胸部 X 光 VLM,支持报告生成、疾病分类、器械识别、定位等多任务,并结合生成式与判别式双路推理及辅助监督。
IBM Research 在博客中对比自家的 ALTK-Evolve 与 ACE 两种智能体记忆方法,两者都不压缩经验教训,差异在于交付:ACE 每步注入完整 playbook,ALTK-Evolve 按任务和模型能力检索适量 guideline。
Mistral 推出三项主权 AI 举措:Mistral Regional Endpoints 正式可用,客户可选择推理在欧洲或美国运行;Mistral Priority Tier 进入公开预览,提供自定义速率限制和 uptime SLA。