从 Atari 到 EVE Online:Google DeepMind 15 年游戏 AI 研究的演进之路
Google DeepMind 梳理了自 2010 年成立以来以游戏驱动的 AI 研究历程:DQN 从原始像素学会 49 款 Atari 2600 游戏,AlphaGo 于 2016 年击败李世石,AlphaZero 通用化至国际象棋、将棋和围棋,MuZero 无需规则即可学习,AlphaStar 在 2019 年达到 StarCraft II 宗师级。
Google DeepMind 梳理了自 2010 年成立以来以游戏驱动的 AI 研究历程:DQN 从原始像素学会 49 款 Atari 2600 游戏,AlphaGo 于 2016 年击败李世石,AlphaZero 通用化至国际象棋、将棋和围棋,MuZero 无需规则即可学习,AlphaStar 在 2019 年达到 StarCraft II 宗师级。
Google Research 推出 Mobility-Embedded POIs(ME-POIs)框架,将匿名聚合的移动模式与文本嵌入融合,帮助语言模型捕捉地点的时间活动节奏。
Hugging Face 发布新研究,用三项探针测试量化 ASR 模型的基准优化(benchmaxxing)现象。评估 11 个开源模型发现,多个高分模型会复现 VoxPopuli 和 LibriSpeech 的错误参考转录,甚至在相关词被静音时恢复被删除的数字,或按基准期望切换拼写变体;部分模型还能借助声学线索识别测试集。
推荐理由:研究用三种探针量化了 ASR 模型对公开基准的过拟合,并给出选用模型与设计基准的具体建议。
Hugging Face 团队详解 Papers with Code 混合搜索架构:PostgreSQL 全文检索加 pgvector 语义召回,经加权 RRF 融合,语义向量用 Qwen/Qwen3-Embedding-0.6B 生成 256 维 Matryoshka 截断向量。
Liquid AI 为 LFM2.5 系列三个模型(LFM2.5-1.2B-Instruct、LFM2.5-2.6B、LFM2.5-8B-A1B)发布 DSpark 草稿模型检查点,采用投机解码在不改变输出质量的前提下大幅加速解码。
推荐理由:官方给出 DSpark 草稿模型的具体加速数据、质量等价原理和 llama.cpp 与 SGLang 的用法,端侧部署可直接迁移。
Microsoft Research 发布 Skala 1.1,训练数据较上一版增加 2.5 倍,在 GMTKN55 基准的 55 个类别中 32 项排名第一,加权平均误差 2.8 kcal/mol,并以 meta-GGA 的计算成本超越最昂贵的 global hybrid 泛函。
Mistral 发布 Agentic Search,为模型提供 search、open、navigate、read、grep 五个工具,在现有索引上执行多步检索循环以处理复杂文档。
推荐理由:原文给出 Agentic Search 在 FinanceBench 和 OfficeQA Pro 上的具体数字,读者可以对照自己场景估算检索收益。
OpenAI 推出名为 Intelligence Age 的新博客,探讨变革性 AI 可能如何重塑权力、治理、经济与个人自由。
Stampli 使用 Codex 和 ChatGPT Work 将上线工时缩短了 68%。在截止日期固定、设计资源被占用的情况下,该公司把原本需要数周的上线生产工作压缩到了数天完成。
OpenAI 重申为符合条件的 API 客户提供 Zero Data Retention(零数据保留),并预览 Private Safety Processing,在不牺牲数据隐私的前提下支持高级 AI 安全。
Replit 推出由 GPT-5.6 Luna 驱动的 Free Mode,让任何人都能将想法变成可运行的软件,且无需担心 token 成本。
OpenAI 将 ChatGPT Ads 扩展到 31 个欧洲市场。广告主可在用户探索、比较选项和做出决策时触达他们。
OpenAI 发起一项倡议,旨在加强国家安全领域对 AI 的民主监督,为政府机构提供工具、培训和专业知识支持。
IBM Research 在 Hugging Face 博客发布 ALTK-Evolve 研究,在 AppWorld 上测试八种模型后提出智能体记忆应按模型能力校准注入剂量,而非全量累积。
OpenAI 推出 ChatGPT for Teens,帮助青少年学习、培养批判性思维并自信地使用 AI。该版本内置更强的安全防护和健康使用功能,并为家长提供额外的控制选项。
OpenAI 正在为其前沿 AI 模型强化监控、对齐和安全措施。文章介绍了新的安全保障机制如何引导前沿模型的开发节奏,以应对网络安全关键能力带来的挑战。
OpenAI 与 CodeAI 达成合作,帮助学生建立 AI 素养、对 AI 进行批判性思考,并培养负责任地使用和塑造 AI 的能力。
Asana 使用 OpenAI Codex 在两周内替换了一套过时的测试系统,完成了原本需要数年的代码迁移,模型与基础设施成本约 $12K。该项目展示了 Codex 在大型存量代码库改造中的实际落地效果。
NVIDIA 团队使用 ChatGPT Work 减少手动任务、连接快速变化的信号,并将成功的工作流在全球范围内推广。
Hugging Face 发布教程介绍 Sentence Transformers v6.0 新增的第四种模型类型 MultiVectorEncoder,用于 ColBERT 式 late interaction 检索。
推荐理由:官方教程详解 Sentence Transformers v6.0 新增 MultiVectorEncoder 的用法,涵盖 MaxSim 原理、索引成本与视觉文档检索实践。
Hugging Face 构建了一个约束感知 GPU 分配器,在 7 个基准场景中与 FIFO 调度器对比。相同硬件和负载下,利用率从 52–85% 提升至 72–88%,最高提升 33 个百分点;优先级加权产出每个场景均上升,增幅 24.6%–105.1%,平均 52%。最强案例是 8 GPU 的训练密集型负载:利用率从 53.6% 升至 87.0%,产出提升 105%。
Google Research 推出研究性深度学习框架 PhotoScan,从标准 2D 手机照片估算体脂率、A/G 比和 V/S 比等身体成分指标。
AI 正在同时改变网络攻击者与防御者的能力格局。OpenAI 介绍了其如何加强自身安全防御,以及安全团队现在可以采取哪些应对措施。
OpenAI 宣布加入 PORTS-Pike 项目,扩大社区投资,支持俄亥俄州南部的数千个就业岗位。
OpenAI 资助 14 个独立项目,探索智能时代的 AI 政策新想法,目标是扩大经济机会并增强社会韧性。
Hugging Face 发布 2026 年 1 至 8 月开源模型生态观察,Hub 公开模型仓库从 243 万增至 296 万,Qwen 衍生模型达 151,448 个,成为社区主要基座模型。
推荐理由:Hugging Face 用 Hub 下载、衍生模型和 Agent 流量等一手数据,刻画 2026 年开源模型生态的结构变化。
Strands Robots 推出流式数据环,在一个 Agent 内完成录制机器人演示、直接从 Hub 流式读取训练、再把 checkpoint 部署回硬件,全程保持 LeRobot 格式。
Google DeepMind 发布 Gemini 3.7 Flash,定位为其最智能的编码与智能体主力模型,距 Gemini 3.6 Flash 发布仅三周。
推荐理由:官方给出了具体基准对比和减半的引入价,读者可以据此评估 Flash 系列在编码和智能体场景的性价比变化。
OpenAI 发布 GPT-5.6 开发者指南,介绍初创公司如何借助更智能的模型选择和 Responses API 新能力,更快、更省成本地构建 AI 智能体。指南聚焦实际开发用法与省钱方案。
OpenAI 推出新的 API 服务层级 Ultrafast,运行 GPT-5.6 Sol 时速度最高提升 14 倍。该服务由 Cerebras 驱动,输出速度最高可达 750 output tokens 每秒,目前处于预览阶段。
OpenAI 任命 Dali Rajic 为首席营收官(Chief Revenue Officer)。他将领导 OpenAI 的全球营收组织,帮助企业充分释放 AI 的价值。
Hugging Face 于 7 月 15 日至 8 月 2 日举办 ICML 2026 Open Reproductions 挑战赛,1,221 名社区成员用 Claude Code、Codex、Cursor 等智能体逐条复现论文,19 天内发布 6,816 份 Trackio logbook,覆盖 2,226 篇论文,约占会议的 34%。
推荐理由:原文基于一次大规模复现活动的第一手数据,给出可复现率、证伪案例和人类在 Agent 审稿中的角色判断。
Hugging Face 的 OlmoEarth Studio 现已支持计算并导出 OlmoEarth 开源基础模型的 embedding 向量,用于相似性搜索、分割等下游任务。
Microsoft Research 推出 MindTopo 基准,评估多模态大模型在连通性、包围、顺序、分离与绳结五类拓扑概念上的推理与规划能力。测试显示,各类专有和开源模型在静态推理上明显优于交互式规划任务,且均远低于人类水平,错误多出现在多步规划中丢失结构关系或提出违反物理约束的动作。该基准可为机器人和交互环境中需要保持拓扑结构的智能体研究提供诊断工具。
Google DeepMind 发布多语言手语转文本(SL2T)翻译模型,首次将手语 AI 带入消费产品,支持在 Pixel 11 的 Gboard 和 Live Transcribe 中以美式手语(ASL)输入英文。
推荐理由:原文介绍了 SL2T 的训练数据、隐私设计与基准成绩,并说明其落地产品形态,读者可以了解手语翻译模型的可行路径。
Google Research 提出 knowledge profiling 行为框架和 WikiProfile 基准(2,150 条 Wikipedia 事实,各配 10 个任务),评估 13 个 LLM 约 450 万条回复。
推荐理由:Google 用知识画像框架把事实错误拆成编码与召回两类,指出前沿模型瓶颈在召回,并量化 thinking 的恢复作用。
OpenAI 发布研究,展示企业采用 agentic AI 的现状,包括如何使用 ChatGPT 和 Codex,以及前沿企业在 AI 落地上如何领先。
RingCentral 使用 ChatGPT Work 和 Codex 加速 AI 产品开发,并将工程与运维的运营情报集中化,展示其从工程到运维的 AI 原生工作实践。
Google Research 发布 AMIE (Video),基于 Gemini 和 Project Astra 的实时视频问诊系统,采用 Talker、Planner、Perception 三个智能体并行工作的异步多智能体架构。
推荐理由:原文给出研究架构、随机对照规模和关键结果,读者可以了解视频问诊 AI 与真人医生对比的具体依据和局限。
Microsoft Research 发布研究模型 CARE-X,一个统一的胸部 X 光 VLM,支持报告生成、疾病分类、器械识别、定位等多任务,并结合生成式与判别式双路推理及辅助监督。