Google DeepMind 发布 Gemini 3 Pro 预览版及 Gemini 3 Deep Think
Google DeepMind 发布 Gemini 3,先以 Gemini 3 Pro 预览版形式推出,并预告增强推理模式 Gemini 3 Deep Think。
推荐理由:官方发布给出完整基准成绩和覆盖入口,读者可据此判断 Gemini 3 Pro 的推理与编码能力以及它如何嵌入现有工具链。
Google DeepMind 发布 Gemini 3,先以 Gemini 3 Pro 预览版形式推出,并预告增强推理模式 Gemini 3 Deep Think。
推荐理由:官方发布给出完整基准成绩和覆盖入口,读者可据此判断 Gemini 3 Pro 的推理与编码能力以及它如何嵌入现有工具链。
Google DeepMind 推出智能体开发平台 Google Antigravity,包含 AI IDE 式 Editor 界面和面向异步协作的 Manager 界面,支持智能体自主规划并执行端到端软件任务。
推荐理由:官方宣布了 Antigravity 的产品形态、免费预览和可用模型,读者可据此评估它对现有开发流程的影响。
Google 发布生成式 UI 实现,可按提示词动态生成网页、游戏、工具等定制交互界面,相关论文为 Generative UI: LLMs are Effective UI Generators。
推荐理由:原文介绍了生成式 UI 的实现原理、产品入口和人评结果,读者可以了解这一交互范式如何落地到现有产品。
Google DeepMind 发布 SIMA 2,将 Gemini 模型嵌入智能体核心,使其从跟随指令进化为能思考目标、与用户对话并自我改进的通用游戏智能体。
推荐理由:官方介绍 SIMA 2 如何借 Gemini 从执行指令走向推理与自改进,读者可了解具身智能体训练路径。
提示词注入是 AI 系统面临的前沿安全挑战。OpenAI 介绍了这类攻击的运作方式,并说明其如何通过推进相关研究、训练模型和构建安全防护来保护用户。
Google Research 推出 DS-STAR 数据科学智能体,通过数据文件分析模块、LLM 判官验证和顺序规划迭代三项创新,支持 JSON、非结构化文本等异构数据格式。
OpenAI 推出 Aardvark,一个能自主发现、验证并协助修复软件漏洞的 AI 安全研究员。该系统目前处于 private beta 阶段,用户可报名参加早期测试。
MiniMax 团队成员分享 MiniMax M2 后训练中智能体对齐的关键经验。结论包括:智能体需要 Interleaved Thinking,思考可在任务任意阶段发生以应对工具输出等外部扰动。
OpenAI 深入解析了为 ChatGPT Atlas 浏览器打造的新架构 OWL。OWL 将 Chromium 解耦,实现快速启动和丰富 UI,并支持与 ChatGPT 结合的 agentic 浏览体验。
安全公司 Doppel 使用 GPT-5 和强化微调来阻止 deepfake 与身份冒充攻击,在攻击扩散前完成拦截。该系统将分析师工作量减少 80%,并把响应时间从数小时缩短到数分钟。
Hugging Face 发布 huggingface_hub v1.0,该库现支持 20 万依赖库,并提供超过 200 万公开模型、50 万公开数据集和 100 万公开 Spaces 的访问。
推荐理由:官方完整梳理了 huggingface_hub 五年演进与 v1.0 的破坏性变更,含兼容性影响和迁移指引,对依赖该库的开发者有直接参考价值。
Mistral 发布 Mistral AI Studio,将支撑其自身大规模系统的基础设施打包给企业团队,用于在生产环境构建、评估和运行 AI。平台由三大支柱组成:Observability、基于 Temporal 的 Agent Runtime 和 AI Registry,提供评估、可追溯反馈回路、版本管理与治理能力,并支持混合、专用和自托管部署。
Consensus 基于 GPT-5 和 OpenAI Responses API 构建多智能体研究助手,可在几分钟内读取、分析并综合文献证据。该平台已帮助超过 800 万研究人员加速科学发现。
Meta-PyTorch 与 Hugging Face 联合推出 OpenEnv Hub,一个共享开放的智能体环境社区平台,同时发布 OpenEnv 0.1 规范(RFC)征集社区反馈。
人力资源平台 HiBob 通过 ChatGPT Enterprise 和自建 custom GPT 规模化推行 AI,已打造 2,500 个 GPT,用于提升营收、精简 HR 工作流,并在 Bob 平台中推出 AI 驱动的功能。
BigCode 发布 BigCodeArena,一个通过真实执行来评判代码生成模型的人类投票平台,支持 10 种语言和 8 种执行环境,开放无需注册。上线 5 个月收集 14K 对话、4700+ 偏好投票,Elo 排名中 o3-mini 和 o1-mini 居首。
推荐理由:基于5个月社区执行评估数据发布代码生成评测平台,给出分语言和执行环境的模型表现差异与两个新基准。
OpenAI 发布 AgentKit、扩展 Evals 能力,并为智能体推出强化微调(RFT),帮助开发者更快地从原型走向生产。
推荐理由:官方宣布面向开发者的智能体工具套件,可帮助关注 Agent 开发的读者了解从原型到生产的最新官方工具链。
OpenAI 构建了一套合同数据提取系统,可快速提取合同信息,缩短处理周转时间,让各团队更便捷地获取所需合同细节。
作者发布 VibeGame,一个建立在 three.js、rapier 和 bitecs 之上、面向 AI 辅助游戏开发的高层声明式游戏引擎。
推荐理由:作者先实测 Roblox、Unity 和 web 三条 vibe coding 游戏路线,再据此设计出兼顾抽象与开放性的引擎,方法可迁移。
Hugging Face 与 Intel 基于 OpenVINO 在 Intel Core Ultra 集成 GPU 上加速 Qwen3-8B:用 Qwen3-0.6B 作草稿模型的投机解码带来约 1.3× 提速,再从草稿模型 28 层中剪掉 6 层并用 Qwen3-8B 生成的 500k 提示词数据微调后,提速提升至约 1.4×。
OpenAI 宣布在 ChatGPT 中迈出 agentic commerce 的第一步,推出 Instant Checkout 和 Agentic Commerce Protocol,为用户、AI 智能体和商家提供共同购物的新方式。
推荐理由:OpenAI 官方宣布 ChatGPT 引入购物结算与开放协议,读者可据此了解 AI 智能体参与电商交易的早期方向。
OpenAI 发布 ChatGPT Pulse 预览版,面向移动端 Pro 用户。Pulse 是一种新体验,ChatGPT 会主动做研究,基于用户的聊天记录、反馈以及日历等连接应用生成个性化更新。
Hugging Face 发布 Smol2Operator 方案,将无 GUI 定位能力的 SmolVLM2-2.2B-Instruct 通过两阶段 SFT 训练为 GUI 智能体,在 ScreenSpot-v2 上从基线 0 提升到 61.71%。
Meta 的 Hugging Face 团队发布 GAIA 后续基准 Gaia2 和配套开源框架 Meta Agents Research Environments(ARE),Gaia2 数据集采用 CC BY 4.0 许可,ARE 采用 MIT 许可。
推荐理由:官方发布新基准 Gaia2 和开源评估框架 ARE,含七类任务和主流模型结果,便于开发者调试和评估自己的 Agent。
OpenAI 在 GPT-5 系统卡附录中发布新模型 GPT-5-Codex,是针对 Codex 中智能体编码进一步优化的 GPT-5 版本。该模型会根据任务复杂度更动态地调整思考力度,简单对话或小任务快速响应,复杂任务则可独立长时间工作。
推荐理由:原文说明新模型在思考力度上按任务复杂度动态调整,读者可了解其与 GPT-5 在编码场景下的差异。
Hugging Face 发布 Jupyter Agent 项目,用约 2TB Kaggle 笔记本构建 51k 条合成轨迹、近 0.2B tokens 的数据集,微调 Qwen3-4B-Instruct-2507 与 Qwen3-4B-Thinking-2507。
推荐理由:原文完整给出从数据清洗到微调的管线与消融数字,读者可复用其中提升小模型数据科学能力的做法。
Mistral 为 Le Chat 推出 Memories(beta)记忆功能,采用自动保存与智能、可见召回的混合方案。功能遵循透明、可控、主权三原则,用户可随时关闭记忆、开启隐身聊天、编辑或删除单条记忆,并支持导出导入;还提供 Memory Insights 轻量提示帮助探索记忆内容,移动端可在 App Store 或 Google Play 下载体验。
Mistral AI 在 Le Chat 中推出 20+ 个安全 MCP 连接器(beta)和 Memories 记忆功能(beta)。
Hugging Face 发布教程,介绍如何用 Model Context Protocol(MCP)让 AI 通过自然语言调用 arXiv、GitHub、Hugging Face 等研究工具,自动化文献发现的跨平台检索与交叉引用。
Basis 基于 OpenAI o3、o3-Pro、GPT-4.1 和 GPT-5 构建的 AI 智能体,帮助会计师事务所节省多达 30% 的时间。释放的产能可用于拓展咨询业务与业务增长。
Hugging Face 推出 TextQuests 基准,基于 25 款经典 Infocom 互动小说游戏评估 LLM 作为自主智能体的长上下文推理与探索学习能力。
OpenAI 发文称 GPT-5 是其最先进的模型,将变革企业级 AI、自动化与劳动力生产力。文章把 GPT-5 定位为智能工作新纪元的核心驱动力,聚焦企业场景下的自动化与工作效率提升。
OpenAI 发布文章介绍 Cursor 如何使用 GPT-5。原文仅说明“了解 Cursor 如何使用 GPT-5”,未提供更多细节。
OpenAI 发布开源权重模型 GPT OSS,包含 117B 参数的 gpt-oss-120b 和 21B 参数的 gpt-oss-20b,均采用 MoE 架构和 MXFP4 4-bit 量化,分别可装入单张 H100 和 16GB 显存,采用 Apache 2.0 许可证。
推荐理由:文章给出两个模型的参数量、量化方案和各硬件平台的具体推理优化建议,读者可按自己的 GPU 直接选择部署路径。
NVIDIA 的 AI-Q Blueprint 在 Hugging Face DeepResearch Bench「LLM with Search」榜单登顶,总分为 40.52(截至 2025 年 8 月),是目前完全开源授权方案中的第一名。
Mistral AI 发布 Codestral 25.08,并整合 Codestral Embed、Devstral 和 Mistral Code IDE 插件形成面向企业的完整编码栈。
Outtake 使用 GPT-4.1 和 OpenAI o3 驱动 AI 智能体,检测和处置数字威胁的速度比此前提升 100 倍。OpenAI News 介绍了这家公司如何将两套模型用于威胁响应。该案例展示了前沿模型在网络安全自动化场景中的实际落地。
在 OpenAI 的 Executive Function 系列中,Model ML CEO Chaz Englander 介绍了 AI 原生基础设施和自主智能体正在变革金融服务的工作流程。
OpenAI 发布 ChatGPT agent 的 System Card,介绍其将研究、浏览器自动化和代码工具整合为一的智能体能力。安全防护措施依据 Preparedness Framework 设置。
推荐理由:官方系统卡说明 ChatGPT agent 如何把研究、浏览器操作与代码工具合一,并给出安全防护框架,可作为能力与风险参考。
OpenAI 发布 ChatGPT agent,能边思考边行动,借助工具完成任务。官方称其可在用户引导下完成调研、预订和制作幻灯片等工作。
推荐理由:OpenAI 官方宣布 ChatGPT agent 上线,读者可以了解其边思考边行动、借助工具完成任务的产品定位。