OpenAI 发布 ChatGPT Work 智能体,可将目标转化为完成的工作
OpenAI 官方宣布推出 ChatGPT Work 智能体,可跨用户的应用和文件采取行动,必要时可持续跟进一个项目数小时,把目标变成完成的工作。
推荐理由:官方宣布 ChatGPT 可跨应用与文件执行操作,读者可以据此判断它能承接多长时间的自主项目式工作。
OpenAI 官方宣布推出 ChatGPT Work 智能体,可跨用户的应用和文件采取行动,必要时可持续跟进一个项目数小时,把目标变成完成的工作。
推荐理由:官方宣布 ChatGPT 可跨应用与文件执行操作,读者可以据此判断它能承接多长时间的自主项目式工作。
UC Berkeley 的 Aditya G. Parameswaran 团队发文认为近零成本推理时代将重塑数据系统,提出三类议程:For Agents 重新设计系统以应对智能体高并发重复查询(实验中仅 10-20% 子计划不同)。
Australian Payments Plus(AP+)使用 ChatGPT Enterprise 和 Codex 应对支付业务的复杂性,从而加快工作速度。该公司节省了时间、提升了质量,并保持人工判断处于核心地位。
LeRobot v0.6.0 发布,引入 VLA-JEPA、FastWAM、LingBot-VA 三种会预测未来的世界模型策略,新增 GR00T N1.7、MolmoAct2、EO-1 等多个 VLA,以及统一奖励模型 API(Robometer、TOPReward)。
推荐理由:官方发布页完整列出各项新能力与配套工具,读者可以据此评估这次版本更新对机器人学习工作流的实际影响。
Hugging Face 官方博客总结 🤗 Kernels 项目近几个月的重大更新。Hub 新增 kernel 仓库类型,可查看内核支持的加速器、操作系统和后端版本;默认只加载受信任发布者的内核,非受信来源需显式传 trust_remote_code=True,并引入基于 Sigstore cosign 的代码签名(加载时尚未默认验证)。
Hugging Face 推出开源基准 ScarfBench,用 Spring、Jakarta EE、Quarkus 间的迁移任务评测 AI 智能体,包含 34 个应用、102 个框架实现、204 个迁移任务、约 151K 行代码和 1,331 个专家编写测试。
OpenAI 发布新研究论文,展示 AI 智能体如何改变工作,让更长、更复杂的任务得以完成,并提升各类岗位的生产力。
Google DeepMind 宣布 computer use 成为 Gemini 3.5 Flash 的内置工具,此前该能力仅以独立 Gemini 2.5 computer use 模型提供。
推荐理由:原文说明 computer use 从独立模型转为 Gemini 3.5 Flash 内置工具,并给出 API 入口和企业级安全防护选项。
Mistral 推出多项 Connectors 新功能:管理员可按 workspace 或 org 设置连接器访问权限并逐个开关工具,API keys 支持 connector scope 防止自动化任务冒充用户身份,多账号连接器支持一个连接器绑定多个登录账号。
Jason Liu 分享了使用 OpenAI Codex 处理长时间运行任务的经验。他利用 Codex 保存上下文、管理复杂项目,让工作在单个提示词之外持续进行。
Hugging Face 博客介绍了 localpager 系统,用 pi agent harness 加受限只读 shell reposhell,在 NVIDIA GB10(DGX Spark。
推荐理由:作者分享了本地模型加受限 shell 做高吞吐分类的完整配方,附带 330 条评测对比,可迁移到其他信息过滤场景。
ServiceNow 团队在 Hugging Face Blog 发布 MosaicLeaks 基准与 PA-DR 训练方法,研究深度研究智能体通过 web 查询逐步拼出私有文档信息导致的马赛克式隐私泄露。
Hugging Face 发布 agent-eval 基准工具,不只看最终答案,而是测量智能体完成任务所需的轮次、token、时间和失败情况,全部由开源模型通过 pi 编码智能体驱动并跑在 Hugging Face Jobs 上。
AWS 开源 SDK Strands Robots 将 LeRobot 栈封装为 AgentTools,可用单个 Strands agent 完成录制演示数据、运行策略、部署到实体 SO-101 和多机器人协调。
推荐理由:AWS 官方 walkthrough 给出从 Hub 数据集到实体 SO-101 机器人的完整可运行示例,仿真与硬件共享同一 LeRobotDataset 格式,可迁移到自己的机器人工作流。
OpenAI 与 Molecule.one 展示了一个使用 GPT-5.4 的近自主 AI 化学家,成功改进了一项关键的药物合成反应。这一成果推进了药物化学研究。
智谱发布旗舰模型 GLM-5.2,面向长时程任务,首次在稳定的 1M-token 上下文上交付该能力,采用 MIT 开源协议。架构上提出 IndexShare,每 4 层稀疏注意力共享一个 indexer,1M 上下文下每 token FLOPs 降低 2.9 倍,并改进 MTP 层使投机解码接受长度最多提升 20%。
推荐理由:官方技术报告给出 1M 上下文的架构改进和三项长时程基准对比,读者可以借此评估开源模型在真实编码场景的可用性。
Hugging Face 联合 Microsoft、Google、GoDaddy 等贡献者发布 Agentic Resource Discovery(ARD)开放规范草案,定义如何通过联邦注册表对 Agent 能力进行编目、索引和自然语言搜索,让 Agent 在运行时发现 MCP 工具、A2A Agent 和 Skills,而无需预先安装配置。
推荐理由:原文介绍了 ARD 开放规范的设计细节和 Hugging Face 的参考实现,附 CLI 和 API 用法,可直接上手做运行时能力发现。
Google DeepMind 正与英国政府、Google Cloud、Faculty 及 Barnet、Dorset、Camden 三个地方规划部门合作,开发基于 Gemini 的 AI 规划原型,目标是把住宅规划申请的决策时间缩短 50%,以支持 2029 年前新建 150 万套住房的目标。
Google DeepMind 发布 AI Control Roadmap,把内部 AI 智能体视为潜在未对齐的系统,在对齐之上叠加系统级安全防护。方案基于 MITRE ATT&CK 构建 AI 威胁建模框架,采用可信模型监督器做检测与拦截,并按模型逃避检测和造成危害的能力划分 D1-D4 与 R1-R3 安全等级。
推荐理由:原文提出以模型不可信为前提的系统级 AI Control 框架,并给出检测分级和百万轨迹的落地实践,对构建智能体安全有参考价值。
OpenAI 在 Academy 推出三门新课程,帮助人们学习实用 AI 技能、建立可复用的工作流,并将智能体应用到日常工作中。课程面向职场场景,聚焦实际操作能力的培养。
OpenAI 宣布计划收购 Ona,目标是让 Codex 获得安全、持久的云端环境,支持长时间运行的 AI 智能体在企业工作流中使用。
Google DeepMind 联合 Schmidt Sciences、Cooperative AI Foundation、ARIA 并由 Google.org 支持,发起最高 1000 万美元的多智能体 AI 安全研究资助,面向全球研究者。
Hugging Face 工程师让一个编码 Agent 通过调用两个 Spaces(ideogram-ai/ideogram4 图像生成和 VAST-AI/TripoSplat 单图转 3D Gaussian splat)搭建了巴黎地标 3D 画廊 mishig/monuments-de-paris,全程未手动使用图像生成或 3D 工具。
推荐理由:作者亲历一次完整流水线复现,给出可复用的 agents.md 调用方法和链式组合思路,读者可照做搭建自己的多媒体 Agent 应用。
Notion 使用 OpenAI 的 Codex 一次性生成规格说明(one-shot specs)、为网页端构建 AI Voice Input 功能,并让小型工程团队的能力成倍放大。
Hugging Face 宣布 OpenEnv 转为由多方委员会协调的开源项目,委员会成员包括 Meta-PyTorch、Unsloth、Modal、Nvidia、Microsoft 等。
Google 推出由 Agentic RAG 驱动的 Gemini Enterprise Agent Platform 版 Cross-Corpus Retrieval,采用多智能体架构(Orchestrator、Planner Agent、Query Rewriter、Search Fanout Agent 等)处理多数据源、多跳查询。
Endava 正在利用 AI 智能体、ChatGPT Enterprise 和 Codex 加速软件交付,并自动化工作流程。该公司同时在整个企业范围内建设 AI 原生文化,推动 AI 融入日常研发与业务流程。
Hugging Face 重构官方 hf CLI,使其同时服务人类和 Claude Code、Codex、Cursor 等编码 Agent,hf v1.9.0 引入按环境变量自动检测的 agent 模式,输出 TSV、完整字段、无 ANSI、不截断,并提供 next-command 提示、--yes/--dry-run 等安全重试设计。
推荐理由:官方实测数据显示 CLI 在多步 Hub 任务上可把 token 消耗降到手工 curl/SDK 的几分之一,方法与结论可迁移给 Agent 工具设计。
Wasmer 使用 Codex(配合 GPT-5.5)构建了一个面向边缘环境的 Node.js 运行时。该方案将开发速度提升 10x 到 20x,原本需要数月的交付缩短至数周。
Hcompany 发布 Holo3.1 系列 Computer Use 模型,提供 0.8B、4B、9B 和 35B-A3B 四种尺寸。
推荐理由:官方给出各尺寸在 OSWorld 与 AndroidWorld 的量化后表现和部署路径,读者可据此评估本地 Computer Use Agent 的可行性。
OpenAI 推出 Codex 插件、站点和标注功能,帮助分析师、营销人员、设计师和投资人等不同团队更高效地用 AI 完成工作。这些新能力让 Codex 覆盖更多角色与工作流场景。
OpenAI 发布《The Next Era of Knowledge Work》报告,探讨 Codex 如何通过 AI 驱动的研究、数据分析、工作流自动化和内容创作来变革生产力。报告指出 Codex 正在成为面向所有人的生产力工具。
JetBrains 发布 Mellum2,一个总参数 12B、每 token 仅激活 2.5B 的开源 Mixture-of-Experts 模型,在自然语言和代码语料上从头训练,采用 Apache 2.0 许可证。
IBM 在四个企业场景(Cobol/PL/1 遗留代码理解、Aster 测试生成、事件响应等)中验证:在智能体层加入程序分析、知识图谱等 agent logic,可约束 LLM 的上下文空间。
Google Research 在 I/O 2026 上发布 Gemini for Science,包含基于 ERA 和 AlphaEvolve 构建的 Computational Discovery。
Mistral 在 AI Now Summit 2026 上发布面向工业工程的 AI 全栈方案,并与 Airbus、BMW 和 ASML 合作优化设计、仿真与生产。其智能体工具 Vibe 升级为可执行长程多步任务,涵盖深度研究、代码修复与提交可审查的 PR。位于法国 Les Ulis 的新 10 MW 推理数据中心计划于 2026 年第三季度启用。
Mistral 发布统一智能体 Vibe,Le Chat 品牌正式升级,一个许可同时覆盖工作与编码。
推荐理由:Mistral 官方公布了 Le Chat 升级为统一智能体 Vibe 的具体能力与各端入口,读者可据此评估其在工作与编码场景中的可用性。
Endava 使用 Codex 构建智能体组织,加速软件交付,并将需求分析时间从数周缩短到数小时。
Cisco 与 OpenAI 合作,通过 Codex 重塑企业级工程。Cisco 借助 Codex 扩展 AI 原生开发,加速 AI Defense 相关工作,并实现缺陷修复自动化。
OpenAI 与 Thrive、Crete 基于 Codex 构建了能自我改进的税务智能体,实现申报自动化。该智能体提升了准确性并加快了工作流程。