OpenAI 发布开源编排规范 Symphony
OpenAI 推出 Symphony,一个面向 Codex 编排的开源规范,可将 issue 跟踪器转化为始终运行的智能体系统。该规范旨在提升工程产出并减少上下文切换。
OpenAI 推出 Symphony,一个面向 Codex 编排的开源规范,可将 issue 跟踪器转化为始终运行的智能体系统。该规范旨在提升工程产出并减少上下文切换。
食品分销公司 Choco 使用 OpenAI API 构建 AI 智能体,实现食品分销流程自动化。该方案帮助 Choco 提升了生产力并释放增长空间,是 AI 在实际业务中落地应用的客户案例。
DeepSeek 发布 V4,在 Hub 上开源 DeepSeek-V4-Pro(1.6T 总参数 / 49B 激活)和 DeepSeek-V4-Flash(284B 总参数 / 13B 激活)两个 instruct 及对应 base 检查点,均支持 1M token 上下文。
推荐理由:文章拆解了 V4 为长上下文与 Agent 场景做的架构与后训练设计,读者可据此评估开源模型跑长任务的部署成本。
ChatGPT Work 提供面向日常工作的实用工作流,覆盖重复性任务、更新汇报、调研、规划以及团队协作运营等场景,帮助用户将这些常见工作环节交给 ChatGPT 处理。
Hugging Face 发布教程,指导开发者在 Manifest V3 约束下用 Transformers.js 在 Chrome 扩展中运行本地 AI,并复刻其 Gemma 4 Browser Assistant 架构。
推荐理由:作者基于自家 Gemma 4 浏览器扩展拆解 MV3 下运行 Transformers.js 的架构决策,给出可直接迁移的运行时划分与消息契约设计。
OpenAI 深入解析了 Codex 智能体循环,展示如何在 Responses API 中用 WebSocket 和连接级缓存降低 API 开销、改善模型延迟。文中说明了 WebSocket 连接复用如何为智能体工作流提速。该能力通过 Responses API 提供。
OpenAI 在 ChatGPT 中推出 workspace agents,这是由 Codex 驱动的智能体,可自动化复杂工作流并在云端运行。该功能面向团队,帮助团队安全地跨工具扩展工作。
OpenAI 介绍如何在 ChatGPT 中构建和使用工作区智能体(workspace agents),用于自动化可重复的工作流。这些智能体可连接各类工具,简化团队运营流程。
Google Research 在 ICLR 论文中提出 ReasoningBank,一个从成功与失败经验中提炼结构化推理记忆的智能体框架,并开源了代码。它以检索、提取、整合的闭环运行,把失败案例转化为预防性经验;配合记忆感知的测试时扩展(MaTTS)进一步提效。
Google DeepMind 宣布与 Accenture、Bain & Company、BCG、Deloitte 和 McKinsey 合作,帮助企业规模化采用前沿 AI。
Hugging Face 发文分析网络安全进入 AI 加速时代后的格局,认为关键在于模型所嵌入的系统而非模型本身,开放生态可在检测、验证、协调、补丁四个阶段分散风险、缩小攻防能力差距。文章主张防御方采用半自主 AI 智能体,配合开源安全工具在组织内部署,并保留人类审批与可审计的决策日志。
推荐理由:原文从 Mythos 出发分析开放生态为何是防御方的结构性优势,并给出半自主智能体的可行防御路线。
Berkeley AI Research 提出 GRASP,一种基于梯度的世界模型规划器,让长时程规划更稳定可靠。其核心做法有三点:把轨迹提升到虚拟状态使优化在时间上并行、在状态迭代中直接引入随机性以实现探索、重塑梯度让动作获得干净的信号并避开脆弱的“状态-输入”梯度。
OpenAI 更新 macOS 和 Windows 版 Codex 应用,新增 computer use、应用内浏览、图像生成、记忆和插件功能,用于加速开发者工作流。
推荐理由:原文点出 Codex 桌面端新增的多项能力,开发者可据此评估是否将其纳入日常工作流。
Hugging Face 发布一个 Skill 和独立测试套件,帮助贡献者把 transformers 模型移植到 mlx-lm,模型进入 transformers 后可更快在 MLX 上可用。
推荐理由:原文给出一个可复用的 Skill 加非智能体测试套件,并总结了让智能体 PR 符合开源惯例的具体规则,可迁移到其他项目。
Hugging Face 将 RLVE 框架从单轮推理任务扩展到多轮、带工具调用的电商对话场景,推出 EcomRLVE-GYM,提供 8 个可算法验证的环境,如商品发现、换货、购物车构建、订单追踪等。
Hugging Face 介绍了其推出的可执行基准 VAKRA,用于评估 AI 智能体在企业级环境中的推理与执行能力。基准提供 8,000+ 本地托管 API、覆盖 62 个领域,任务需 3-7 步推理链,包含 API 链式调用、工具选择、多跳推理等四类能力。文章还分析了模型在不同任务上的失败模式。
OpenAI 更新 Agents SDK,新增原生沙盒执行和模型原生 harness,帮助开发者构建可跨文件与工具运行的安全的长时运行智能体。
HCompany 推出 Chrome 扩展 HoloTab,将其 3 月 31 日发布的 computer-use 模型 Holo3 直接带到浏览器中,无需配置即可在任何网站自动化操作。其 Routines 功能通过录屏和讲解生成可重复运行或定时执行的例程,适合比价、找工作等重复任务;产品目前免费开放使用。
推荐理由:原文介绍了浏览器智能体的录制生成例程能力和免费入口,读者可以据此了解它如何把 computer-use 模型带入日常工作流。
Cloudflare 将 OpenAI 的 GPT-5.4 和 Codex 引入 Agent Cloud,帮助企业快速、安全地构建、部署和扩展用于真实任务的 AI 智能体。企业可在 Agent Cloud 上直接运行智能体工作流。
ChatGPT skills 可用于创建可复用的工作流、自动化重复性任务,并确保输出稳定且高质量。
Google Research 推出两个学术智能体框架:PaperVizAgent(原 PaperBanana)用于从论文文本生成可发表的学术图表,ScholarPeer 则自动执行严格的同行评审。
OpenAI 阐述企业 AI 的下一个阶段,称各行业的企业级 AI 采用正在加速。该阶段的核心包括 Frontier、ChatGPT Enterprise、Codex 以及覆盖全公司的 AI 智能体。
Google DeepMind 发布 Gemma 4 开源模型,基于 Gemini 3 技术,主打高级推理和智能体工作流。提供 E2B、E4B、26B MoE(推理时仅激活 3.8B 参数)和 31B Dense 四种尺寸,31B 在 Arena AI 文本排行榜上位列全球开源模型第 3,采用 Apache 2.0 许可,支持 128K-256K 上下文窗口、原生多模态和 140+ 语言。
推荐理由:原文给出了四个尺寸、基准排名和部署细节,读者可以据此判断在本地和端侧硬件上的可用性。
Gradient Labs 基于 GPT-4.1 和 GPT-5.4 mini、nano 构建 AI 智能体,为每位银行客户提供 AI 客户经理,自动化银行支持工作流程。该方案具备低延迟和高可靠性。
Mistral AI 发布面向人类开发者和 Agent 的 Spaces CLI,三条命令即可从零搭建带热重载、数据库和生成 Dockerfile 的多服务项目并部署。
推荐理由:Mistral 以自家 CLI 为例,总结了一套让同一工具同时服务人类与 Agent 的可复用设计原则,细节具体。
Hugging Face 发文称 Anthropic 正在限制 Pro/Max 订阅者在开放智能体平台使用 Claude 模型,并给出两条迁移路径。
Hugging Face 发布端到端语音智能体评估框架 EVA,采用 bot-to-bot 音频架构评估完整多轮语音对话,产出 EVA-A(准确性)与 EVA-X(体验)两项分数。
OpenAI 使用链式思维(chain-of-thought)监控方法,研究内部编码智能体的对齐偏差问题。该方法通过分析真实部署中的智能体行为来检测潜在风险,并据此强化 AI 安全保障措施。
Google Research 在 The Check Up 活动上展示其在医疗健康领域的最新 AI 进展。
Mistral AI 发布 Forge,帮助企业基于内部文档、代码库和运营数据训练前沿级自有模型,并已与 ASML、Ericsson、欧洲空间局等机构合作。Forge 支持 pre-training、post-training 与强化学习,兼容 dense 和 MoE 架构及多模态输入,模型可在企业自有基础设施中运行。
H Company 发布多模态计算机使用模型 Holotron-12B,基于 NVIDIA Nemotron-Nano-2 VL 后训练约 140 亿 token,已在 Hugging Face 以 NVIDIA Open Model License 开放。
Mistral 发布 Leanstral,称其为首个面向 Lean 4 的开源代码智能体,权重采用 Apache 2.0 许可证,提供 120B-A6B 稀疏架构(6B 激活参数),并集成于 Mistral Vibe 及免费 API 端点 labs-leanstral-2603。
Mistral 在开源编码助手 Vibe 之上构建了一个自主 Agent,可读取 Rails 源码并生成或改进 RSpec 测试,在 CI/CD 中无人干预运行。
推荐理由:原文给出可直接复用的 AGENTS.md、skills 与自定义工具做法,以及质量分数变化,方法可迁移到其他代码测试场景。
ChatGPT 通过约束智能体工作流中的高风险操作、保护敏感数据,来防御提示词注入和社工攻击。文章说明了 OpenAI 在 AI 智能体安全设计上的具体做法,帮助降低智能体被恶意指令利用的风险。
OpenAI 介绍了如何基于 Responses API、shell 工具和托管容器构建 Agent 运行时,用于运行带文件、工具和状态的 Agent。方案强调安全性与可扩展性。
OpenAI 推出 AI 应用安全智能体 Codex Security,目前处于研究预览阶段。该智能体通过分析项目上下文来检测、验证并修复复杂漏洞,从而提供更高的置信度和更少的噪音。
Balyasny Asset Management 通过严格的模型评估、全面使用 OpenAI 平台以及智能体工作流,重塑投资研究流程。公司以系统化的模型评测筛选合适的模型,并将 OpenAI 的能力嵌入投研各环节,由智能体自动执行研究任务,构建起一套 AI 驱动的研究引擎。
OpenAI 发布 GPT-5.4,称其为面向专业工作最强、最高效的前沿模型。新模型在编码、计算机使用和工具搜索上达到 SOTA,并提供 1M-token 上下文窗口。
推荐理由:OpenAI 官方给出 GPT-5.4 的能力定位与 1M-token 上下文,可据此判断其在专业工作场景中的可用性。
Amazon Bedrock 推出 Stateful Runtime for Agents,为多步骤 AI 工作流提供持久编排、记忆和安全执行能力。该运行时由 OpenAI 模型驱动,可支持跨步骤保持状态的智能体应用。
OpenAI 与太平洋西北国家实验室(PNNL)联合推出 DraftNEPABench 基准,评估 AI 编程智能体加急联邦审批的能力。该基准显示,AI 有望将 NEPA(国家环境政策法)文件起草时间缩短最多 15%,推动基础设施审查现代化。