OpenAI 推出 ChatGPT Work 与 Codex 的 Admin 插件
OpenAI 推出面向 ChatGPT Work 和 Codex 的 Admin 插件。管理员可用它分析工作区使用情况、管理成员和权限、调整限额,并处理管理员请求。
OpenAI 推出面向 ChatGPT Work 和 Codex 的 Admin 插件。管理员可用它分析工作区使用情况、管理成员和权限、调整限额,并处理管理员请求。
GPT‑5.6 现已在 Kiro 中可用,帮助开发者更高效地规划、构建、审查和测试软件,并提供更好的价格性能比。
Google DeepMind 发布 Gemini 3.7 Flash,定位为其最智能的编码与智能体主力模型,距 Gemini 3.6 Flash 发布仅三周。
推荐理由:官方给出了具体基准对比和减半的引入价,读者可以据此评估 Flash 系列在编码和智能体场景的性价比变化。
Microsoft Research 发布开源框架 Orchard,核心是可复用的 Kubernetes 环境服务 Orchard Env,支持软件工程、网页导航和个人助理智能体的训练与评估,并可直接在 Codex、OpenClaw、ZeroClaw 等真实部署 harness 中训练。
推荐理由:开源框架把环境层做成可复用服务,并支持直接在真实部署 harness 中训练,为低成本研究智能体提供了可复用的路径。
IBM Research 与 UC Berkeley Sky Lab 基于开源 K-Search 框架构建结构化 CUDA 到 MLX 翻译层,用演化搜索为 Apple Silicon 生成高质量内核。
OpenAI 发布的一份领域报告显示,科学家正借助 AI 编程智能体升级科学计算,加速软件开发与科学发现,应用涵盖基因组学等领域。
Epoch 与 METR 发布 MirrorCode 基准,测试 AI 仅凭 CLI 访问重新实现完整软件的能力。
UC Berkeley BAIR 团队提出 ABBEL 框架,用自然语言信念状态替代完整交互历史作为 LLM 智能体的工作上下文,并通过 belief grading 监督摘要内容。
Google DeepMind 发布三款 Gemini Flash 系列模型。3.6 Flash 在 Artificial Analysis Index 上输出 token 用量较 3.5 Flash 减少 17%。
推荐理由:原文给出三款 Flash 模型的基准数据、定价和开放入口,读者可以据此评估升级对现有 Agent 工作流成本的影响。
Australian Payments Plus(AP+)使用 ChatGPT Enterprise 和 Codex 应对支付业务的复杂性,从而加快工作速度。该公司节省了时间、提升了质量,并保持人工判断处于核心地位。
Jack Clark 主持的 Import AI 第 464 期汇总:Fable 在 KernelBench-Mega 上以 CUDA 代码取得 18.71X 加速。
Hugging Face 推出开源基准 ScarfBench,用 Spring、Jakarta EE、Quarkus 间的迁移任务评测 AI 智能体,包含 34 个应用、102 个框架实现、204 个迁移任务、约 151K 行代码和 1,331 个专家编写测试。
Jason Liu 分享了使用 OpenAI Codex 处理长时间运行任务的经验。他利用 Codex 保存上下文、管理复杂项目,让工作在单个提示词之外持续进行。
Hugging Face 发布 agent-eval 基准工具,不只看最终答案,而是测量智能体完成任务所需的轮次、token、时间和失败情况,全部由开源模型通过 pi 编码智能体驱动并跑在 Hugging Face Jobs 上。
智谱发布旗舰模型 GLM-5.2,面向长时程任务,首次在稳定的 1M-token 上下文上交付该能力,采用 MIT 开源协议。架构上提出 IndexShare,每 4 层稀疏注意力共享一个 indexer,1M 上下文下每 token FLOPs 降低 2.9 倍,并改进 MTP 层使投机解码接受长度最多提升 20%。
推荐理由:官方技术报告给出 1M 上下文的架构改进和三项长时程基准对比,读者可以借此评估开源模型在真实编码场景的可用性。
Hugging Face 发布教程,教你把 GitHub Actions CI 任务改由 HF Jobs 执行,只需将 runs-on 改为 hf-jobs-* 标签,通过 dispatcher Space 和 GitHub App 桥接即可。
推荐理由:Hugging Face 官方给出把 GitHub Actions CI 迁到 HF Jobs 的完整步骤,并用 Trackio 实测数据说明 CPU 提速约 30% 和低成本 GPU CI 的可行路径。
Endava 正在利用 AI 智能体、ChatGPT Enterprise 和 Codex 加速软件交付,并自动化工作流程。该公司同时在整个企业范围内建设 AI 原生文化,推动 AI 融入日常研发与业务流程。
Wasmer 使用 Codex(配合 GPT-5.5)构建了一个面向边缘环境的 Node.js 运行时。该方案将开发速度提升 10x 到 20x,原本需要数月的交付缩短至数周。
OpenAI 推出 ChatGPT Sites,用户可以用 Codex 创建轻量级网站或应用。目前公开信息有限,该功能的核心用途即通过 Codex 生成这类轻量网页内容。
OpenAI 推出 Codex 插件、站点和标注功能,帮助分析师、营销人员、设计师和投资人等不同团队更高效地用 AI 完成工作。这些新能力让 Codex 覆盖更多角色与工作流场景。
OpenAI 发布《The Next Era of Knowledge Work》报告,探讨 Codex 如何通过 AI 驱动的研究、数据分析、工作流自动化和内容创作来变革生产力。报告指出 Codex 正在成为面向所有人的生产力工具。
JetBrains 发布 Mellum2,一个总参数 12B、每 token 仅激活 2.5B 的开源 Mixture-of-Experts 模型,在自然语言和代码语料上从头训练,采用 Apache 2.0 许可证。
Braintrust 工程师使用 Codex 与 GPT-5.5 将客户需求转化为代码。借助这一组合,团队能够更快地运行实验和编写代码。
Google Research 在 I/O 2026 上发布 Gemini for Science,包含基于 ERA 和 AlphaEvolve 构建的 Computational Discovery。
Mistral 发布统一智能体 Vibe,Le Chat 品牌正式升级,一个许可同时覆盖工作与编码。
推荐理由:Mistral 官方公布了 Le Chat 升级为统一智能体 Vibe 的具体能力与各端入口,读者可据此评估其在工作与编码场景中的可用性。
Endava 使用 Codex 构建智能体组织,加速软件交付,并将需求分析时间从数周缩短到数小时。
Cisco 与 OpenAI 合作,通过 Codex 重塑企业级工程。Cisco 借助 Codex 扩展 AI 原生开发,加速 AI Defense 相关工作,并实现缺陷修复自动化。
OpenAI 与 Thrive、Crete 基于 Codex 构建了能自我改进的税务智能体,实现申报自动化。该智能体提升了准确性并加快了工作流程。
Warp 使用 GPT-5.5 及 OpenAI 模型,在本地、云端和开源开发工作流中协调编码智能体。这一举措体现了 Warp 对基于 GPT-5.5 构建开源工具的重点投入。
Mistral 发布 Mistral Medium 3.5 公测版,一个 128B 稠密模型,256k 上下文窗口,SWE-Bench Verified 得分 77.6%,以修改版 MIT 许可开放权重,最少可在四块 GPU 上自托管。
推荐理由:官方发布给出基准成绩、定价和开放权重细节,读者可以据此评估其在自托管编码场景的可行性。
Mistral 发布 Studio 中的 Connectors(Public Preview),内置连接器与自定义 MCP 可通过 API/SDK 用于所有模型和 Agent 调用。
Virgin Atlantic 使用 Codex 在固定的假日出行截止期限前完成了新版移动 App 的交付。该团队借此实现了接近全覆盖的单元测试,并做到零 P1 缺陷。
OpenAI 入选 2026 年 Gartner 企业级 AI 编程智能体魔力象限领导者(Leader)。Codex 因创新性和企业级规模部署能力获得认可。
Ramp 工程师使用搭配 GPT-5.5 的 Codex 进行代码审查并发布改进,将获得实质性反馈的时间从数小时缩短到数分钟。
Google DeepMind 发布 Gemini 3.5 模型系列,首个型号 3.5 Flash 当天全量开放,3.5 Pro 预计下月推出。
推荐理由:官方正文给出具体基准分数、速度对比和开放渠道,读者可据此评估 3.5 Flash 在智能体与编码场景的实用性。
OpenAI 举办 Parameter Golf 活动,汇聚 1000+ 参与者和 2000+ 提交作品,探索 AI 辅助机器学习研究。活动在严格约束下覆盖 coding agents、量化和新型模型设计等方向。
Simplex 采用 ChatGPT Enterprise 和 Codex 提升软件开发效率,缩短了设计、构建和测试所需的时间,并扩展了 AI 驱动的工作流。
Google DeepMind 汇总 Gemini 驱动的编码智能体 AlphaEvolve 一年来的应用成果,并通过 Google Cloud 将其带给商业客户。
推荐理由:官方汇总了 AlphaEvolve 在医疗、电网、数学和商业客户中的具体成果数字,读者可以据此评估这类算法进化智能体的实际落地范围。
Singular Bank 基于 ChatGPT 和 Codex 构建了内部助手 Singularity,帮助银行家在会议准备、投资组合分析和后续跟进等工作中每天节省 60–90 分钟。
OpenAI 的 B2B Signals 研究显示,前沿企业正在深化 AI 采用、扩展基于 Codex 的智能体工作流,并由此构建可持续的竞争优势。