OpenAI 发布实时编码模型 GPT-5.3-Codex-Spark
OpenAI 发布首个实时编码模型 GPT-5.3-Codex-Spark,生成速度提升 15x,支持 128k 上下文。模型以研究预览形式向 ChatGPT Pro 用户开放。
推荐理由:OpenAI 官方公布实时编码模型的速度与上下文规格及试用范围,正在用该模型的用户可据此评估是否切换。
OpenAI 发布首个实时编码模型 GPT-5.3-Codex-Spark,生成速度提升 15x,支持 128k 上下文。模型以研究预览形式向 ChatGPT Pro 用户开放。
推荐理由:OpenAI 官方公布实时编码模型的速度与上下文规格及试用范围,正在用该模型的用户可据此评估是否切换。
OpenAI 技术成员 Ryan Lopopolo 撰文介绍如何在智能体优先的开发模式中利用 Codex,阐述 harness 工程的实践方法。文章来自 OpenAI News,面向希望将 Codex 融入智能体化工作流的工程团队。 (注:正文仅提供了作者署名,摘要主要基于原始标题与来源信息,未添加原文未提及的细节。)
OpenAI 推出 GPT-5.3-Codex,一个 Codex 原生智能体,将前沿编码能力与通用推理相结合,用于支持长周期、真实世界的技术工作。
OpenAI 发布 GPT-5.3-Codex,称其为迄今最强的智能体编码模型。它结合了 GPT-5.2-Codex 的前沿编码能力与 GPT-5.2 的推理和专业知识能力。
OpenAI 介绍 Codex App Server,这是一个双向 JSON-RPC API,用于嵌入 Codex 智能体。该 API 支持流式进度、工具调用、审批和 diffs。
OpenAI 发布面向 macOS 的 Codex app,定位为 AI 编码与软件开发的指挥中心。它支持多个智能体协作、并行工作流和长时间运行的任务。
推荐理由:官方介绍 macOS 版 Codex app 的定位,涵盖多智能体、并行工作流和长时任务,可帮助读者判断它与现有编码工具的关系。
Hugging Face 发布 upskill 工具,用 Claude Opus 4.5 生成和评估 agent 技能,再供更小、更便宜或本地模型使用。流程为用 Claude Code 完成任务并导出 trace、从 trace 生成 SKILL.md 技能文件并自动生成测试用例,然后用 upskill eval 对比模型有无技能的表现。
推荐理由:原文给出了用大模型生成技能再迁移到小模型的完整流程和实测数字,方法可直接复用于领域任务。
Mistral 发布 Mistral Vibe 2.0,升级其终端原生编码智能体,由 Devstral 2 模型家族驱动,新增自定义 subagent、多选澄清、斜杠命令技能和统一 agent 模式,CLI 持续自动更新。
推荐理由:官方公布 Vibe 2.0 的新增控制能力与 Devstral 2 转付费后的具体价格,读者可据此评估团队编码工作流的成本与用法。
Datadog 使用 OpenAI 的 Codex 对系统级代码进行审查。目前公开信息仅包含 OpenAI 与 Datadog 的品牌联合图片及该合作用途,具体实施细节与效果数据尚未公布。
Google 回顾 2025 年在 Google、Google DeepMind 和 Google Research 取得的研究进展:3 月发布 Gemini 2.5。
OpenAI 发布 GPT-5.2-Codex,称其为目前最先进的编码模型。该模型主打长程推理、大规模代码变换和增强的网络安全能力。
推荐理由:官方说明点出长程推理、大规模代码改造与安全能力三个方向,可作为评估其编码定位的基本参照。
OpenAI 仅用 28 天就发布了 Android 版 Sora,全程借助 Codex 完成。团队通过 AI 辅助规划、翻译以及并行编码工作流,以小团队实现了快速、可靠的开发。
Hugging Face 发布教程,展示如何用 Hugging Face Skills 让 OpenAI Codex 端到端完成机器学习实验,覆盖数据验证、硬件选择、提交 Hugging Face Jobs、用 Trackio 监控训练、维护训练报告以及用 lighteval 评测。
推荐理由:官方教程给出让 Codex 端到端跑完微调、评测和 GGUF 导出的完整流程与成本参考,方法可直接迁移到自己的实验。
OpenAI 发布 GPT-5.2,定位为面向日常专业工作的最先进前沿模型,具备推理、长上下文理解、编码和视觉能力。用户可在 ChatGPT 和 OpenAI API 中使用,以驱动更快、更可靠的智能体工作流。
推荐理由:OpenAI 官方说明 GPT-5.2 的能力定位和可用入口,读者可以据此判断是否将其纳入日常工作流。
Mistral AI 发布开源编码模型 Devstral 2(123B)和 Devstral Small 2(24B),SWE-bench Verified 分别取得 72.2% 和 68.0%,并推出开源终端编码智能体 Mistral Vibe CLI。
推荐理由:官方公布两个尺寸开源编码模型的基准成绩、许可与部署门槛,并同步开放终端 CLI,读者可评估其替代现有方案的成本。
Hugging Face 推出 hf-llm-trainer 技能,让 Claude Code、Codex、Gemini CLI 等编码智能体可自动选择 GPU、生成脚本、向 Hugging Face Jobs 提交微调任务并用 Trackio 监控进度,完成后模型自动推送到 Hub。
推荐理由:官方发布了让 Claude Code 等编码智能体端到端微调开源模型的 hf-llm-trainer 技能,覆盖 GPU 选择、任务提交到监控的完整流程。
JetBrains 正在其编程工具中集成 GPT-5,帮助数百万开发者更快地设计、推理和构建软件。
Hugging Face 博客宣布 AnyLanguageModel,一个 Swift 包,作为 Apple Foundation Models 框架的 drop-in 替代,支持多模型供应商。
推荐理由:原文解释了为何以 Apple Foundation Models API 为模板设计,并给出换 import 即切换本地或云端模型的实际用法。
OpenAI 推出面向 Codex 的 GPT-5.1-Codex-Max,定位为更快速、更智能的智能体编码模型。该模型面向长时间运行的项目级工作,具备增强的推理能力和更高的 token 效率。
推荐理由:官方说明了该模型面向长时间项目级任务定位,并强调推理与 token 效率改进,可作为选用参考。
OpenAI 发布 GPT-5.1-CodexMax 系统卡,介绍其配套安全措施。模型层面包括针对有害任务和提示词注入的专项安全训练;产品层面包括 agent 沙箱和可配置的网络访问权限。
Google DeepMind 发布 Gemini 3,称 Gemini 3 Pro 为其最智能模型,在各大基准上超越此前的 2.5 Pro。
推荐理由:官方发布给出了 Gemini 3 Pro 的基准成绩、API 定价和新工具入口,开发者可以直接评估是否迁移到现有编码与智能体工作流。
Google DeepMind 发布 Gemini 3,先以 Gemini 3 Pro 预览版形式推出,并预告增强推理模式 Gemini 3 Deep Think。
推荐理由:官方发布给出完整基准成绩和覆盖入口,读者可据此判断 Gemini 3 Pro 的推理与编码能力以及它如何嵌入现有工具链。
Google DeepMind 推出智能体开发平台 Google Antigravity,包含 AI IDE 式 Editor 界面和面向异步协作的 Manager 界面,支持智能体自主规划并执行端到端软件任务。
推荐理由:官方宣布了 Antigravity 的产品形态、免费预览和可用模型,读者可据此评估它对现有开发流程的影响。
OpenAI 宣布 GPT-5.1 在 API 中可用,带来更快的自适应推理、扩展的提示词缓存和更好的编码性能,并新增 apply_patch 与 shell 工具。
推荐理由:官方说明 GPT-5.1 API 版的能力变化点,开发者可以据此判断是否迁移现有调用。
OpenAI 推出 Aardvark,一个能自主发现、验证并协助修复软件漏洞的 AI 安全研究员。该系统目前处于 private beta 阶段,用户可报名参加早期测试。
BigCode 发布 BigCodeArena,一个通过真实执行来评判代码生成模型的人类投票平台,支持 10 种语言和 8 种执行环境,开放无需注册。上线 5 个月收集 14K 对话、4700+ 偏好投票,Elo 排名中 o3-mini 和 o1-mini 居首。
推荐理由:基于5个月社区执行评估数据发布代码生成评测平台,给出分语言和执行环境的模型表现差异与两个新基准。
OpenAI 宣布 Codex 正式可用,面向开发者推出多项新功能,包括 Slack 集成、Codex SDK,以及用量看板和工作区管理等管理员工具。这些更新让 Codex 在大规模使用下更易用、更易管理。
推荐理由:官方宣布 Codex 正式可用并列出新增的集成与管控能力,团队读者可以据此评估它在规模化使用中的适用性。
作者发布 VibeGame,一个建立在 three.js、rapier 和 bitecs 之上、面向 AI 辅助游戏开发的高层声明式游戏引擎。
推荐理由:作者先实测 Roblox、Unity 和 web 三条 vibe coding 游戏路线,再据此设计出兼顾抽象与开放性的引擎,方法可迁移。
OpenAI 宣布对 Codex 进行升级,使其速度更快、更可靠,并改进实时协作与独立完成任务的能力。用户可在终端、IDE、网页端甚至手机上使用升级后的 Codex。
OpenAI 在 GPT-5 系统卡附录中发布新模型 GPT-5-Codex,是针对 Codex 中智能体编码进一步优化的 GPT-5 版本。该模型会根据任务复杂度更动态地调整思考力度,简单对话或小任务快速响应,复杂任务则可独立长时间工作。
推荐理由:原文说明新模型在思考力度上按任务复杂度动态调整,读者可了解其与 GPT-5 在编码场景下的差异。
Numina 与 Kimi 开源 kimina-prover-rl,一个基于 DeepSeek-R1 推理范式、与 Verl 完全兼容的 Lean 4 形式化定理证明训练管线,采用 GRPO 强化学习并配套 kimina-lean-server 验证服务。
OpenAI 在 API 平台推出 GPT-5,面向开发者提供高推理性能和新的控制选项。该模型在真实编码任务上取得同类领先的评测结果。
推荐理由:OpenAI 官方宣布 GPT-5 上线 API,读者可以据此了解其在推理和编码任务上的定位以及面向开发者的新控制能力。
OpenAI 发文称 GPT-5 是其最先进的模型,将变革企业级 AI、自动化与劳动力生产力。文章把 GPT-5 定位为智能工作新纪元的核心驱动力,聚焦企业场景下的自动化与工作效率提升。
GPT-5 为编码与设计带来了新的可能性。OpenAI 介绍了如何利用 GPT-5 在这两个领域开展相关工作,展示其在编程和设计任务上的能力。
OpenAI 发布 GPT-5,称其是目前最好的 AI 系统,智能水平较此前所有模型有显著跃升。GPT-5 在编码、数学、写作、健康、视觉感知等领域具有领先表现。
推荐理由:OpenAI 官方宣布 GPT-5 发布,可借此了解其在编码、数学、写作等多项能力上的定位。
OpenAI 发布文章介绍 Cursor 如何使用 GPT-5。原文仅说明“了解 Cursor 如何使用 GPT-5”,未提供更多细节。
Hugging Face 推出 3LM,首个针对阿拉伯语 LLM 评测 STEM 与代码生成的多组件基准,包含 865 道原生 STEM 选择题、1,744 道合成高难度题,以及由 HumanEval+ 和 MBPP+ 翻译的阿拉伯语代码数据集。
Mistral AI 发布 Codestral 25.08,并整合 Codestral Embed、Devstral 和 Mistral Code IDE 插件形成面向企业的完整编码栈。
Mistral AI 与 All Hands AI 合作推出 Devstral Medium,并升级 Devstral Small 1.1。
推荐理由:原文给出两款新模型的 SWE-Bench Verified 分数、许可证与定价,可据此比较成本与代码智能体能力。
Mistral 发布 Mistral Code,一款面向企业开发团队的 AI 编程助手,基于开源项目 Continue 打造,今日面向 JetBrains IDE 和 VSCode 开放 private beta,GA 即将推出。