Google DeepMind 发布 Gemini 4 Argon,输出上限达 1M token
Google DeepMind 发布 Gemini 4 Argon,面向编码、企业知识工作与网络防御,宣称在 19 项基准中的 13 项排名第一,输出上限从 64K 提升至 1M(通过 Long Decode Continuation 实现)。
推荐理由:汇总了 Gemini 4 Argon 的基准成绩、定价与获取限制,并保留独立评测和质疑声音,读者可据此平衡官方宣传。
Google DeepMind 发布 Gemini 4 Argon,面向编码、企业知识工作与网络防御,宣称在 19 项基准中的 13 项排名第一,输出上限从 64K 提升至 1M(通过 Long Decode Continuation 实现)。
推荐理由:汇总了 Gemini 4 Argon 的基准成绩、定价与获取限制,并保留独立评测和质疑声音,读者可据此平衡官方宣传。
Google 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind 计划向可信网络防御者和内部团队开放,再逐步向开发者、企业和消费者开放,暂未给出日期。
推荐理由:文章汇总独立评测、定价和灰度策略,显示 Argon 缩小与头部差距但在 token 效率上仍有代价。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络防御者开放,后续面向开发者、企业和消费者推出。
推荐理由:官方公布的能力、价格与安全机制信息完整,读者可以据此判断 Gemini 4 Argon 在编码、知识工作和网防上的实际变化。
OpenAI 在 DevDay 2026 发布常驻智能体 Dots(由 GPT-6 Astra 驱动,连接 4000+ 应用)、GPT-6.1 Sol(价格约为 Astra 的 1/5。
OpenAI 发布 GPT-6.1 Sol,面向编码、计算机操作和专业工作,提供接近 Astra 的智能水平,标准 API 输入与输出 token 价格为 Astra 的五分之一。
推荐理由:官方宣布 GPT-6.1 Sol 以约五分之一的价格提供接近 Astra 的能力,读者可据此评估编码与办公场景的成本取舍。
Claude Opus 5.5 本周发布,社区反响热烈,尤其被认为擅长制作解释视频。它在 SimpleBench 上以 88.4% 领跑,视觉评测被评为 Anthropic 迄今最佳视觉模型,成本比 Fable 5.1 低约 60%。此外,GPT-6 系列、Gemini 3.8 Flash、小米 MiMo-V2.6-Pro(MIT 开源、1M 上下文)等同周亮相。
Anthropic 发布 Claude Sonnet 5.5,官方称速度提升 30% 以上、多数工作成本降低最多 30%,定价与 Sonnet 5 相同但在各基准上更优。
AWS 宣布 Claude Sonnet 5.5 可在 Amazon Bedrock 和 Claude Platform on AWS(北美)使用,大多数任务成本更低、速度更快。
推荐理由:原文给出 Claude Sonnet 5.5 在 Amazon Bedrock 的接入方式、适用场景与 Opus 5.5 分工建议,读者可据此规划云端部署与成本。
Anthropic 发布 Claude Opus 5.5,称多数任务达到 Fable 5.1 水平、比 Opus 5 快约 30%,token 定价从 $5/$25 降至 $4/$20,并成为 Claude Code 和 Claude 应用的默认模型;Sonnet 5.5 和 Haiku 5.5 将在未来数周推出。
推荐理由:文章汇总了 Opus 5.5 的定价、跑分与争议,并对照 GPT-6 Sol/Luna,帮助读者理解两家降价背后的真实成本结构。
Anthropic 于 9 月 22 日发布 Claude Opus 5.5,约一小时后 OpenAI 发布 GPT-6 Sol 与 GPT-6 Luna,掀起价格战。
推荐理由:作者第一时间用同一套 pelican 测试实测三家新模型,并整理了完整价格对照表,读者可据此比较各家定价与实际表现。
Latent Space 采访 TypeSafe AI CEO Diogo Almeida,讨论其发布的 System One 模型 Jev,该模型主打面向软件而非聊天的可编程 AI,以 intelligence per dollar 为优化目标。
Google DeepMind 发布 Gemini 3.8 Flash 和 3.8 Flash Cyber,称其为迄今最佳推理与编码模型,定价与 3.7 Flash 相同(每百万输入 token $0.75、输出 $3.75)。
推荐理由:官方公布了两个变体的基准数字、定价和 Cyber 版的申请入口,读者可据此评估升级成本与实际收益。
GPT‑5.6 现已在 Kiro 中可用,帮助开发者更高效地规划、构建、审查和测试软件,并提供更好的价格性能比。
Google DeepMind 发布 Gemini 3.7 Flash,定位为其最智能的编码与智能体主力模型,距 Gemini 3.6 Flash 发布仅三周。
推荐理由:官方给出了具体基准对比和减半的引入价,读者可以据此评估 Flash 系列在编码和智能体场景的性价比变化。
Google DeepMind 发布三款 Gemini Flash 系列模型。3.6 Flash 在 Artificial Analysis Index 上输出 token 用量较 3.5 Flash 减少 17%。
推荐理由:原文给出三款 Flash 模型的基准数据、定价和开放入口,读者可以据此评估升级对现有 Agent 工作流成本的影响。
智谱发布旗舰模型 GLM-5.2,面向长时程任务,首次在稳定的 1M-token 上下文上交付该能力,采用 MIT 开源协议。架构上提出 IndexShare,每 4 层稀疏注意力共享一个 indexer,1M 上下文下每 token FLOPs 降低 2.9 倍,并改进 MTP 层使投机解码接受长度最多提升 20%。
推荐理由:官方技术报告给出 1M 上下文的架构改进和三项长时程基准对比,读者可以借此评估开源模型在真实编码场景的可用性。
JetBrains 发布 Mellum2,一个总参数 12B、每 token 仅激活 2.5B 的开源 Mixture-of-Experts 模型,在自然语言和代码语料上从头训练,采用 Apache 2.0 许可证。
Mistral 发布 Mistral Medium 3.5 公测版,一个 128B 稠密模型,256k 上下文窗口,SWE-Bench Verified 得分 77.6%,以修改版 MIT 许可开放权重,最少可在四块 GPU 上自托管。
推荐理由:官方发布给出基准成绩、定价和开放权重细节,读者可以据此评估其在自托管编码场景的可行性。
Google DeepMind 发布 Gemini 3.5 模型系列,首个型号 3.5 Flash 当天全量开放,3.5 Pro 预计下月推出。
推荐理由:官方正文给出具体基准分数、速度对比和开放渠道,读者可据此评估 3.5 Flash 在智能体与编码场景的实用性。
OpenAI 推出 GPT-5.4 mini 和 nano,是 GPT-5.4 更小、更快的版本。两款模型针对编程、工具调用、多模态推理进行了优化,适用于高并发的 API 与子智能体工作负载。
Mistral 发布 Mistral Small 4,首次将 Magistral 的推理、Pixtral 的多模态和 Devstral 的编码能力统一到单一模型,采用 Apache 2.0 许可开源。
推荐理由:官方宣布 Small 家系统一推理、多模态与编码能力,并给出架构参数和推理效率对比,便于评估开源部署性价比。
Mistral 发布 Leanstral,称其为首个面向 Lean 4 的开源代码智能体,权重采用 Apache 2.0 许可证,提供 120B-A6B 稀疏架构(6B 激活参数),并集成于 Mistral Vibe 及免费 API 端点 labs-leanstral-2603。
OpenAI 发布 GPT-5.4,称其为面向专业工作最强、最高效的前沿模型。新模型在编码、计算机使用和工具搜索上达到 SOTA,并提供 1M-token 上下文窗口。
推荐理由:OpenAI 官方给出 GPT-5.4 的能力定位与 1M-token 上下文,可据此判断其在专业工作场景中的可用性。
OpenAI 发布首个实时编码模型 GPT-5.3-Codex-Spark,生成速度提升 15x,支持 128k 上下文。模型以研究预览形式向 ChatGPT Pro 用户开放。
推荐理由:OpenAI 官方公布实时编码模型的速度与上下文规格及试用范围,正在用该模型的用户可据此评估是否切换。
OpenAI 推出 GPT-5.3-Codex,一个 Codex 原生智能体,将前沿编码能力与通用推理相结合,用于支持长周期、真实世界的技术工作。
OpenAI 发布 GPT-5.3-Codex,称其为迄今最强的智能体编码模型。它结合了 GPT-5.2-Codex 的前沿编码能力与 GPT-5.2 的推理和专业知识能力。
OpenAI 发布 GPT-5.2-Codex,称其为目前最先进的编码模型。该模型主打长程推理、大规模代码变换和增强的网络安全能力。
推荐理由:官方说明点出长程推理、大规模代码改造与安全能力三个方向,可作为评估其编码定位的基本参照。
OpenAI 发布 GPT-5.2,定位为面向日常专业工作的最先进前沿模型,具备推理、长上下文理解、编码和视觉能力。用户可在 ChatGPT 和 OpenAI API 中使用,以驱动更快、更可靠的智能体工作流。
推荐理由:OpenAI 官方说明 GPT-5.2 的能力定位和可用入口,读者可以据此判断是否将其纳入日常工作流。
Mistral AI 发布开源编码模型 Devstral 2(123B)和 Devstral Small 2(24B),SWE-bench Verified 分别取得 72.2% 和 68.0%,并推出开源终端编码智能体 Mistral Vibe CLI。
推荐理由:官方公布两个尺寸开源编码模型的基准成绩、许可与部署门槛,并同步开放终端 CLI,读者可评估其替代现有方案的成本。
OpenAI 推出面向 Codex 的 GPT-5.1-Codex-Max,定位为更快速、更智能的智能体编码模型。该模型面向长时间运行的项目级工作,具备增强的推理能力和更高的 token 效率。
推荐理由:官方说明了该模型面向长时间项目级任务定位,并强调推理与 token 效率改进,可作为选用参考。
OpenAI 发布 GPT-5.1-CodexMax 系统卡,介绍其配套安全措施。模型层面包括针对有害任务和提示词注入的专项安全训练;产品层面包括 agent 沙箱和可配置的网络访问权限。
Google DeepMind 发布 Gemini 3,称 Gemini 3 Pro 为其最智能模型,在各大基准上超越此前的 2.5 Pro。
推荐理由:官方发布给出了 Gemini 3 Pro 的基准成绩、API 定价和新工具入口,开发者可以直接评估是否迁移到现有编码与智能体工作流。
Google DeepMind 发布 Gemini 3,先以 Gemini 3 Pro 预览版形式推出,并预告增强推理模式 Gemini 3 Deep Think。
推荐理由:官方发布给出完整基准成绩和覆盖入口,读者可据此判断 Gemini 3 Pro 的推理与编码能力以及它如何嵌入现有工具链。
OpenAI 宣布 GPT-5.1 在 API 中可用,带来更快的自适应推理、扩展的提示词缓存和更好的编码性能,并新增 apply_patch 与 shell 工具。
推荐理由:官方说明 GPT-5.1 API 版的能力变化点,开发者可以据此判断是否迁移现有调用。
OpenAI 在 GPT-5 系统卡附录中发布新模型 GPT-5-Codex,是针对 Codex 中智能体编码进一步优化的 GPT-5 版本。该模型会根据任务复杂度更动态地调整思考力度,简单对话或小任务快速响应,复杂任务则可独立长时间工作。
推荐理由:原文说明新模型在思考力度上按任务复杂度动态调整,读者可了解其与 GPT-5 在编码场景下的差异。
Numina 与 Kimi 开源 kimina-prover-rl,一个基于 DeepSeek-R1 推理范式、与 Verl 完全兼容的 Lean 4 形式化定理证明训练管线,采用 GRPO 强化学习并配套 kimina-lean-server 验证服务。
OpenAI 在 API 平台推出 GPT-5,面向开发者提供高推理性能和新的控制选项。该模型在真实编码任务上取得同类领先的评测结果。
推荐理由:OpenAI 官方宣布 GPT-5 上线 API,读者可以据此了解其在推理和编码任务上的定位以及面向开发者的新控制能力。
OpenAI 发文称 GPT-5 是其最先进的模型,将变革企业级 AI、自动化与劳动力生产力。文章把 GPT-5 定位为智能工作新纪元的核心驱动力,聚焦企业场景下的自动化与工作效率提升。
OpenAI 发布 GPT-5,称其是目前最好的 AI 系统,智能水平较此前所有模型有显著跃升。GPT-5 在编码、数学、写作、健康、视觉感知等领域具有领先表现。
推荐理由:OpenAI 官方宣布 GPT-5 发布,可借此了解其在编码、数学、写作等多项能力上的定位。
Mistral AI 发布 Codestral 25.08,并整合 Codestral Embed、Devstral 和 Mistral Code IDE 插件形成面向企业的完整编码栈。