JetBrains 将 GPT-5 集成到其编程工具中
JetBrains 正在其编程工具中集成 GPT-5,帮助数百万开发者更快地设计、推理和构建软件。
JetBrains 正在其编程工具中集成 GPT-5,帮助数百万开发者更快地设计、推理和构建软件。
Hugging Face 博客宣布 AnyLanguageModel,一个 Swift 包,作为 Apple Foundation Models 框架的 drop-in 替代,支持多模型供应商。
推荐理由:原文解释了为何以 Apple Foundation Models API 为模板设计,并给出换 import 即切换本地或云端模型的实际用法。
OpenAI 推出面向 Codex 的 GPT-5.1-Codex-Max,定位为更快速、更智能的智能体编码模型。该模型面向长时间运行的项目级工作,具备增强的推理能力和更高的 token 效率。
推荐理由:官方说明了该模型面向长时间项目级任务定位,并强调推理与 token 效率改进,可作为选用参考。
OpenAI 发布 GPT-5.1-CodexMax 系统卡,介绍其配套安全措施。模型层面包括针对有害任务和提示词注入的专项安全训练;产品层面包括 agent 沙箱和可配置的网络访问权限。
Google DeepMind 发布 Gemini 3,称 Gemini 3 Pro 为其最智能模型,在各大基准上超越此前的 2.5 Pro。
推荐理由:官方发布给出了 Gemini 3 Pro 的基准成绩、API 定价和新工具入口,开发者可以直接评估是否迁移到现有编码与智能体工作流。
Google DeepMind 发布 Gemini 3,先以 Gemini 3 Pro 预览版形式推出,并预告增强推理模式 Gemini 3 Deep Think。
推荐理由:官方发布给出完整基准成绩和覆盖入口,读者可据此判断 Gemini 3 Pro 的推理与编码能力以及它如何嵌入现有工具链。
Google DeepMind 推出智能体开发平台 Google Antigravity,包含 AI IDE 式 Editor 界面和面向异步协作的 Manager 界面,支持智能体自主规划并执行端到端软件任务。
推荐理由:官方宣布了 Antigravity 的产品形态、免费预览和可用模型,读者可据此评估它对现有开发流程的影响。
OpenAI 宣布 GPT-5.1 在 API 中可用,带来更快的自适应推理、扩展的提示词缓存和更好的编码性能,并新增 apply_patch 与 shell 工具。
推荐理由:官方说明 GPT-5.1 API 版的能力变化点,开发者可以据此判断是否迁移现有调用。
OpenAI 推出 Aardvark,一个能自主发现、验证并协助修复软件漏洞的 AI 安全研究员。该系统目前处于 private beta 阶段,用户可报名参加早期测试。
BigCode 发布 BigCodeArena,一个通过真实执行来评判代码生成模型的人类投票平台,支持 10 种语言和 8 种执行环境,开放无需注册。上线 5 个月收集 14K 对话、4700+ 偏好投票,Elo 排名中 o3-mini 和 o1-mini 居首。
推荐理由:基于5个月社区执行评估数据发布代码生成评测平台,给出分语言和执行环境的模型表现差异与两个新基准。
OpenAI 宣布 Codex 正式可用,面向开发者推出多项新功能,包括 Slack 集成、Codex SDK,以及用量看板和工作区管理等管理员工具。这些更新让 Codex 在大规模使用下更易用、更易管理。
推荐理由:官方宣布 Codex 正式可用并列出新增的集成与管控能力,团队读者可以据此评估它在规模化使用中的适用性。
作者发布 VibeGame,一个建立在 three.js、rapier 和 bitecs 之上、面向 AI 辅助游戏开发的高层声明式游戏引擎。
推荐理由:作者先实测 Roblox、Unity 和 web 三条 vibe coding 游戏路线,再据此设计出兼顾抽象与开放性的引擎,方法可迁移。
OpenAI 宣布对 Codex 进行升级,使其速度更快、更可靠,并改进实时协作与独立完成任务的能力。用户可在终端、IDE、网页端甚至手机上使用升级后的 Codex。
OpenAI 在 GPT-5 系统卡附录中发布新模型 GPT-5-Codex,是针对 Codex 中智能体编码进一步优化的 GPT-5 版本。该模型会根据任务复杂度更动态地调整思考力度,简单对话或小任务快速响应,复杂任务则可独立长时间工作。
推荐理由:原文说明新模型在思考力度上按任务复杂度动态调整,读者可了解其与 GPT-5 在编码场景下的差异。
Numina 与 Kimi 开源 kimina-prover-rl,一个基于 DeepSeek-R1 推理范式、与 Verl 完全兼容的 Lean 4 形式化定理证明训练管线,采用 GRPO 强化学习并配套 kimina-lean-server 验证服务。
OpenAI 在 API 平台推出 GPT-5,面向开发者提供高推理性能和新的控制选项。该模型在真实编码任务上取得同类领先的评测结果。
推荐理由:OpenAI 官方宣布 GPT-5 上线 API,读者可以据此了解其在推理和编码任务上的定位以及面向开发者的新控制能力。
OpenAI 发文称 GPT-5 是其最先进的模型,将变革企业级 AI、自动化与劳动力生产力。文章把 GPT-5 定位为智能工作新纪元的核心驱动力,聚焦企业场景下的自动化与工作效率提升。
GPT-5 为编码与设计带来了新的可能性。OpenAI 介绍了如何利用 GPT-5 在这两个领域开展相关工作,展示其在编程和设计任务上的能力。
OpenAI 发布 GPT-5,称其是目前最好的 AI 系统,智能水平较此前所有模型有显著跃升。GPT-5 在编码、数学、写作、健康、视觉感知等领域具有领先表现。
推荐理由:OpenAI 官方宣布 GPT-5 发布,可借此了解其在编码、数学、写作等多项能力上的定位。
OpenAI 发布文章介绍 Cursor 如何使用 GPT-5。原文仅说明“了解 Cursor 如何使用 GPT-5”,未提供更多细节。
Hugging Face 推出 3LM,首个针对阿拉伯语 LLM 评测 STEM 与代码生成的多组件基准,包含 865 道原生 STEM 选择题、1,744 道合成高难度题,以及由 HumanEval+ 和 MBPP+ 翻译的阿拉伯语代码数据集。
Mistral AI 发布 Codestral 25.08,并整合 Codestral Embed、Devstral 和 Mistral Code IDE 插件形成面向企业的完整编码栈。
Mistral AI 与 All Hands AI 合作推出 Devstral Medium,并升级 Devstral Small 1.1。
推荐理由:原文给出两款新模型的 SWE-Bench Verified 分数、许可证与定价,可据此比较成本与代码智能体能力。
Mistral 发布 Mistral Code,一款面向企业开发团队的 AI 编程助手,基于开源项目 Continue 打造,今日面向 JetBrains IDE 和 VSCode 开放 private beta,GA 即将推出。
Mistral 发布首款代码专用嵌入模型 Codestral Embed,性能超越 Voyage Code 3、Cohere Embed v4.0 和 OpenAI 的大型嵌入模型。
CodeRabbit 使用 OpenAI 的 o3、o4-mini 和 GPT-4.1 模型改进代码审查,提升审查准确性并加快 PR 合并速度,帮助开发者以更少的 bug 更快交付代码,获得更高回报。
Mistral AI 与 All Hands AI 联合发布面向软件工程任务的智能体模型 Devstral,以 Apache 2.0 许可开源,在 SWE-Bench Verified 上取得 46.8%,超过此前开源 SoTA 6 个百分点以上,并超越 GPT-4.1-mini 超过 20%。
推荐理由:原文给出 SWE-Bench Verified 具体分数和部署门槛,可判断这款开源编码模型在本地与隐私场景的可行性。
OpenAI 在 o3 和 o4-mini 系统卡附录中介绍云端编码智能体 Codex,底层为针对软件工程优化的 o3 版本 codex-1。该模型通过强化学习在多种环境的真实编码任务上训练,生成贴近人类风格和 PR 偏好的代码,精确遵循指令,并迭代运行测试直至通过。
推荐理由:原文说明了 codex-1 的训练方式与目标能力,读者可以了解 Codex 与一般代码补全的区别。
Mistral AI 发布 Mistral Medium 3,在多项基准上达到或超过 Claude Sonnet 3.7 的 90% 表现,定价为 $0.4 输入 / $2 输出每 M token,并称超越 Llama 4 Maverick 与 Cohere Command A。
推荐理由:官方给出与 Claude Sonnet 3.7 对比的基准成绩、定价和部署选项,读者可据此评估企业落地的性价比。
Hugging Face 发布 Tiny Agents 教程,展示在 InferenceClient 之上实现 MCP 客户端后,Agent 本质上只是一个 while 循环,全部代码约 50 行 TypeScript。
推荐理由:作者把 MCP 客户端到 Agent 的实现压缩成约 50 行 TypeScript,并提供可运行的开源代码,适合想理解 Agent 与 MCP 基本结构的开发者直接上手。
OpenAI 在 API 中发布 GPT-4.1 系列模型,在编码、指令遵循和长上下文理解方面有显著提升,同时发布其首个 nano 模型,即日起面向全球开发者开放。
推荐理由:官方宣布 GPT-4.1 系列上线 API,编码、指令遵循与长上下文能力全面提升,还推出了首个 nano 模型。
DeepSeek-V3 更新版 0324 上架 Hugging Face Hub,架构与原版相同并改为 MIT 许可,重点改进指令遵循、代码与数学能力。官方基准显示 MMLU-Pro 75.9→81.2、AIME 39.6→59.4、LiveCodeBench 39.2→49.2,常与 GPT-4.5 相当、普遍强于 Claude-Sonnet-3.7。
推荐理由:原文汇总了基准对比、能力改进细节和多种本地部署路径,读者可据此评估是否在自己的工作流中替换旧版 V3。
Hugging Face 发布教程,讲解如何用 LM Studio、4bit GGUF 量化的 OlympicCoder 7B 和 VS Code 的 Continue 扩展搭建本地编码助手。
推荐理由:原文给出从 LM Studio 到 VS Code 的完整本地部署步骤,并说明 OlympicCoder 适合竞赛类编码的定位,方法可直接照做。
Hugging Face 在 Open R1 第三次更新中发布了从 DeepSeek-R1 蒸馏的 CodeForces-CoTs 数据集(近 10 万样本)、2024 年 IOI 题目构成的 IOI 基准,以及基于 Qwen2.5 Coder 微调的 OlympicCoder-7B 和 OlympicCoder-32B。
推荐理由:Hugging Face 官方复盘训练过程,给出样本打包、学习率等可复用经验,并附带完整数据集、基准和评测代码。
OpenAI 借助其 AI 工具将工程周期加速 20%。这一效率提升可帮助工程团队缩短开发迭代时间,加快产品交付节奏。
OpenAI 推出 SWE-Lancer 基准,将真实自由职业软件工程任务转化为 LLM 评测,总价值 100 万美元,考察前沿模型能否赚取这笔报酬。该基准用真实 Upwork 工程任务衡量模型的实际编程能力。
Mistral AI 发布 Codestral 25.01,采用更高效的架构和改进的 tokenizer,代码生成与补全速度提升约 2 倍,上下文长度达 256k。
Answer.AI 与 LightOn 联合发布 ModernBERT 编码器模型系列,提供 base(149M 参数)和 large(395M 参数)两个规格,可作为 BERT 类模型的直接替代。
推荐理由:Answer.AI 与 LightOn 官方发布,作者本人阐述了架构与训练改动,读者可据此评估它能否替换现有 BERT 类工作流。
TII 发布 Falcon3 开源模型家族,包含 Falcon3-1B-Base、3B、7B、10B 和 Mamba-7B 五个基座模型,均低于 10B 参数。
Hugging Face 博客作者搭建了一个 Keras chatbot arena,用 Gradio、Spaces、JAX 和 TPU 测试 LLM 在对话中被指出错误后能否自行修复。