跳到正文

全部动态

今日 4 条
2月13日周五
  1. OpenAI News65

    GPT-5.2 推导出理论物理新结果

    OpenAI 发布预印本,显示 GPT-5.2 提出了一个新的 gluon amplitude(胶子振幅)公式,该公式随后由 OpenAI 与学术合作者正式证明和验证。

    推荐理由:模型提出的新物理公式经学术合作者证明与验证,可作为前沿模型科研能力的具体例证。

2月12日周四
  1. OpenAI News62

    OpenAI 发布实时编码模型 GPT-5.3-Codex-Spark

    OpenAI 发布首个实时编码模型 GPT-5.3-Codex-Spark,生成速度提升 15x,支持 128k 上下文。模型以研究预览形式向 ChatGPT Pro 用户开放。

    推荐理由:OpenAI 官方公布实时编码模型的速度与上下文规格及试用范围,正在用该模型的用户可据此评估是否切换。

2月10日周二
  1. Google DeepMind80

    Google DeepMind 发布两篇论文,展示 Gemini Deep Think 在数学与科学研究中的应用

    Google DeepMind 发布两篇论文,介绍 Gemini Deep Think 在专家指导下解决数学、物理和计算机科学的专业研究问题。其数学研究智能体 Aletheia 配备自然语言验证器并可承认失败,在 IMO-ProofBench Advanced 上最高得分 90%,并自主解决 Bloom's Erdős 猜想数据库中的四个开放问题,包括 Erdős-1051。

    推荐理由:原文给出两篇论文的具体成果和方法细节,读者可以了解 AI 辅助科研的实际边界与协作模式。

2月5日周四
2月4日周三
1月29日周四
1月20日周二
1月16日周五
1月13日周二
1月6日周二
1月5日周一
12月23日周二
12月18日周四
  1. OpenAI News72

    OpenAI 发布 GPT-5.2-Codex 编码模型

    OpenAI 发布 GPT-5.2-Codex,称其为目前最先进的编码模型。该模型主打长程推理、大规模代码变换和增强的网络安全能力。

    推荐理由:官方说明点出长程推理、大规模代码改造与安全能力三个方向,可作为评估其编码定位的基本参照。

12月17日周三
  1. Mistral AI63

    Mistral 发布 Mistral OCR 3,文档解析胜率较 Mistral OCR 2 达 74%

    Mistral AI 发布 Mistral OCR 3,在表单、扫描件、复杂表格和手写内容上对 Mistral OCR 2 的整体胜率为 74%。模型(mistral-ocr-2512)定价 $2/1000 页,Batch-API 半价至 $1/1000 页,输出支持带 HTML 表格重建的 markdown,并可拖拽 PDF/图片解析为文本或结构化 JSON。

    推荐理由:官方给出与上一代的胜率对比、定价和接入方式,读者可以据此评估它在文档解析流程中的成本与适用性。

12月13日周六
  1. Google DeepMind66

    Google DeepMind 发布升级版 Gemini 2.5 Flash Native Audio,推出实时语音翻译

    Google DeepMind 发布面向实时语音 Agent 的更新版 Gemini 2.5 Flash Native Audio,提升函数调用、指令遵循与多轮对话能力,在 ComplexFuncBench Audio 上得分 71.5%,开发者指令遵循率从 84% 升至 90%。

    推荐理由:官方给出了函数调用、指令遵循的具体提升数据和落地入口,读者可以据此评估现有语音 Agent 是否值得升级。

12月11日周四
  1. OpenAI News67

    OpenAI 发布 GPT-5.2,在 GPQA Diamond 与 FrontierMath 上刷新纪录

    OpenAI 发布 GPT-5.2,称其为迄今数学和科学能力最强的模型,在 GPQA Diamond 和 FrontierMath 等基准上创下新的 SOTA 成绩。文章展示了这些能力提升如何转化为实际研究进展,包括解决一个开放理论问题和生成可靠的数学证明。

    推荐理由:原文给出 GPT-5.2 在数学与科学基准上的成绩及其在真实研究中的应用,适合想了解模型推理能力边界的读者。

  2. OpenAI News74

    OpenAI 发布 GPT-5.2:面向专业工作的前沿模型

    OpenAI 发布 GPT-5.2,定位为面向日常专业工作的最先进前沿模型,具备推理、长上下文理解、编码和视觉能力。用户可在 ChatGPT 和 OpenAI API 中使用,以驱动更快、更可靠的智能体工作流。

    推荐理由:OpenAI 官方说明 GPT-5.2 的能力定位和可用入口,读者可以据此判断是否将其纳入日常工作流。

12月9日周二
  1. Mistral AI69

    Mistral 发布 Devstral 2(123B)与 Devstral Small 2(24B)编码模型及 Mistral Vibe CLI

    Mistral AI 发布开源编码模型 Devstral 2(123B)和 Devstral Small 2(24B),SWE-bench Verified 分别取得 72.2% 和 68.0%,并推出开源终端编码智能体 Mistral Vibe CLI。

    推荐理由:官方公布两个尺寸开源编码模型的基准成绩、许可与部署门槛,并同步开放终端 CLI,读者可评估其替代现有方案的成本。

12月4日周四
  1. Hugging Face Blog44

    DeepMath:基于 smolagents 的轻量级数学推理智能体

    Intel AI 软件团队推出 DeepMath,一个基于 Qwen3-4B Thinking、用 GRPO 微调并通过 smolagents 实现的数学推理智能体。模型用简短 Python 代码片段替代冗长文本推理,在沙箱中执行后回填推理上下文,输出长度最多减少 66%,同时常提升准确率。在 MATH500、AIME、HMMT、HLE 四个数据集上,GRPO 训练与智能体推理结合取得最高准确率。

12月3日周三
  1. Mistral AI82

    Mistral 发布 Mistral 3 系列模型,含 Mistral Large 3 与 Ministral 3 全系开源

    Mistral 发布 Mistral 3 系列模型,包括 41B 激活、675B 总参数的 MoE 模型 Mistral Large 3,以及 3B/8B/14B 三种尺寸的 Ministral 3 小模型,全部以 Apache 2.0 协议开源。

    推荐理由:官方发布涵盖 Large 3 与 Ministral 3 全系的参数规模、开源协议和部署途径,读者可以据此判断各档模型适合的场景。

11月24日周一
11月20日周四
11月19日周三
  1. OpenAI News67

    OpenAI 发布 GPT-5.1-Codex-Max 编码模型

    OpenAI 推出面向 Codex 的 GPT-5.1-Codex-Max,定位为更快速、更智能的智能体编码模型。该模型面向长时间运行的项目级工作,具备增强的推理能力和更高的 token 效率。

    推荐理由:官方说明了该模型面向长时间项目级任务定位,并强调推理与 token 效率改进,可作为选用参考。

11月17日周一
11月13日周四
  1. OpenAI News73

    OpenAI 在 API 中推出 GPT-5.1

    OpenAI 宣布 GPT-5.1 在 API 中可用,带来更快的自适应推理、扩展的提示词缓存和更好的编码性能,并新增 apply_patch 与 shell 工具。

    推荐理由:官方说明 GPT-5.1 API 版的能力变化点,开发者可以据此判断是否迁移现有调用。

11月12日周三
  1. OpenAI News76

    OpenAI 发布 GPT-5.1,更聪明也更会聊天的 ChatGPT

    OpenAI 升级 GPT-5 系列,推出更温暖、能力更强的 GPT-5.1,并为 ChatGPT 新增语气和风格的自定义方式。GPT-5.1 从发布当天起向付费用户逐步推出。

    推荐理由:原文直接给出 GPT-5 系列升级方向、语气定制能力和面向付费用户的开放节奏,读者可据此评估升级是否影响自身使用。

10月29日周三
  1. OpenAI News63

    OpenAI 发布 gpt-oss-safeguard-120b 与 gpt-oss-safeguard-20b 开放权重模型及技术报告

    OpenAI 发布 gpt-oss-safeguard-120b 和 gpt-oss-safeguard-20b 两个开放权重推理模型,由 gpt-oss 模型后训练而来,可根据给定策略推理并对内容进行标注。技术报告描述了其能力,并以底层 gpt-oss 模型为基线提供了安全评估结果。

    推荐理由:原文给出两个安全审核模型的训练思路和基线安全评估来源,读者可以据此了解其按策略标注内容的能力定位。