GPT-5.2 推导出理论物理新结果
OpenAI 发布预印本,显示 GPT-5.2 提出了一个新的 gluon amplitude(胶子振幅)公式,该公式随后由 OpenAI 与学术合作者正式证明和验证。
推荐理由:模型提出的新物理公式经学术合作者证明与验证,可作为前沿模型科研能力的具体例证。
OpenAI 发布预印本,显示 GPT-5.2 提出了一个新的 gluon amplitude(胶子振幅)公式,该公式随后由 OpenAI 与学术合作者正式证明和验证。
推荐理由:模型提出的新物理公式经学术合作者证明与验证,可作为前沿模型科研能力的具体例证。
Google DeepMind 发布 Gemini 3 Deep Think 重大升级,面向科学、研究和工程挑战的专用推理模式。
推荐理由:原文给出 Deep Think 多项基准成绩和 API 开放入口,读者可以据此评估它在科研与工程场景的可用性。
OpenAI 发布首个实时编码模型 GPT-5.3-Codex-Spark,生成速度提升 15x,支持 128k 上下文。模型以研究预览形式向 ChatGPT Pro 用户开放。
推荐理由:OpenAI 官方公布实时编码模型的速度与上下文规格及试用范围,正在用该模型的用户可据此评估是否切换。
Google DeepMind 发布两篇论文,介绍 Gemini Deep Think 在专家指导下解决数学、物理和计算机科学的专业研究问题。其数学研究智能体 Aletheia 配备自然语言验证器并可承认失败,在 IMO-ProofBench Advanced 上最高得分 90%,并自主解决 Bloom's Erdős 猜想数据库中的四个开放问题,包括 Erdős-1051。
推荐理由:原文给出两篇论文的具体成果和方法细节,读者可以了解 AI 辅助科研的实际边界与协作模式。
OpenAI 推出 GPT-5.3-Codex,一个 Codex 原生智能体,将前沿编码能力与通用推理相结合,用于支持长周期、真实世界的技术工作。
OpenAI 发布 GPT-5.3-Codex,称其为迄今最强的智能体编码模型。它结合了 GPT-5.2-Codex 的前沿编码能力与 GPT-5.2 的推理和专业知识能力。
Mistral 发布 Voxtral Transcribe 2 系列,包含批处理转写模型 Voxtral Mini Transcribe V2 和实时模型 Voxtral Realtime。
推荐理由:官方发布了两个语音转写模型的具体性能、价格和开放权重信息,读者可以据此对比现有转写方案的成本与延迟。
H 公司发布其最大的 UI 定位模型 Holo2-235B-A22B Preview,在 ScreenSpot-Pro 达到 78.5%、OSWorld G 达到 79.0%,创下 SOTA 纪录。该模型采用智能体定位方式迭代修正预测,带来 10-20% 相对提升,已作为研究版本在 Hugging Face 开放。训练使用 SkyPilot 统一管理跨云的 Kubernetes 集群任务。
OpenAI 将于 2026 年 2 月 13 日在 ChatGPT 中下线 GPT-4o、GPT-4.1、GPT-4.1 mini 和 o4-mini,与此前宣布的 GPT-5(Instant、Thinking、Pro)退役同步进行。API 侧目前没有任何变化。
微软团队(Tianzhu Ye、Li Dong、Yutao Sun、Furu Wei)发布 DIFF Transformer V2,在 DIFF V1 基础上让相减的两个 head 共享同一 GQA 组的 key 和 value,不再增加 KV head,解码速度与标准 Transformer 相当,也无需自定义 attention kernel。
Overworld 发布实时交互式视频扩散模型 Waypoint-1,可通过文本、鼠标和键盘交互生成可进入的虚拟世界。
推荐理由:原文给出训练方法、推理库与帧率数据,并解释它与微调路线世界模型在控制延迟上的差异。
Google DeepMind 发布 D4RT(Dynamic 4D Reconstruction and Tracking),用统一的 encoder-decoder Transformer 框架从普通视频重建动态 3D 场景并追踪时空运动。
Google 发布在 Science Advances 的论文,介绍 NeuralGCM 通过直接在 2001 至 2018 年 NASA 卫星降水观测上训练,改进全球降水模拟能力。
NVIDIA 发布 Cosmos Reason 2,一个面向物理 AI 的开源推理视觉语言模型,登顶 Physical AI Bench 和 Physical Reasoning 排行榜,成为视觉理解排名第一的开源模型。
推荐理由:官方发布给出模型规格、上下文长度和评测变化,读者可据此评估其是否适合机器人与视频分析场景。
Hugging Face 博客宣布推出 Falcon-H1-Arabic 阿拉伯语模型家族,包含 3B、7B、34B 三种规格,采用融合 Mamba(State Space Model)与 Transformer 注意力的混合架构。
ServiceNow AI 发布 8B 参数安全护栏模型 AprielGuard,可检测 16 类安全风险以及提示注入、越狱、记忆投毒等对抗攻击,并支持独立提示、多轮对话和含工具调用与推理轨迹的 agentic 工作流输入。
OpenAI 发布 GPT-5.2-Codex,称其为目前最先进的编码模型。该模型主打长程推理、大规模代码变换和增强的网络安全能力。
推荐理由:官方说明点出长程推理、大规模代码改造与安全能力三个方向,可作为评估其编码定位的基本参照。
Mistral AI 发布 Mistral OCR 3,在表单、扫描件、复杂表格和手写内容上对 Mistral OCR 2 的整体胜率为 74%。模型(mistral-ocr-2512)定价 $2/1000 页,Batch-API 半价至 $1/1000 页,输出支持带 HTML 表格重建的 markdown,并可拖拽 PDF/图片解析为文本或结构化 JSON。
推荐理由:官方给出与上一代的胜率对比、定价和接入方式,读者可以据此评估它在文档解析流程中的成本与适用性。
Google DeepMind 发布 Gemini 3 Flash,将 Gemini 3 Pro 级推理能力与 Flash 级速度和成本结合。
推荐理由:官方给出关键基准分数、价格和开放渠道,读者可以据此比较它与大模型在速度成本上的取舍。
Google DeepMind 发布面向实时语音 Agent 的更新版 Gemini 2.5 Flash Native Audio,提升函数调用、指令遵循与多轮对话能力,在 ComplexFuncBench Audio 上得分 71.5%,开发者指令遵循率从 84% 升至 90%。
推荐理由:官方给出了函数调用、指令遵循的具体提升数据和落地入口,读者可以据此评估现有语音 Agent 是否值得升级。
OpenAI 发布 GPT-5.2,称其为迄今数学和科学能力最强的模型,在 GPQA Diamond 和 FrontierMath 等基准上创下新的 SOTA 成绩。文章展示了这些能力提升如何转化为实际研究进展,包括解决一个开放理论问题和生成可靠的数学证明。
推荐理由:原文给出 GPT-5.2 在数学与科学基准上的成绩及其在真实研究中的应用,适合想了解模型推理能力边界的读者。
OpenAI 发布 GPT-5 系统卡更新,介绍 GPT-5 系列最新模型 GPT-5.2。该模型的安全缓解方案与 GPT-5 及 GPT-5.1 系统卡所述基本一致。训练数据涵盖公开互联网信息、第三方合作数据以及用户和人类训练员提供或生成的信息。
OpenAI 发布 GPT-5.2,定位为面向日常专业工作的最先进前沿模型,具备推理、长上下文理解、编码和视觉能力。用户可在 ChatGPT 和 OpenAI API 中使用,以驱动更快、更可靠的智能体工作流。
推荐理由:OpenAI 官方说明 GPT-5.2 的能力定位和可用入口,读者可以据此判断是否将其纳入日常工作流。
Mistral AI 发布开源编码模型 Devstral 2(123B)和 Devstral Small 2(24B),SWE-bench Verified 分别取得 72.2% 和 68.0%,并推出开源终端编码智能体 Mistral Vibe CLI。
推荐理由:官方公布两个尺寸开源编码模型的基准成绩、许可与部署门槛,并同步开放终端 CLI,读者可评估其替代现有方案的成本。
Intel AI 软件团队推出 DeepMath,一个基于 Qwen3-4B Thinking、用 GRPO 微调并通过 smolagents 实现的数学推理智能体。模型用简短 Python 代码片段替代冗长文本推理,在沙箱中执行后回填推理上下文,输出长度最多减少 66%,同时常提升准确率。在 MATH500、AIME、HMMT、HLE 四个数据集上,GRPO 训练与智能体推理结合取得最高准确率。
Mistral 发布 Mistral 3 系列模型,包括 41B 激活、675B 总参数的 MoE 模型 Mistral Large 3,以及 3B/8B/14B 三种尺寸的 Ministral 3 小模型,全部以 Apache 2.0 协议开源。
推荐理由:官方发布涵盖 Large 3 与 Ministral 3 全系的参数规模、开源协议和部署途径,读者可以据此判断各档模型适合的场景。
UCLA 教授 Ernest Ryu 与 GPT-5 合作解决了优化理论中的一个关键问题,展示了 AI 在加速数学发现中的作用。
Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image),基于 Gemini 3 Pro 的新一代图像生成与编辑模型。
推荐理由:官方发布新图像模型,列出文本渲染、多语言、4K 分辨率等具体能力变化和各产品入口,读者可以对照评估使用方式。
SLAM Lab 发布 Apriel-H1 系列,将 15B 推理模型部分注意力层替换为 Mamba,旗舰 Apriel-H1-15b-Thinker-SFT 以 76.8B token 训练实现 2.1 倍吞吐且推理质量损失很小。
OpenAI 推出面向 Codex 的 GPT-5.1-Codex-Max,定位为更快速、更智能的智能体编码模型。该模型面向长时间运行的项目级工作,具备增强的推理能力和更高的 token 效率。
推荐理由:官方说明了该模型面向长时间项目级任务定位,并强调推理与 token 效率改进,可作为选用参考。
OpenAI 发布 GPT-5.1-CodexMax 系统卡,介绍其配套安全措施。模型层面包括针对有害任务和提示词注入的专项安全训练;产品层面包括 agent 沙箱和可配置的网络访问权限。
Google DeepMind 发布 Gemini 3,称 Gemini 3 Pro 为其最智能模型,在各大基准上超越此前的 2.5 Pro。
推荐理由:官方发布给出了 Gemini 3 Pro 的基准成绩、API 定价和新工具入口,开发者可以直接评估是否迁移到现有编码与智能体工作流。
Google DeepMind 发布 Gemini 3,先以 Gemini 3 Pro 预览版形式推出,并预告增强推理模式 Gemini 3 Deep Think。
推荐理由:官方发布给出完整基准成绩和覆盖入口,读者可据此判断 Gemini 3 Pro 的推理与编码能力以及它如何嵌入现有工具链。
Google DeepMind 与 Google Research 发布 WeatherNext 2 天气预报模型,生成预报速度快 8 倍,分辨率最高达 1 小时。
推荐理由:Google DeepMind 官方介绍了 WeatherNext 2 的技术细节、性能对比数据和开放获取渠道,读者可以据此评估其在天气预报场景的可用性。
Google DeepMind 发布 SIMA 2,将 Gemini 模型嵌入智能体核心,使其从跟随指令进化为能思考目标、与用户对话并自我改进的通用游戏智能体。
推荐理由:官方介绍 SIMA 2 如何借 Gemini 从执行指令走向推理与自改进,读者可了解具身智能体训练路径。
OpenAI 宣布 GPT-5.1 在 API 中可用,带来更快的自适应推理、扩展的提示词缓存和更好的编码性能,并新增 apply_patch 与 shell 工具。
推荐理由:官方说明 GPT-5.1 API 版的能力变化点,开发者可以据此判断是否迁移现有调用。
OpenAI 发布 GPT-5 系统卡附录,更新 GPT-5.1 Instant 与 GPT-5.1 Thinking 的安全指标。附录新增了针对心理健康和情感依赖的评估。
OpenAI 升级 GPT-5 系列,推出更温暖、能力更强的 GPT-5.1,并为 ChatGPT 新增语气和风格的自定义方式。GPT-5.1 从发布当天起向付费用户逐步推出。
推荐理由:原文直接给出 GPT-5 系列升级方向、语气定制能力和面向付费用户的开放节奏,读者可据此评估升级是否影响自身使用。
OpenAI 发布 gpt-oss-safeguard-120b 和 gpt-oss-safeguard-20b 两个开放权重推理模型,由 gpt-oss 模型后训练而来,可根据给定策略推理并对内容进行标注。技术报告描述了其能力,并以底层 gpt-oss 模型为基线提供了安全评估结果。
推荐理由:原文给出两个安全审核模型的训练思路和基线安全评估来源,读者可以据此了解其按策略标注内容的能力定位。
OpenAI 发布 gpt-oss-safeguard,是用于安全分类的开源权重推理模型。开发者可以在其上应用并迭代自定义安全策略。
推荐理由:原文说明这是面向安全分类的开源权重推理模型,开发者可自定义安全策略并迭代,适合关注安全工程的人参考。