Google DeepMind 发布 Gemini 3 Pro 预览版及 Gemini 3 Deep Think
Google DeepMind 发布 Gemini 3,先以 Gemini 3 Pro 预览版形式推出,并预告增强推理模式 Gemini 3 Deep Think。
推荐理由:官方发布给出完整基准成绩和覆盖入口,读者可据此判断 Gemini 3 Pro 的推理与编码能力以及它如何嵌入现有工具链。
Google DeepMind 发布 Gemini 3,先以 Gemini 3 Pro 预览版形式推出,并预告增强推理模式 Gemini 3 Deep Think。
推荐理由:官方发布给出完整基准成绩和覆盖入口,读者可据此判断 Gemini 3 Pro 的推理与编码能力以及它如何嵌入现有工具链。
Google DeepMind 与 Google Research 发布 WeatherNext 2 天气预报模型,生成预报速度快 8 倍,分辨率最高达 1 小时。
推荐理由:Google DeepMind 官方介绍了 WeatherNext 2 的技术细节、性能对比数据和开放获取渠道,读者可以据此评估其在天气预报场景的可用性。
OpenAI 宣布 GPT-5.1 在 API 中可用,带来更快的自适应推理、扩展的提示词缓存和更好的编码性能,并新增 apply_patch 与 shell 工具。
推荐理由:官方说明 GPT-5.1 API 版的能力变化点,开发者可以据此判断是否迁移现有调用。
OpenAI 升级 GPT-5 系列,推出更温暖、能力更强的 GPT-5.1,并为 ChatGPT 新增语气和风格的自定义方式。GPT-5.1 从发布当天起向付费用户逐步推出。
推荐理由:原文直接给出 GPT-5 系列升级方向、语气定制能力和面向付费用户的开放节奏,读者可据此评估升级是否影响自身使用。
OpenAI 发布 gpt-oss-safeguard-120b 和 gpt-oss-safeguard-20b 两个开放权重推理模型,由 gpt-oss 模型后训练而来,可根据给定策略推理并对内容进行标注。技术报告描述了其能力,并以底层 gpt-oss 模型为基线提供了安全评估结果。
推荐理由:原文给出两个安全审核模型的训练思路和基线安全评估来源,读者可以据此了解其按策略标注内容的能力定位。
OpenAI 发布 gpt-oss-safeguard,是用于安全分类的开源权重推理模型。开发者可以在其上应用并迭代自定义安全策略。
推荐理由:原文说明这是面向安全分类的开源权重推理模型,开发者可自定义安全策略并迭代,适合关注安全工程的人参考。
IBM 发布 Granite 4.0 Nano,这是 Granite 4.0 家族中参数最小的模型,含 Granite 4.0 H 1B(约 1.5B)、Granite 4.0 H 350M(约 350M)及对应传统 transformer 版本,采用 Apache 2.0 许可。
OpenAI 发布 GPT-5 系统卡附录,说明 GPT-5 在敏感对话处理上的改进。新增针对情感依赖、心理健康和越狱抵抗力的基准。
OpenAI 发布 Sora 2,一个支持同步对话与音效的视频生成模型。同时原文提到 Sora 产品已不再可用。
推荐理由:官方宣布 Sora 2 带同步对话与音效的视频生成能力,读者可借此了解其与此前版本的能力差异。
OpenAI 发布新一代视频与音频生成模型 Sora 2。相较初代 Sora,新模型具备更准确的物理表现、更强的真实感、同步音频、更高的可控性和更广的风格范围。
推荐理由:官方说明列出 Sora 2 在物理准确性、音画同步和可控性上的能力变化,可帮助读者比较视频模型迭代方向。
OpenAI 在 GPT-5 系统卡附录中发布新模型 GPT-5-Codex,是针对 Codex 中智能体编码进一步优化的 GPT-5 版本。该模型会根据任务复杂度更动态地调整思考力度,简单对话或小任务快速响应,复杂任务则可独立长时间工作。
推荐理由:原文说明新模型在思考力度上按任务复杂度动态调整,读者可了解其与 GPT-5 在编码场景下的差异。
Writer 发布 Palmyra-mini 家族三个 1.5B 到 1.7B 的开源模型:非思考基座 palmyra-mini、面向复杂逻辑的 palmyra-mini-thinking-a,以及长于数学推理的 palmyra-mini-thinking-b。
Hugging Face 发布 Jupyter Agent 项目,用约 2TB Kaggle 笔记本构建 51k 条合成轨迹、近 0.2B tokens 的数据集,微调 Qwen3-4B-Instruct-2507 与 Qwen3-4B-Thinking-2507。
推荐理由:原文完整给出从数据清洗到微调的管线与消融数字,读者可复用其中提升小模型数据科学能力的做法。
mmBERT 发布,基于 ModernBERT 架构,在 1800 多种语言、3T+ token 上训练,是首个在 XTREME 等基准上超越 XLM-R 的多语言编码器。
推荐理由:原文给出三阶段训练细节和完整评测数据,读者可以据此评估其多语言与检索能力是否适合自己的场景。
Google 发布开源嵌入模型 EmbeddingGemma,308M 参数、2K 上下文窗口,支持超过 100 种语言,量化后内存占用低于 200 MB,适合端侧 RAG 和 Agent 场景。
推荐理由:官方博客给出架构、基准和各框架用法,还附完整微调示例,读者可以据此判断如何把它接入现有检索流程。
OpenAI 发布更先进的语音到语音模型 gpt-realtime,并更新 Realtime API。新能力包括 MCP server 支持、图像输入和 SIP 电话呼叫支持。
推荐理由:官方公布了语音到语音模型与 API 能力更新,读者可据此了解语音方向的新入口。
OpenAI 推出专用模型 GPT-4b micro,与 Retro Bio 合作设计更有效的蛋白质,用于干细胞疗法和延寿研究。该模型面向生命科学场景,帮助提升蛋白质工程效率,加速相关研究进展。
NVIDIA 发布 600 万条多语言推理数据集 Nemotron Post-Training Dataset v2,将原有英文推理数据翻译为法语、西班牙语、德语、意大利语和日语五种语言,并保留原始英文推理链。
Numina 与 Kimi 开源 kimina-prover-rl,一个基于 DeepSeek-R1 推理范式、与 Verl 完全兼容的 Lean 4 形式化定理证明训练管线,采用 GRPO 强化学习并配套 kimina-lean-server 验证服务。
Arm 发布面向图形与游戏开发的 AI 超分辨率方案 Neural Super Sampling(NSS),可在移动 GPU 的 Neural Accelerator 上实时运行。
OpenAI 在 API 平台推出 GPT-5,面向开发者提供高推理性能和新的控制选项。该模型在真实编码任务上取得同类领先的评测结果。
推荐理由:OpenAI 官方宣布 GPT-5 上线 API,读者可以据此了解其在推理和编码任务上的定位以及面向开发者的新控制能力。
OpenAI 发文称 GPT-5 是其最先进的模型,将变革企业级 AI、自动化与劳动力生产力。文章把 GPT-5 定位为智能工作新纪元的核心驱动力,聚焦企业场景下的自动化与工作效率提升。
OpenAI 介绍 GPT-5 在创意写作方面的辅助能力,说明该模型如何支持写作创作。
OpenAI 发布 GPT-5 系统卡,说明统一模型路由系统如何在 gpt-5-main、gpt-5-thinking 和轻量版 gpt-5-thinking-nano 之间分配请求,以兼顾快速和智能的响应。各变体针对不同任务和开发者使用场景做了优化。
推荐理由:官方系统卡说明 GPT-5 的统一路由机制,读者可以据此理解不同 gpt-5 变体如何按任务分配响应。
OpenAI 发布 GPT-5,称其是目前最好的 AI 系统,智能水平较此前所有模型有显著跃升。GPT-5 在编码、数学、写作、健康、视觉感知等领域具有领先表现。
推荐理由:OpenAI 官方宣布 GPT-5 发布,可借此了解其在编码、数学、写作等多项能力上的定位。
OpenAI 发布开源权重模型 GPT OSS,包含 117B 参数的 gpt-oss-120b 和 21B 参数的 gpt-oss-20b,均采用 MoE 架构和 MXFP4 4-bit 量化,分别可装入单张 H100 和 16GB 显存,采用 Apache 2.0 许可证。
推荐理由:文章给出两个模型的参数量、量化方案和各硬件平台的具体推理优化建议,读者可按自己的 GPU 直接选择部署路径。
OpenAI 发布 gpt-oss-120b 和 gpt-oss-20b 两款开放权重语言模型,采用 Apache 2.0 许可证。官方称二者在推理任务上优于同等规模的开源模型,具备较强的工具调用能力,并针对消费级硬件上的高效部署做了优化。
推荐理由:OpenAI 官方发布两款开放权重模型,读者可以据此了解其推理表现、工具调用能力和在消费级硬件上的部署定位。
OpenAI 发布 gpt-oss-120b 和 gpt-oss-20b 两个开放权重推理模型,采用 Apache 2.0 许可证并附带 gpt-oss 使用政策。
推荐理由:OpenAI 以 Apache 2.0 开放权重发布两款推理模型,读者可以据此评估开源推理生态的新选项。
OpenAI 发布其最强开放权重(open-weights)模型,让先进 AI 更开放、灵活且在全球更易获取。这是 OpenAI「让更多人用上 AI」使命的重要一步,核心不只在于能力,更在于谁能使用 AI。
Hugging Face 推出 Ettin 套件,用 ModernBERT 配方在相同数据(2T tokens)、架构和训练流程下训练出 17M 至 1B 参数的成对 encoder-only 与 decoder-only 模型,全部数据开源可复现。
Mistral 发布语音理解模型 Voxtral,提供 24B 和 3B 两个版本,均以 Apache 2.0 许可开源,可通过 Hugging Face 下载或 API 调用。
推荐理由:官方发布了模型规格、基准对比和价格,读者可以据此评估它在语音理解和成本上相对现有方案的定位。
Mistral AI 与 All Hands AI 合作推出 Devstral Medium,并升级 Devstral Small 1.1。
推荐理由:原文给出两款新模型的 SWE-Bench Verified 分数、许可证与定价,可据此比较成本与代码智能体能力。
Numina 与 Kimi 团队发布基于 Qwen2.5-72B 和 Kimi k1.5 RL 流水线训练的定理证明模型 Kimina-Prover-72B,并开源 Kimina-Prover-Distill-8B 和 1.7B 蒸馏版。
Hugging Face 发布完全开源的 SmolLM3-3B,用 11.2T tokens 分三阶段预训练,性能超越 Llama-3.2-3B 和 Qwen2.5-3B,并与 Qwen3-4B、Gemma3-4B 等更大模型竞争力相当。
推荐理由:官方同步放出模型、三阶段预训练配比和双模式推理完整训练配方,适合想复现或改进同级小模型的研究者对照学习。
NVIDIA 发布 Llama Nemotron Nano VL,一个面向智能文档处理的 8B 视觉语言模型,已在 Hugging Face 提供下载,并可通过 NVIDIA NIM API 使用。
Google Gemma 3n 正式开源,发布 E2B 和 E4B 两个尺寸、各含 base 与 instruct 版本,支持图像、文本、音频和视频输入。E2B/E4B 实际参数为 5B/8B,但借助 MatFormer 架构与 Per-Layer Embeddings,仅需 2GB/3GB GPU 内存即可运行,E4B 还在 LMArena 上取得 1300+ 分数。
推荐理由:原文给出模型的有效参数设计、显存需求和各开源库用法,端侧开发者可以据此选择部署方式。
Mistral AI 发布首个推理模型 Magistral,含 24B 开源的 Magistral Small(Apache 2.0)和企业版 Magistral Medium。
推荐理由:原文给出两版本的具体评测分数、开源许可和部署渠道,读者可据此评估其在推理模型中的定位与可用性。
H Company 发布开源 Action VLM 系列 Holo1(含 Holo1-3B 与 Holo1-7B),并同步开源含 1,639 项 UI 任务的 WebClick 多模态定位基准。
推荐理由:官方给出模型规格、定位准确率和每任务成本数字,读者可据此评估这套开源 GUI 自动化方案的实际性价比。
Hugging Face 发布 450M 参数的开源视觉-语言-动作模型 SmolVLA,基于 lerobot 标签下的社区共享数据集预训练,可在消费级硬件(甚至 CPU 或 MacBook)上运行和训练。
Mistral 发布首款代码专用嵌入模型 Codestral Embed,性能超越 Voyage Code 3、Cohere Embed v4.0 和 OpenAI 的大型嵌入模型。