OpenAI 发布 GPT-5.2:面向专业工作的前沿模型
OpenAI 发布 GPT-5.2,定位为面向日常专业工作的最先进前沿模型,具备推理、长上下文理解、编码和视觉能力。用户可在 ChatGPT 和 OpenAI API 中使用,以驱动更快、更可靠的智能体工作流。
推荐理由:OpenAI 官方说明 GPT-5.2 的能力定位和可用入口,读者可以据此判断是否将其纳入日常工作流。
文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。
OpenAI 发布 GPT-5.2,定位为面向日常专业工作的最先进前沿模型,具备推理、长上下文理解、编码和视觉能力。用户可在 ChatGPT 和 OpenAI API 中使用,以驱动更快、更可靠的智能体工作流。
推荐理由:OpenAI 官方说明 GPT-5.2 的能力定位和可用入口,读者可以据此判断是否将其纳入日常工作流。
Mistral 发布 Mistral 3 系列模型,包括 41B 激活、675B 总参数的 MoE 模型 Mistral Large 3,以及 3B/8B/14B 三种尺寸的 Ministral 3 小模型,全部以 Apache 2.0 协议开源。
推荐理由:官方发布涵盖 Large 3 与 Ministral 3 全系的参数规模、开源协议和部署途径,读者可以据此判断各档模型适合的场景。
Google DeepMind 宣布在 Gemini app 中支持验证图片是否由 Google AI 生成或编辑,基于 SynthID 数字水印技术,用户上传图片询问即可检测。
推荐理由:原文说明了 Gemini app 内用 SynthID 验证 AI 图片的具体用法,以及后续扩展到视频音频和 C2PA 的计划。
Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image),基于 Gemini 3 Pro 的高保真图像生成与编辑模型,已开始在 Google AI Studio 和 Vertex AI 面向付费预览推出。
推荐理由:官方发布文给出了模型能力细节、2K/4K 分辨率、接入渠道和定价定位,开发者可据此评估是否切换或叠加使用。
Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image),基于 Gemini 3 Pro 的新一代图像生成与编辑模型。
推荐理由:官方发布新图像模型,列出文本渲染、多语言、4K 分辨率等具体能力变化和各产品入口,读者可以对照评估使用方式。
Google DeepMind 发布 Gemini 3,称 Gemini 3 Pro 为其最智能模型,在各大基准上超越此前的 2.5 Pro。
推荐理由:官方发布给出了 Gemini 3 Pro 的基准成绩、API 定价和新工具入口,开发者可以直接评估是否迁移到现有编码与智能体工作流。
Google DeepMind 发布 Gemini 3,先以 Gemini 3 Pro 预览版形式推出,并预告增强推理模式 Gemini 3 Deep Think。
推荐理由:官方发布给出完整基准成绩和覆盖入口,读者可据此判断 Gemini 3 Pro 的推理与编码能力以及它如何嵌入现有工具链。
Google 发布生成式 UI 实现,可按提示词动态生成网页、游戏、工具等定制交互界面,相关论文为 Generative UI: LLMs are Effective UI Generators。
推荐理由:原文介绍了生成式 UI 的实现原理、产品入口和人评结果,读者可以了解这一交互范式如何落地到现有产品。
Google 发布 Google Earth AI 相关技术论文,介绍新的 Imagery 与 Population 基础模型,以及由 Gemini 驱动的 Geospatial Reasoning 智能体,用于多步地理空间问答。
推荐理由:官方同步放出技术论文和评测数字,读者可以据此了解跨模态地理空间推理的实际能力边界与应用案例。
Hugging Face 宣布其开源无代码工具 AI Sheets 新增视觉支持,可在表格中分析图片、提取结构化数据、从文本生成图像并用 Qwen-Image-Edit 等模型编辑图像。
推荐理由:官方发布带来图像提取、生成与编辑能力,教程演示了手写菜谱数字化等具体用法,便于读者评估是否引入自己的数据工作流。
Hugging Face 发布开源 OCR 模型指南,新增 Chandra 和 OlmOCR-2 及其 OlmOCR Benchmark 得分。
推荐理由:指南基于 OlmOCR Benchmark 等公开基准对比了 9 个开源 OCR 模型的格式、大小与成本,并给出按使用场景选型的具体方法。
mmBERT 发布,基于 ModernBERT 架构,在 1800 多种语言、3T+ token 上训练,是首个在 XTREME 等基准上超越 XLM-R 的多语言编码器。
推荐理由:原文给出三阶段训练细节和完整评测数据,读者可以据此评估其多语言与检索能力是否适合自己的场景。
OpenAI 发布 GPT-5,称其是目前最好的 AI 系统,智能水平较此前所有模型有显著跃升。GPT-5 在编码、数学、写作、健康、视觉感知等领域具有领先表现。
推荐理由:OpenAI 官方宣布 GPT-5 发布,可借此了解其在编码、数学、写作等多项能力上的定位。
H Company 发布开源 Action VLM 系列 Holo1(含 Holo1-3B 与 Holo1-7B),并同步开源含 1,639 项 UI 任务的 WebClick 多模态定位基准。
推荐理由:官方给出模型规格、定位准确率和每任务成本数字,读者可据此评估这套开源 GUI 自动化方案的实际性价比。
Hugging Face 发布 nanoVLM,一个纯 PyTorch 的轻量工具包,可在免费 Colab 上启动视觉语言模型训练,灵感来自 Andrej Karpathy 的 nanoGPT。
推荐理由:原文拆解了 nanoVLM 的架构、训练与推理全流程,代码轻量可读,适合想从头理解 VLM 训练机制的读者上手实践。
Hugging Face 发布长文,回顾 2024 年 4 月以来视觉语言模型(VLM)的关键变化与趋势。
推荐理由:Hugging Face 系统梳理了过去一年 VLM 的新架构、多模态 RAG、智能体与安全模型,可作为领域入门与选型参考。
Mistral AI 发布 Mistral Medium 3,在多项基准上达到或超过 Claude Sonnet 3.7 的 90% 表现,定价为 $0.4 输入 / $2 输出每 M token,并称超越 Llama 4 Maverick 与 Cohere Command A。
推荐理由:官方给出与 Claude Sonnet 3.7 对比的基准成绩、定价和部署选项,读者可据此评估企业落地的性价比。
Meta 发布 Llama 4 Maverick(约 400B、128 专家)和 Scout(约 109B、16 专家),均为 17B 激活参数的 MoE 原生多模态模型,在最多 40 万亿 token、200 种语言数据上训练。
推荐理由:官方公告给出两款模型的参数、上下文长度与架构细节,读者可以据此评估部署门槛和与 transformers 的集成方式。
Mistral AI 发布 Mistral Small 3.1,基于 Mistral Small 3 改进文本性能、增加多模态理解和 128k 上下文窗口,推理速度达 150 tokens 每秒。
推荐理由:官方给出基准对比、128k 上下文、单卡部署要求和开源下载入口,可据此评估其在小模型生态的定位。
Google 发布 Gemma 3 系列开源模型,提供 1B/4B/12B/27B 四种尺寸,4B 及以上支持图文输入和 140+ 种语言,上下文窗口扩展到 128K(1B 为 32K)。
推荐理由:文章梳理了 Gemma 3 各尺寸能力变化并给出 transformers、llama.cpp、MLX 的推理用法,便于判断上手方式。