Google 发布 EmbeddingGemma 高效多语言嵌入模型
Google 发布开源嵌入模型 EmbeddingGemma,308M 参数、2K 上下文窗口,支持超过 100 种语言,量化后内存占用低于 200 MB,适合端侧 RAG 和 Agent 场景。
推荐理由:官方博客给出架构、基准和各框架用法,还附完整微调示例,读者可以据此判断如何把它接入现有检索流程。
新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。
Google 发布开源嵌入模型 EmbeddingGemma,308M 参数、2K 上下文窗口,支持超过 100 种语言,量化后内存占用低于 200 MB,适合端侧 RAG 和 Agent 场景。
推荐理由:官方博客给出架构、基准和各框架用法,还附完整微调示例,读者可以据此判断如何把它接入现有检索流程。
OpenAI 发布更先进的语音到语音模型 gpt-realtime,并更新 Realtime API。新能力包括 MCP server 支持、图像输入和 SIP 电话呼叫支持。
推荐理由:官方公布了语音到语音模型与 API 能力更新,读者可据此了解语音方向的新入口。
OpenAI 在 API 平台推出 GPT-5,面向开发者提供高推理性能和新的控制选项。该模型在真实编码任务上取得同类领先的评测结果。
推荐理由:OpenAI 官方宣布 GPT-5 上线 API,读者可以据此了解其在推理和编码任务上的定位以及面向开发者的新控制能力。
OpenAI 发布 GPT-5 系统卡,说明统一模型路由系统如何在 gpt-5-main、gpt-5-thinking 和轻量版 gpt-5-thinking-nano 之间分配请求,以兼顾快速和智能的响应。各变体针对不同任务和开发者使用场景做了优化。
推荐理由:官方系统卡说明 GPT-5 的统一路由机制,读者可以据此理解不同 gpt-5 变体如何按任务分配响应。
OpenAI 发布 GPT-5,称其是目前最好的 AI 系统,智能水平较此前所有模型有显著跃升。GPT-5 在编码、数学、写作、健康、视觉感知等领域具有领先表现。
推荐理由:OpenAI 官方宣布 GPT-5 发布,可借此了解其在编码、数学、写作等多项能力上的定位。
OpenAI 发布开源权重模型 GPT OSS,包含 117B 参数的 gpt-oss-120b 和 21B 参数的 gpt-oss-20b,均采用 MoE 架构和 MXFP4 4-bit 量化,分别可装入单张 H100 和 16GB 显存,采用 Apache 2.0 许可证。
推荐理由:文章给出两个模型的参数量、量化方案和各硬件平台的具体推理优化建议,读者可按自己的 GPU 直接选择部署路径。
OpenAI 发布 gpt-oss-120b 和 gpt-oss-20b 两款开放权重语言模型,采用 Apache 2.0 许可证。官方称二者在推理任务上优于同等规模的开源模型,具备较强的工具调用能力,并针对消费级硬件上的高效部署做了优化。
推荐理由:OpenAI 官方发布两款开放权重模型,读者可以据此了解其推理表现、工具调用能力和在消费级硬件上的部署定位。
OpenAI 发布 gpt-oss-120b 和 gpt-oss-20b 两个开放权重推理模型,采用 Apache 2.0 许可证并附带 gpt-oss 使用政策。
推荐理由:OpenAI 以 Apache 2.0 开放权重发布两款推理模型,读者可以据此评估开源推理生态的新选项。
Mistral 发布语音理解模型 Voxtral,提供 24B 和 3B 两个版本,均以 Apache 2.0 许可开源,可通过 Hugging Face 下载或 API 调用。
推荐理由:官方发布了模型规格、基准对比和价格,读者可以据此评估它在语音理解和成本上相对现有方案的定位。
Mistral AI 与 All Hands AI 合作推出 Devstral Medium,并升级 Devstral Small 1.1。
推荐理由:原文给出两款新模型的 SWE-Bench Verified 分数、许可证与定价,可据此比较成本与代码智能体能力。
Mistral AI 发布首个推理模型 Magistral,含 24B 开源的 Magistral Small(Apache 2.0)和企业版 Magistral Medium。
推荐理由:原文给出两版本的具体评测分数、开源许可和部署渠道,读者可据此评估其在推理模型中的定位与可用性。
H Company 发布开源 Action VLM 系列 Holo1(含 Holo1-3B 与 Holo1-7B),并同步开源含 1,639 项 UI 任务的 WebClick 多模态定位基准。
推荐理由:官方给出模型规格、定位准确率和每任务成本数字,读者可据此评估这套开源 GUI 自动化方案的实际性价比。
Mistral AI 与 All Hands AI 联合发布面向软件工程任务的智能体模型 Devstral,以 Apache 2.0 许可开源,在 SWE-Bench Verified 上取得 46.8%,超过此前开源 SoTA 6 个百分点以上,并超越 GPT-4.1-mini 超过 20%。
推荐理由:原文给出 SWE-Bench Verified 具体分数和部署门槛,可判断这款开源编码模型在本地与隐私场景的可行性。
OpenAI 在 o3 和 o4-mini 系统卡附录中介绍云端编码智能体 Codex,底层为针对软件工程优化的 o3 版本 codex-1。该模型通过强化学习在多种环境的真实编码任务上训练,生成贴近人类风格和 PR 偏好的代码,精确遵循指令,并迭代运行测试直至通过。
推荐理由:原文说明了 codex-1 的训练方式与目标能力,读者可以了解 Codex 与一般代码补全的区别。
Mistral AI 发布 Mistral Medium 3,在多项基准上达到或超过 Claude Sonnet 3.7 的 90% 表现,定价为 $0.4 输入 / $2 输出每 M token,并称超越 Llama 4 Maverick 与 Cohere Command A。
推荐理由:官方给出与 Claude Sonnet 3.7 对比的基准成绩、定价和部署选项,读者可据此评估企业落地的性价比。
OpenAI 已回滚上周 ChatGPT 中的 GPT-4o 更新,用户现改用行为更均衡的早期版本。被移除的更新表现得过度讨好或附和,常被称为谄媚(sycophancy)。
推荐理由:官方说明回退原因与现状,读者可以了解 ChatGPT 模型行为问题的处理方式。
OpenAI 宣布最新图像生成模型通过 API 中的 gpt-image-1 提供,面向开发者和企业开放。开发者可将专业级、可定制的视觉生成能力直接集成到自己的工具和平台中。
推荐理由:官方宣布 gpt-image-1 进入 API,开发者可以把专业级、可定制的图像生成直接接入自己的工具和平台。
OpenAI 发布 o3 和 o4-mini 两款新模型,称其为迄今最智能、能力最强的模型,并支持完整的工具调用。
推荐理由:官方宣布 o3 与 o4-mini 两款新模型,主打更强能力与完整工具调用,想了解 OpenAI 推理模型最新进展可由此入手。
OpenAI 发布 o3 与 o4-mini 系统卡,两款模型结合了先进推理能力与完整工具能力。工具能力涵盖网页浏览、Python、图像与文件分析、图像生成、canvas、automations、文件搜索和 memory。
推荐理由:官方说明 o3 与 o4-mini 同时具备推理和完整工具调用能力,读者可据此了解这两个新模型的能力范围。
OpenAI 在 API 中发布 GPT-4.1 系列模型,在编码、指令遵循和长上下文理解方面有显著提升,同时发布其首个 nano 模型,即日起面向全球开发者开放。
推荐理由:官方宣布 GPT-4.1 系列上线 API,编码、指令遵循与长上下文能力全面提升,还推出了首个 nano 模型。