Claude Sonnet 5.5 上线 Amazon Bedrock 与 Claude Platform on AWS
AWS 宣布 Claude Sonnet 5.5 可在 Amazon Bedrock 和 Claude Platform on AWS(北美)使用,大多数任务成本更低、速度更快。
推荐理由:原文给出 Claude Sonnet 5.5 在 Amazon Bedrock 的接入方式、适用场景与 Opus 5.5 分工建议,读者可据此规划云端部署与成本。
AWS 宣布 Claude Sonnet 5.5 可在 Amazon Bedrock 和 Claude Platform on AWS(北美)使用,大多数任务成本更低、速度更快。
推荐理由:原文给出 Claude Sonnet 5.5 在 Amazon Bedrock 的接入方式、适用场景与 Opus 5.5 分工建议,读者可据此规划云端部署与成本。
Liquid AI 发布面向视觉语言模型 LFM2.5-VL-3B 的实验性 DSpark 草稿模型,通过投机解码在不改变输出质量的前提下换取加速。
推荐理由:原文给出视觉 DSpark 草稿模型的架构细节、实测加速数字和三大推理框架接入方式,读者可评估端侧 VLM 推理加速的可迁移做法。
NVIDIA Vera Rubin NVL72 首次参加 MLPerf Inference v6.1 预览提交即取得领先性能:在 Qwen3-VL 上吞吐量最高达 GB300 NVL72 的 3.7 倍,在 DeepSeek-R1 上使用 TensorRT-LLM 最高达 2.5 倍。
Liquid AI 为 LFM2.5 系列三个模型(LFM2.5-1.2B-Instruct、LFM2.5-2.6B、LFM2.5-8B-A1B)发布 DSpark 草稿模型检查点,采用投机解码在不改变输出质量的前提下大幅加速解码。
推荐理由:官方给出 DSpark 草稿模型的具体加速数据、质量等价原理和 llama.cpp 与 SGLang 的用法,端侧部署可直接迁移。
NVIDIA 发布 Magpie TTS Multilingual,364M 参数开源权重模型,新增现代标准阿拉伯语、韩语和巴西葡萄牙语,共支持 12 种语言。
NVIDIA 发布 Cosmos-H-Dreams,一个动作条件驱动的手术机器人实时生成式仿真器,将 Cosmos-H-Surgical-Simulator 蒸馏为因果、少步数的学生模型,并通过 FlashDreams 流式推理库在单张 NVIDIA RTX PRO 6000 上从约每秒10帧提升到约160帧的交互运行。
Mistral 发布 Mistral OCR 4,除文本外返回边界框、分类型块(标题、表格、公式、签名等)和逐页逐词置信度分数,支持 10 个语系下 170 种语言。
推荐理由:官方公布了能力细节、定价和基准方法论,还主动列出自动评测的打分缺陷,读者可据此判断在自己场景中怎么用。
IBM 发布 Granite Embedding Multilingual R2 两款 Apache 2.0 多语言嵌入模型:97M 紧凑版在 MTEB Multilingual Retrieval 得 60.3。
推荐理由:原文给出完整基准数据、训练方法与框架集成示例,读者可按规模和场景直接选型。
DeepSeek 发布 V4,在 Hub 上开源 DeepSeek-V4-Pro(1.6T 总参数 / 49B 激活)和 DeepSeek-V4-Flash(284B 总参数 / 13B 激活)两个 instruct 及对应 base 检查点,均支持 1M token 上下文。
推荐理由:文章拆解了 V4 为长上下文与 Agent 场景做的架构与后训练设计,读者可据此评估开源模型跑长任务的部署成本。
TII Falcon Vision 团队发布 Falcon Perception,一个 0.6B 参数的早融合 Transformer,用混合注意力掩码处理图像块与文本,做自然语言提示的开放词汇定位与分割,在 SA-Co 上达到 68.0 Macro-F1(SAM 3 为 62.3),但在 presence calibration 上落后(MCC 0.64 vs 0.82)。
推荐理由:TII 自述用单一早融合 Transformer 做开放词汇感知,读者可以看到架构、数据配方和 SA-Co 与 PBench 上的具体对比依据。
H Company 发布多模态计算机使用模型 Holotron-12B,基于 NVIDIA Nemotron-Nano-2 VL 后训练约 140 亿 token,已在 Hugging Face 以 NVIDIA Open Model License 开放。
SLAM Lab 发布 Apriel-H1 系列,将 15B 推理模型部分注意力层替换为 Mamba,旗舰 Apriel-H1-15b-Thinker-SFT 以 76.8B token 训练实现 2.1 倍吞吐且推理质量损失很小。
OpenAI 在 API 平台推出 GPT-5,面向开发者提供高推理性能和新的控制选项。该模型在真实编码任务上取得同类领先的评测结果。
推荐理由:OpenAI 官方宣布 GPT-5 上线 API,读者可以据此了解其在推理和编码任务上的定位以及面向开发者的新控制能力。
OpenAI 发布 GPT-5 系统卡,说明统一模型路由系统如何在 gpt-5-main、gpt-5-thinking 和轻量版 gpt-5-thinking-nano 之间分配请求,以兼顾快速和智能的响应。各变体针对不同任务和开发者使用场景做了优化。
推荐理由:官方系统卡说明 GPT-5 的统一路由机制,读者可以据此理解不同 gpt-5 变体如何按任务分配响应。
Mistral AI 发布 Codestral 25.08,并整合 Codestral Embed、Devstral 和 Mistral Code IDE 插件形成面向企业的完整编码栈。
Mistral AI 发布 Mistral Medium 3,在多项基准上达到或超过 Claude Sonnet 3.7 的 90% 表现,定价为 $0.4 输入 / $2 输出每 M token,并称超越 Llama 4 Maverick 与 Cohere Command A。
推荐理由:官方给出与 Claude Sonnet 3.7 对比的基准成绩、定价和部署选项,读者可据此评估企业落地的性价比。
Mistral 发布 Mistral Small 3,一个延迟优化的 24B 参数模型,以 Apache 2.0 许可开源预训练和指令微调权重。模型 MMLU 准确率超 81%,延迟 150 tokens/s,官方称性能与 Llama 3.3 70B instruct 相当且在相同硬件上快 3 倍以上。
推荐理由:24B 参数、Apache 2.0 开源、可在单卡 RTX 4090 本地运行,读者可据此评估低延迟场景下的替代方案。
Mistral AI 在 Mistral 7B 发布一周年之际推出端侧模型 Ministral 3B 和 Ministral 8B,主打设备端与边缘场景,官方称两者在 sub-10B 级别的知识、常识、推理、function-calling 和效率上达到新水平。
推荐理由:官方公布了两个端侧模型的能力定位、上下文长度、API 定价与权重许可,读者可据此评估本地推理场景的选型。
Meta 发布 Llama 3.1 系列,在 Hugging Face Hub 上线 8B、70B、405B 三个规模共 8 个开放权重模型,上下文长度提升至 128K tokens,支持 8 种语言和工具调用。
推荐理由:官方发布说明覆盖了三个规模、内存需求和量化权重,读者可以据此选择适合自己硬件的部署与微调路径。
Mistral AI 发布 Mamba 架构的 Codestral Mamba,在 Albert Gu 和 Tri Dao 协助下训练,具备线性时间推理和理论无限序列建模能力,已测试 256k token 的上下文检索,参数量 7,285,403,648。
推荐理由:官方介绍了 Mamba 架构在线性推理和长序列上的特点、部署方式与许可证差异,读者可据此评估本地编码助手的可行性。
Mistral 发布 Mixtral 8x7B,一个采用 Mixture of Experts 架构的开放模型,在多数基准上超越 Llama 2 70B 并达到或超过 GPT-3.5,MT-Bench 得分 8.30。
推荐理由:Mixtral 8x7B 以 MoE 架构达到开放模型新高度,本文同时给出生态内的推理、量化、微调与部署路径,方法可直接照做。
TII 发布 Falcon 180B,为当时最大的开放语言模型,拥有 1800 亿参数,使用 RefinedWeb 数据集在 3.5 万亿 token 上完成预训练。
推荐理由:原文给出了参数量、训练规模、评测对比和完整部署硬件门槛,读者可以据此评估是否在自己的场景中采用这个开源模型。