Meta 发布 Llama 4 Maverick 与 Scout,Hugging Face 同步上线权重与生态支持
Meta 发布 Llama 4 Maverick(约 400B、128 专家)和 Scout(约 109B、16 专家),均为 17B 激活参数的 MoE 原生多模态模型,在最多 40 万亿 token、200 种语言数据上训练。
推荐理由:官方公告给出两款模型的参数、上下文长度与架构细节,读者可以据此评估部署门槛和与 transformers 的集成方式。
新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。
Meta 发布 Llama 4 Maverick(约 400B、128 专家)和 Scout(约 109B、16 专家),均为 17B 激活参数的 MoE 原生多模态模型,在最多 40 万亿 token、200 种语言数据上训练。
推荐理由:官方公告给出两款模型的参数、上下文长度与架构细节,读者可以据此评估部署门槛和与 transformers 的集成方式。
DeepSeek-V3 更新版 0324 上架 Hugging Face Hub,架构与原版相同并改为 MIT 许可,重点改进指令遵循、代码与数学能力。官方基准显示 MMLU-Pro 75.9→81.2、AIME 39.6→59.4、LiveCodeBench 39.2→49.2,常与 GPT-4.5 相当、普遍强于 Claude-Sonnet-3.7。
推荐理由:原文汇总了基准对比、能力改进细节和多种本地部署路径,读者可据此评估是否在自己的工作流中替换旧版 V3。
OpenAI 发表 GPT-4o 系统卡附录,介绍 4o 图像生成,称其比此前 DALL·E 3 系列能力显著更强。它能生成照片级真实输出,并支持以图像作为输入进行转换。
推荐理由:原文明确了 4o 图像生成相比 DALL·E 3 的能力跃升,读者可以据此判断它在生成与图像转换上的新定位。
NVIDIA 在 GTC 2025 上发布三项面向物理 AI 的开源资源:70 亿参数的 Cosmos Transfer 世界基础模型、含超过 32 万条轨迹共 15 TB 数据的 Physical AI Dataset,以及首个开放的人形机器人推理与技能基础模型 NVIDIA Isaac GR00T N1。
推荐理由:官方一次放出 Cosmos Transfer、开放数据集和 GR00T N1 三项资源,开发者可直接获取模型权重与数据用于机器人和自动驾驶研发。
Mistral AI 发布 Mistral Small 3.1,基于 Mistral Small 3 改进文本性能、增加多模态理解和 128k 上下文窗口,推理速度达 150 tokens 每秒。
推荐理由:官方给出基准对比、128k 上下文、单卡部署要求和开源下载入口,可据此评估其在小模型生态的定位。
Google 发布 Gemma 3 系列开源模型,提供 1B/4B/12B/27B 四种尺寸,4B 及以上支持图文输入和 140+ 种语言,上下文窗口扩展到 128K(1B 为 32K)。
推荐理由:文章梳理了 Gemma 3 各尺寸能力变化并给出 transformers、llama.cpp、MLX 的推理用法,便于判断上手方式。
Hugging Face 在 Open R1 第三次更新中发布了从 DeepSeek-R1 蒸馏的 CodeForces-CoTs 数据集(近 10 万样本)、2024 年 IOI 题目构成的 IOI 基准,以及基于 Qwen2.5 Coder 微调的 OlympicCoder-7B 和 OlympicCoder-32B。
推荐理由:Hugging Face 官方复盘训练过程,给出样本打包、学习率等可复用经验,并附带完整数据集、基准和评测代码。
Mistral AI 发布 Mistral OCR 光学字符识别 API,输入图片和 PDF,输出图文交错内容,定位为多模态文档 RAG 系统的解析组件。
推荐理由:官方给出与 Azure OCR、Gemini、GPT-4o 的分项基准对比和定价细节,读者可以据此评估它是否适合替换现有文档解析链路。
OpenAI 发布 GPT-4.5 的研究预览版,称其为目前最大、知识最丰富的模型。材料仅含发布说明摘要,未提供更多技术细节。
推荐理由:OpenAI 官方确认 GPT-4.5 以研究预览版发布,并定位为其最大、知识最丰富的模型。
Hugging Face 发布 SmolVLM2 系列,包含 2.2B、500M 和 256M 三种参数规模,主打让视频理解在手机到服务器等设备上运行。
推荐理由:官方发布三档小尺寸视频理解模型并给出端侧运行方案,读者可以据此评估轻量多模态模型在自己的设备上的可行性。
Mistral 发布 Mistral Small 3,一个延迟优化的 24B 参数模型,以 Apache 2.0 许可开源预训练和指令微调权重。模型 MMLU 准确率超 81%,延迟 150 tokens/s,官方称性能与 Llama 3.3 70B instruct 相当且在相同硬件上快 3 倍以上。
推荐理由:24B 参数、Apache 2.0 开源、可在单卡 RTX 4090 本地运行,读者可据此评估低延迟场景下的替代方案。
Hugging Face 发布 SmolVLM 家族两款新模型 SmolVLM-256M 和 SmolVLM-500M,各含 base 与 instruct 共 4 个 checkpoint,其中 256M 为迄今最小的 VLM。
推荐理由:官方详述 256M/500M 两款小模型的视觉编码器、数据配比和 tokenization 改动,适合想在受限设备上跑多模态的读者参考选型。
Answer.AI 与 LightOn 联合发布 ModernBERT 编码器模型系列,提供 base(149M 参数)和 large(395M 参数)两个规格,可作为 BERT 类模型的直接替代。
推荐理由:Answer.AI 与 LightOn 官方发布,作者本人阐述了架构与训练改动,读者可据此评估它能否替换现有 BERT 类工作流。
OpenAI 推出 o1 模型,同时带来面向开发者的多项更新,包括 Realtime API 改进和一种新的微调方法。
推荐理由:官方公告集中列出 o1 模型、Realtime API 改进与新微调方法,开发者可据此了解当期可用的工具变化。
OpenAI 宣布视频生成模型 Sora 上线,用户可在 sora.com 使用。支持生成最高 1080p、最长 20 秒的视频,可选宽屏、竖屏或方形比例,还可导入自有素材进行扩展、混剪与融合,或从文本生成全新内容。
推荐理由:官方公布视频生成的分辨率、时长与素材混用方式,读者可据此判断是否把 Sora 纳入现有视频创作流程。
OpenAI 发布 Sora 视频生成模型的系统卡。Sora 接受文本、图像和视频输入并生成新视频,建立在 DALL-E 和 GPT 模型的经验之上,旨在为人们的叙事和创意表达提供更多工具。
推荐理由:官方系统卡说明了 Sora 的输入输出形式和模型来源,读者可以据此了解其能力定位。
Google 发布视觉语言模型 PaliGemma 2,将 SigLIP 图像编码器与 Gemma 2 语言模型结合,提供 3B、10B、28B 三种规模,支持 224x224、448x448 和 896x896 三种输入分辨率。
推荐理由:Google 发布 PaliGemma 2 视觉语言模型,提供 3B、10B、28B 三种规模与多分辨率选择,并附 transformers 集成和微调脚本。
Hugging Face 发布 2B 小型视觉语言模型 SmolVLM,含 Base、Synthetic 和 Instruct 三个版本,模型、数据集、训练配方均以 Apache 2.0 开源。
推荐理由:原文给出与同级 2B 模型的显存、token 编码和吞吐对比数据,可帮助读者评估端侧部署小 VLM 的实际成本。
Mistral 发布 Pixtral Large,一个基于 Mistral Large 2 的 124B 开源权重多模态模型,在 MathVista 达到 69.4%,DocVQA 与 ChartQA 上超过 GPT-4o 和 Gemini-1.5 Pro,LMSys Vision Leaderboard 上领先最近的开放权重模型近 50 ELO。
推荐理由:官方给出关键基准数字和开放下载渠道,读者可以据此判断该多模态模型在图像理解和文本能力上的定位。
Stable Diffusion 3.5 Large 发布,提供 8B 基础版和 8B timestep-distilled 版两个 checkpoint,模型已在 Hugging Face Hub 开放并可在 🧨 Diffusers 中使用。
推荐理由:原文给出 Diffusers 中推理、量化加载和低显存训练 LoRA 的具体做法,读者可以直接照着在消费级硬件上使用 8B 模型。