Liquid AI 发布 LFM2.5-VL-3B 的 DSpark 草稿模型,端侧解码最高加速 3.13x
Liquid AI 发布面向视觉语言模型 LFM2.5-VL-3B 的实验性 DSpark 草稿模型,通过投机解码在不改变输出质量的前提下换取加速。
推荐理由:原文给出视觉 DSpark 草稿模型的架构细节、实测加速数字和三大推理框架接入方式,读者可评估端侧 VLM 推理加速的可迁移做法。
Liquid AI 发布面向视觉语言模型 LFM2.5-VL-3B 的实验性 DSpark 草稿模型,通过投机解码在不改变输出质量的前提下换取加速。
推荐理由:原文给出视觉 DSpark 草稿模型的架构细节、实测加速数字和三大推理框架接入方式,读者可评估端侧 VLM 推理加速的可迁移做法。
Liquid AI 为 LFM2.5 系列三个模型(LFM2.5-1.2B-Instruct、LFM2.5-2.6B、LFM2.5-8B-A1B)发布 DSpark 草稿模型检查点,采用投机解码在不改变输出质量的前提下大幅加速解码。
推荐理由:官方给出 DSpark 草稿模型的具体加速数据、质量等价原理和 llama.cpp 与 SGLang 的用法,端侧部署可直接迁移。
Google DeepMind 发布多语言手语转文本(SL2T)翻译模型,首次将手语 AI 带入消费产品,支持在 Pixel 11 的 Gboard 和 Live Transcribe 中以美式手语(ASL)输入英文。
推荐理由:原文介绍了 SL2T 的训练数据、隐私设计与基准成绩,并说明其落地产品形态,读者可以了解手语翻译模型的可行路径。
Google DeepMind 发布 Gemma 4 12B,采用无编码器的统一多模态架构,视觉和音频输入直接进入 LLM backbone,支持原生音频输入。
推荐理由:原文给出了架构细节、内存门槛和许可证等可验证事实,读者可据此评估本地部署多模态模型的可行性。
Hcompany 发布 Holo3.1 系列 Computer Use 模型,提供 0.8B、4B、9B 和 35B-A3B 四种尺寸。
推荐理由:官方给出各尺寸在 OSWorld 与 AndroidWorld 的量化后表现和部署路径,读者可据此评估本地 Computer Use Agent 的可行性。
Overworld 发布实时视频世界模型 Waypoint-1.5,权重已上传 Hugging Face。在 RTX 3090 至 5090 桌面硬件上可实时生成最高 720p、60 FPS 的交互环境,另提供面向游戏笔记本等更广消费级硬件的 360p 档位,Apple Silicon 支持即将推出。
推荐理由:原文给出两档模型的具体硬件门槛、帧率分辨率和约百倍数据训练规模,读者可据此判断自己的设备能否本地运行。
Google DeepMind 发布 Gemma 4 开源模型,基于 Gemini 3 技术,主打高级推理和智能体工作流。提供 E2B、E4B、26B MoE(推理时仅激活 3.8B 参数)和 31B Dense 四种尺寸,31B 在 Arena AI 文本排行榜上位列全球开源模型第 3,采用 Apache 2.0 许可,支持 128K-256K 上下文窗口、原生多模态和 140+ 语言。
推荐理由:原文给出了四个尺寸、基准排名和部署细节,读者可以据此判断在本地和端侧硬件上的可用性。
Google DeepMind 发布 Gemma 4 多模态模型系列,共五个尺寸(E2B、E4B、12B Unified、31B、26B A4B MoE),采用 Apache 2.0 许可,支持图像、文本和音频输入,上下文窗口最高 256K。
推荐理由:Hugging Face 官方详解 Gemma 4 架构、多模态能力与全生态部署方式,还覆盖 DiffusionGemma 和推理加速等上手细节。
Mistral 发布 Mistral 3 系列模型,包括 41B 激活、675B 总参数的 MoE 模型 Mistral Large 3,以及 3B/8B/14B 三种尺寸的 Ministral 3 小模型,全部以 Apache 2.0 协议开源。
推荐理由:官方发布涵盖 Large 3 与 Ministral 3 全系的参数规模、开源协议和部署途径,读者可以据此判断各档模型适合的场景。
IBM 发布 Granite 4.0 Nano,这是 Granite 4.0 家族中参数最小的模型,含 Granite 4.0 H 1B(约 1.5B)、Granite 4.0 H 350M(约 350M)及对应传统 transformer 版本,采用 Apache 2.0 许可。
Google 发布开源嵌入模型 EmbeddingGemma,308M 参数、2K 上下文窗口,支持超过 100 种语言,量化后内存占用低于 200 MB,适合端侧 RAG 和 Agent 场景。
推荐理由:官方博客给出架构、基准和各框架用法,还附完整微调示例,读者可以据此判断如何把它接入现有检索流程。
Arm 发布面向图形与游戏开发的 AI 超分辨率方案 Neural Super Sampling(NSS),可在移动 GPU 的 Neural Accelerator 上实时运行。
TII 发布 Falcon-H1 系列开源模型,包含 0.5B、1.5B、1.5B-Deep、3B、7B、34B 六种规模及对应 instruct 版本,采用注意力与 Mamba-2 并行的混合架构,基于 Apache 2.0 类宽松许可。
TII 发布基于 BitNet 架构的 Falcon-Edge 系列三值语言模型,提供 1B 和 3B 两种参数规模,各含 base 和 instruct 版本。
OpenAI 在 API 中发布 GPT-4.1 系列模型,在编码、指令遵循和长上下文理解方面有显著提升,同时发布其首个 nano 模型,即日起面向全球开发者开放。
推荐理由:官方宣布 GPT-4.1 系列上线 API,编码、指令遵循与长上下文能力全面提升,还推出了首个 nano 模型。
Mistral AI 发布 Mistral Small 3.1,基于 Mistral Small 3 改进文本性能、增加多模态理解和 128k 上下文窗口,推理速度达 150 tokens 每秒。
推荐理由:官方给出基准对比、128k 上下文、单卡部署要求和开源下载入口,可据此评估其在小模型生态的定位。
Google 发布 Gemma 3 系列开源模型,提供 1B/4B/12B/27B 四种尺寸,4B 及以上支持图文输入和 140+ 种语言,上下文窗口扩展到 128K(1B 为 32K)。
推荐理由:文章梳理了 Gemma 3 各尺寸能力变化并给出 transformers、llama.cpp、MLX 的推理用法,便于判断上手方式。
Hugging Face 发布 SmolVLM2 系列,包含 2.2B、500M 和 256M 三种参数规模,主打让视频理解在手机到服务器等设备上运行。
推荐理由:官方发布三档小尺寸视频理解模型并给出端侧运行方案,读者可以据此评估轻量多模态模型在自己的设备上的可行性。
Hugging Face 发布 SmolVLM 家族两款新模型 SmolVLM-256M 和 SmolVLM-500M,各含 base 与 instruct 共 4 个 checkpoint,其中 256M 为迄今最小的 VLM。
推荐理由:官方详述 256M/500M 两款小模型的视觉编码器、数据配比和 tokenization 改动,适合想在受限设备上跑多模态的读者参考选型。
Mistral AI 在 Mistral 7B 发布一周年之际推出端侧模型 Ministral 3B 和 Ministral 8B,主打设备端与边缘场景,官方称两者在 sub-10B 级别的知识、常识、推理、function-calling 和效率上达到新水平。
推荐理由:官方公布了两个端侧模型的能力定位、上下文长度、API 定价与权重许可,读者可据此评估本地推理场景的选型。
Meta 发布 Llama 3.2,Hugging Face 上线 10 个开放权重模型,包括 11B 和 90B 两个视觉模型(各有 base 与 instruct 版本)以及 1B 和 3B 两个可端侧运行的文本模型。
推荐理由:原文来自 Hugging Face 官方,详细说明了 Vision 与端侧小模型的规模、显存需求、许可证限制和上手方式,适合据此评估是否采用。
Google 在 Gemma 2 发布一个月后推出三款新模型:2.6B 参数的 Gemma 2 2B(含 base 和 instruct 版本,适合端侧使用)、基于 Gemma 2 的安全分类器系列 ShieldGemma(2B/9B/27B)以及覆盖 Gemma 2 2B 和 9B 每一层的开源稀疏自编码器套件 Gemma Scope。
推荐理由:原文详细给出 Gemma 2 2B 的端侧用法、辅助生成加速和两个配套工具的评测,对部署和模型解释研究都有可操作的参考价值。
Hugging Face 发布 SmolLM 小型语言模型系列,提供 135M、360M 和 1.7B 三种参数规模,并同步开源训练语料 SmolLM-Corpus。
推荐理由:官方公开了小型模型的数据配比、训练细节和完整语料,同档评测结果与端侧部署信息都可查证,适合关心小模型训练的人参考。