Liquid AI 发布 LFM2.5-VL-3B 的 DSpark 草稿模型,端侧解码最高加速 3.13x
Liquid AI 发布面向视觉语言模型 LFM2.5-VL-3B 的实验性 DSpark 草稿模型,通过投机解码在不改变输出质量的前提下换取加速。
推荐理由:原文给出视觉 DSpark 草稿模型的架构细节、实测加速数字和三大推理框架接入方式,读者可评估端侧 VLM 推理加速的可迁移做法。
跑在手机、电脑与边缘设备上的 AI:小模型、本地推理与端侧芯片的进展。
Liquid AI 发布面向视觉语言模型 LFM2.5-VL-3B 的实验性 DSpark 草稿模型,通过投机解码在不改变输出质量的前提下换取加速。
推荐理由:原文给出视觉 DSpark 草稿模型的架构细节、实测加速数字和三大推理框架接入方式,读者可评估端侧 VLM 推理加速的可迁移做法。
Hugging Face 宣布 transformers 支持通过 from_pretrained 直接加载 GGUF 量化模型,复用 ggml 的 Metal 内核以接近 llama.cpp 的性能。
推荐理由:官方介绍 transformers 直接加载 GGUF 的用法、量化选择和与 llama.cpp 的对比数据,对想在 Mac 上本地推理的开发者有实用参考。
Hugging Face WebAI 团队发布 @huggingface/kernels 库和 207 个 WebGPU 内核(Apache-2.0),每个内核以带版本号的独立仓库发布,包含 manifest、正确性测试、基准用例和 WGSL shader 模板。
推荐理由:官方介绍了 207 个 WebGPU 内核的发布方式和与 ORT WebGPU 的实测对比,读者可以据此评估浏览器端推理优化的可用路径。
Liquid AI 为 LFM2.5 系列三个模型(LFM2.5-1.2B-Instruct、LFM2.5-2.6B、LFM2.5-8B-A1B)发布 DSpark 草稿模型检查点,采用投机解码在不改变输出质量的前提下大幅加速解码。
推荐理由:官方给出 DSpark 草稿模型的具体加速数据、质量等价原理和 llama.cpp 与 SGLang 的用法,端侧部署可直接迁移。
Google DeepMind 发布多语言手语转文本(SL2T)翻译模型,首次将手语 AI 带入消费产品,支持在 Pixel 11 的 Gboard 和 Live Transcribe 中以美式手语(ASL)输入英文。
推荐理由:原文介绍了 SL2T 的训练数据、隐私设计与基准成绩,并说明其落地产品形态,读者可以了解手语翻译模型的可行路径。
Google DeepMind 发布 Gemma 4 12B,采用无编码器的统一多模态架构,视觉和音频输入直接进入 LLM backbone,支持原生音频输入。
推荐理由:原文给出了架构细节、内存门槛和许可证等可验证事实,读者可据此评估本地部署多模态模型的可行性。
Hcompany 发布 Holo3.1 系列 Computer Use 模型,提供 0.8B、4B、9B 和 35B-A3B 四种尺寸。
推荐理由:官方给出各尺寸在 OSWorld 与 AndroidWorld 的量化后表现和部署路径,读者可据此评估本地 Computer Use Agent 的可行性。
Hugging Face 发布教程,指导开发者在 Manifest V3 约束下用 Transformers.js 在 Chrome 扩展中运行本地 AI,并复刻其 Gemma 4 Browser Assistant 架构。
推荐理由:作者基于自家 Gemma 4 浏览器扩展拆解 MV3 下运行 Transformers.js 的架构决策,给出可直接迁移的运行时划分与消息契约设计。
Overworld 发布实时视频世界模型 Waypoint-1.5,权重已上传 Hugging Face。在 RTX 3090 至 5090 桌面硬件上可实时生成最高 720p、60 FPS 的交互环境,另提供面向游戏笔记本等更广消费级硬件的 360p 档位,Apple Silicon 支持即将推出。
推荐理由:原文给出两档模型的具体硬件门槛、帧率分辨率和约百倍数据训练规模,读者可据此判断自己的设备能否本地运行。
Google DeepMind 发布 Gemma 4 开源模型,基于 Gemini 3 技术,主打高级推理和智能体工作流。提供 E2B、E4B、26B MoE(推理时仅激活 3.8B 参数)和 31B Dense 四种尺寸,31B 在 Arena AI 文本排行榜上位列全球开源模型第 3,采用 Apache 2.0 许可,支持 128K-256K 上下文窗口、原生多模态和 140+ 语言。
推荐理由:原文给出了四个尺寸、基准排名和部署细节,读者可以据此判断在本地和端侧硬件上的可用性。
Google DeepMind 发布 Gemma 4 多模态模型系列,共五个尺寸(E2B、E4B、12B Unified、31B、26B A4B MoE),采用 Apache 2.0 许可,支持图像、文本和音频输入,上下文窗口最高 256K。
推荐理由:Hugging Face 官方详解 Gemma 4 架构、多模态能力与全生态部署方式,还覆盖 DiffusionGemma 和推理加速等上手细节。
GGML 及 Georgi Gerganov 团队宣布加入 Hugging Face,以保障本地 AI 的长期开源发展。团队将继续全职维护 llama.cpp,保持技术方向与社区自治,项目继续 100% 开源、社区驱动;双方计划让 transformers 中的模型定义能近乎一键地在 llama.cpp 中落地,并改进基于 ggml 的软件的打包与用户体验。
推荐理由:收购方官方说明团队加入后的自治安排与技术方向,读者可据此评估 llama.cpp 社区的连续性与本地推理生态走向。
Mistral 发布 Mistral 3 系列模型,包括 41B 激活、675B 总参数的 MoE 模型 Mistral Large 3,以及 3B/8B/14B 三种尺寸的 Ministral 3 小模型,全部以 Apache 2.0 协议开源。
推荐理由:官方发布涵盖 Large 3 与 Ministral 3 全系的参数规模、开源协议和部署途径,读者可以据此判断各档模型适合的场景。
Hugging Face 博客宣布 AnyLanguageModel,一个 Swift 包,作为 Apple Foundation Models 框架的 drop-in 替代,支持多模型供应商。
推荐理由:原文解释了为何以 Apple Foundation Models API 为模板设计,并给出换 import 即切换本地或云端模型的实际用法。
Google 发布开源嵌入模型 EmbeddingGemma,308M 参数、2K 上下文窗口,支持超过 100 种语言,量化后内存占用低于 200 MB,适合端侧 RAG 和 Agent 场景。
推荐理由:官方博客给出架构、基准和各框架用法,还附完整微调示例,读者可以据此判断如何把它接入现有检索流程。
Mistral AI 发布 Mistral Small 3.1,基于 Mistral Small 3 改进文本性能、增加多模态理解和 128k 上下文窗口,推理速度达 150 tokens 每秒。
推荐理由:官方给出基准对比、128k 上下文、单卡部署要求和开源下载入口,可据此评估其在小模型生态的定位。
Google 发布 Gemma 3 系列开源模型,提供 1B/4B/12B/27B 四种尺寸,4B 及以上支持图文输入和 140+ 种语言,上下文窗口扩展到 128K(1B 为 32K)。
推荐理由:文章梳理了 Gemma 3 各尺寸能力变化并给出 transformers、llama.cpp、MLX 的推理用法,便于判断上手方式。
Hugging Face 发布端侧推理教程,用 React Native、llama.rn(llama.cpp 绑定)和 react-native-fs 构建可从 Hub 下载 GGUF 模型并完全离线对话的移动应用,代码在 EdgeLLM 仓库。
推荐理由:教程讲解模型选择与 GGUF 量化差异,并用 llama.rn 完整走通端侧聊天应用,方法可直接复用。
Hugging Face 发布 SmolVLM2 系列,包含 2.2B、500M 和 256M 三种参数规模,主打让视频理解在手机到服务器等设备上运行。
推荐理由:官方发布三档小尺寸视频理解模型并给出端侧运行方案,读者可以据此评估轻量多模态模型在自己的设备上的可行性。
Hugging Face 发布 SmolVLM 家族两款新模型 SmolVLM-256M 和 SmolVLM-500M,各含 base 与 instruct 共 4 个 checkpoint,其中 256M 为迄今最小的 VLM。
推荐理由:官方详述 256M/500M 两款小模型的视觉编码器、数据配比和 tokenization 改动,适合想在受限设备上跑多模态的读者参考选型。