NVIDIA 开源表格基础模型 Kumo Tabular,单次前向预测登顶四大基准
NVIDIA 发布开源表格基础模型 Kumo Tabular,对带标签的表格数据在单次前向传播中完成分类或回归预测,无需训练、调参或特征工程。
推荐理由:官方发布开放表格基础模型,用上下文学习免训练预测,作者给出了架构细节和基准表现,读者可以评估它是否适合替换现有梯度提升树流程。
NVIDIA 发布开源表格基础模型 Kumo Tabular,对带标签的表格数据在单次前向传播中完成分类或回归预测,无需训练、调参或特征工程。
推荐理由:官方发布开放表格基础模型,用上下文学习免训练预测,作者给出了架构细节和基准表现,读者可以评估它是否适合替换现有梯度提升树流程。
Hcompany 发布 Holo4 智能体系列模型,含 27B dense 和 35B-A3B MoE 两个尺寸,并更新发布 Holotron4 Nano。模型可通过 GUI、代码、MCP 和 API 多种接口操作软件,在 OSWorld 2.0 上 Holo4 27B 得分 61.7%(Opus 5.5 为 81.8%),35B-A3B 达 30.9%,参数量和成本显著更低。
推荐理由:原文给出 OSWorld 2.0 等基准分数、成本对比和全部轨迹开源信息,读者可以据此评估这款多接口智能体模型是否适配自己的业务工作流。
Liquid AI 发布面向视觉语言模型 LFM2.5-VL-3B 的实验性 DSpark 草稿模型,通过投机解码在不改变输出质量的前提下换取加速。
推荐理由:原文给出视觉 DSpark 草稿模型的架构细节、实测加速数字和三大推理框架接入方式,读者可评估端侧 VLM 推理加速的可迁移做法。
H Company 发布 NeoMME 系列 260M 和 800M 多语言多模态编码器,用单个双向 Transformer 处理文本和 32×32 图像 patch,从零以掩码离散扩散目标训练,无需独立视觉塔或因果语言模型。
NVIDIA 发布 Magpie TTS Multilingual,364M 参数开源权重模型,新增现代标准阿拉伯语、韩语和巴西葡萄牙语,共支持 12 种语言。
Meta 发布 30B 参数开源多模态模型 Muse Glimmer,从 Muse 蒸馏而来,采用 Apache 2.0 许可,定位于本地智能体场景如编码、文档分析和个人助理。
推荐理由:原文给出架构细节、跑分对比和多套部署方案,读者可据此评估其在本地多模态智能体场景的可用性。
NVIDIA 发布 Cosmos-H-Dreams,一个动作条件驱动的手术机器人实时生成式仿真器,将 Cosmos-H-Surgical-Simulator 蒸馏为因果、少步数的学生模型,并通过 FlashDreams 流式推理库在单张 NVIDIA RTX PRO 6000 上从约每秒10帧提升到约160帧的交互运行。
Thinking Machines 在 Hugging Face 发布开源多模态模型 Inkling,总参数 975B、激活 41B 的 MoE 架构,原生接受图像、文本和音频输入,支持 1M 上下文窗口,训练数据为 45 万亿 token。
推荐理由:原文给出架构细节、各档位 VRAM 部署配置和多模态评测数据,对评估落地成本和选择变体有直接参考。
PaddlePaddle 发布 PP-OCRv6,提供 tiny、small、medium 三档模型,参数量从 1.5M 到 34.5M,medium 和 small 档支持 50 种语言。
Hcompany 发布 Holo3.1 系列 Computer Use 模型,提供 0.8B、4B、9B 和 35B-A3B 四种尺寸。
推荐理由:官方给出各尺寸在 OSWorld 与 AndroidWorld 的量化后表现和部署路径,读者可据此评估本地 Computer Use Agent 的可行性。
JetBrains 发布 Mellum2,一个总参数 12B、每 token 仅激活 2.5B 的开源 Mixture-of-Experts 模型,在自然语言和代码语料上从头训练,采用 Apache 2.0 许可证。
Hugging Face 的 Tom Aarsen 发布 ettin-reranker-v1 系列,含 17M 到 1B 六个 Sentence Transformers CrossEncoder 重排序模型,基于 Ettin ModernBERT 编码器,Apache 2.0 许可,支持最长 8192 token 上下文。
推荐理由:作者公开了六个模型、完整训练脚本和1.43亿条蒸馏数据,并给出与主流reranker的速度和精度对比,便于按规模选型或自行复现训练。
NVIDIA 发布 Nemotron 3 Nano Omni(30B-A3B)全模态理解模型,支持文档分析、ASR、长音视频理解和 agentic computer use,并在 Hugging Face 开放 BF16、FP8 和 NVFP4 权重。
推荐理由:原文给出完整基准对比和架构细节,读者可以据此评估它是否值得替换现有的多模态工作流。
Google DeepMind 发布 Gemma 4 多模态模型系列,共五个尺寸(E2B、E4B、12B Unified、31B、26B A4B MoE),采用 Apache 2.0 许可,支持图像、文本和音频输入,上下文窗口最高 256K。
推荐理由:Hugging Face 官方详解 Gemma 4 架构、多模态能力与全生态部署方式,还覆盖 DiffusionGemma 和推理加速等上手细节。
TII Falcon Vision 团队发布 Falcon Perception,一个 0.6B 参数的早融合 Transformer,用混合注意力掩码处理图像块与文本,做自然语言提示的开放词汇定位与分割,在 SA-Co 上达到 68.0 Macro-F1(SAM 3 为 62.3),但在 presence calibration 上落后(MCC 0.64 vs 0.82)。
推荐理由:TII 自述用单一早融合 Transformer 做开放词汇感知,读者可以看到架构、数据配方和 SA-Co 与 PBench 上的具体对比依据。
H Company 发布多模态计算机使用模型 Holotron-12B,基于 NVIDIA Nemotron-Nano-2 VL 后训练约 140 亿 token,已在 Hugging Face 以 NVIDIA Open Model License 开放。
H 公司发布其最大的 UI 定位模型 Holo2-235B-A22B Preview,在 ScreenSpot-Pro 达到 78.5%、OSWorld G 达到 79.0%,创下 SOTA 纪录。该模型采用智能体定位方式迭代修正预测,带来 10-20% 相对提升,已作为研究版本在 Hugging Face 开放。训练使用 SkyPilot 统一管理跨云的 Kubernetes 集群任务。
Overworld 发布实时交互式视频扩散模型 Waypoint-1,可通过文本、鼠标和键盘交互生成可进入的虚拟世界。
推荐理由:原文给出训练方法、推理库与帧率数据,并解释它与微调路线世界模型在控制延迟上的差异。
Hugging Face 博客宣布推出 Falcon-H1-Arabic 阿拉伯语模型家族,包含 3B、7B、34B 三种规格,采用融合 Mamba(State Space Model)与 Transformer 注意力的混合架构。
ServiceNow AI 发布 8B 参数安全护栏模型 AprielGuard,可检测 16 类安全风险以及提示注入、越狱、记忆投毒等对抗攻击,并支持独立提示、多轮对话和含工具调用与推理轨迹的 agentic 工作流输入。
SLAM Lab 发布 Apriel-H1 系列,将 15B 推理模型部分注意力层替换为 Mamba,旗舰 Apriel-H1-15b-Thinker-SFT 以 76.8B token 训练实现 2.1 倍吞吐且推理质量损失很小。
mmBERT 发布,基于 ModernBERT 架构,在 1800 多种语言、3T+ token 上训练,是首个在 XTREME 等基准上超越 XLM-R 的多语言编码器。
推荐理由:原文给出三阶段训练细节和完整评测数据,读者可以据此评估其多语言与检索能力是否适合自己的场景。
Google 发布开源嵌入模型 EmbeddingGemma,308M 参数、2K 上下文窗口,支持超过 100 种语言,量化后内存占用低于 200 MB,适合端侧 RAG 和 Agent 场景。
推荐理由:官方博客给出架构、基准和各框架用法,还附完整微调示例,读者可以据此判断如何把它接入现有检索流程。
NVIDIA 发布 600 万条多语言推理数据集 Nemotron Post-Training Dataset v2,将原有英文推理数据翻译为法语、西班牙语、德语、意大利语和日语五种语言,并保留原始英文推理链。
Numina 与 Kimi 开源 kimina-prover-rl,一个基于 DeepSeek-R1 推理范式、与 Verl 完全兼容的 Lean 4 形式化定理证明训练管线,采用 GRPO 强化学习并配套 kimina-lean-server 验证服务。
OpenAI 发布开源权重模型 GPT OSS,包含 117B 参数的 gpt-oss-120b 和 21B 参数的 gpt-oss-20b,均采用 MoE 架构和 MXFP4 4-bit 量化,分别可装入单张 H100 和 16GB 显存,采用 Apache 2.0 许可证。
推荐理由:文章给出两个模型的参数量、量化方案和各硬件平台的具体推理优化建议,读者可按自己的 GPU 直接选择部署路径。
H Company 发布开源 Action VLM 系列 Holo1(含 Holo1-3B 与 Holo1-7B),并同步开源含 1,639 项 UI 任务的 WebClick 多模态定位基准。
推荐理由:官方给出模型规格、定位准确率和每任务成本数字,读者可据此评估这套开源 GUI 自动化方案的实际性价比。
Hugging Face 发布 450M 参数的开源视觉-语言-动作模型 SmolVLA,基于 lerobot 标签下的社区共享数据集预训练,可在消费级硬件(甚至 CPU 或 MacBook)上运行和训练。
Hugging Face 联合 TII 推出 Falcon-Arabic,一个基于 Falcon 3 架构的 7B 参数多语言大模型,支持阿拉伯语和英语。模型通过扩展 32,000 个阿拉伯语 token 进行持续预训练,上下文长度为 32,000 tokens。
Meta 发布 Llama 4 Maverick(约 400B、128 专家)和 Scout(约 109B、16 专家),均为 17B 激活参数的 MoE 原生多模态模型,在最多 40 万亿 token、200 种语言数据上训练。
推荐理由:官方公告给出两款模型的参数、上下文长度与架构细节,读者可以据此评估部署门槛和与 transformers 的集成方式。
DeepSeek-V3 更新版 0324 上架 Hugging Face Hub,架构与原版相同并改为 MIT 许可,重点改进指令遵循、代码与数学能力。官方基准显示 MMLU-Pro 75.9→81.2、AIME 39.6→59.4、LiveCodeBench 39.2→49.2,常与 GPT-4.5 相当、普遍强于 Claude-Sonnet-3.7。
推荐理由:原文汇总了基准对比、能力改进细节和多种本地部署路径,读者可据此评估是否在自己的工作流中替换旧版 V3。
Google 发布 Gemma 3 系列开源模型,提供 1B/4B/12B/27B 四种尺寸,4B 及以上支持图文输入和 140+ 种语言,上下文窗口扩展到 128K(1B 为 32K)。
推荐理由:文章梳理了 Gemma 3 各尺寸能力变化并给出 transformers、llama.cpp、MLX 的推理用法,便于判断上手方式。
Google 发布 SigLIP 2 多语言视觉语言编码器家族,在 sigmoid 损失之上加入解码器、Global-Local 损失和 Masked Prediction 等训练目标。新模型在零样本分类、图文检索和为 VLM 提取视觉表征的迁移能力上全面超过旧版 SigLIP,并新增动态分辨率的 naflex 变体和 1B 参数的 Giant 系列,模型已在 Hugging Face 开放。
Hugging Face 发布 SmolVLM2 系列,包含 2.2B、500M 和 256M 三种参数规模,主打让视频理解在手机到服务器等设备上运行。
推荐理由:官方发布三档小尺寸视频理解模型并给出端侧运行方案,读者可以据此评估轻量多模态模型在自己的设备上的可行性。
Hugging Face 宣布将 Physical Intelligence 开发的 π0 和 π0-FAST 视觉-语言-动作(VLA)机器人基础模型移植到 LeRobot 仓库。
Hugging Face 发布 Open-R1 项目启动一周后的进展更新,目标复现 DeepSeek-R1 缺失的训练管线与合成数据。
推荐理由:官方一周进展报告给出可复现的评测数字、GRPO 训练管线与大规模推理生成的具体配置,读者可以直接沿用其工程做法。
Hugging Face 发布 SmolVLM 家族两款新模型 SmolVLM-256M 和 SmolVLM-500M,各含 base 与 instruct 共 4 个 checkpoint,其中 256M 为迄今最小的 VLM。
推荐理由:官方详述 256M/500M 两款小模型的视觉编码器、数据配比和 tokenization 改动,适合想在受限设备上跑多模态的读者参考选型。
LlamaIndex 与 Hugging Face 发布多语言视觉文档检索嵌入模型 vdr-2b-multi-v1 及英文版 vdr-2b-v1,可直接对文档页截图编码检索,无需 OCR、数据抽取管线或分块。
Answer.AI 与 LightOn 联合发布 ModernBERT 编码器模型系列,提供 base(149M 参数)和 large(395M 参数)两个规格,可作为 BERT 类模型的直接替代。
推荐理由:Answer.AI 与 LightOn 官方发布,作者本人阐述了架构与训练改动,读者可据此评估它能否替换现有 BERT 类工作流。
IBM、Princeton、CMU 和 UIUC 发布基于完全开放数据训练的混合 Mamba2 模型 Bamba-9B,在 vLLM 中相比标准 transformer 实现最高 2.5 倍吞吐提升和 2 倍延迟加速。