BSC-LT 发布 Visual Salamandra 7B 多模态模型,支持图像与视频理解
巴塞罗那超级计算中心语言技术实验室发布 Visual Salamandra,基于 Salamandra Instructed 7B,集成 SigLIP-So400m 视觉编码器、2 层 MLP 投影层和 late-fusion 技术,可处理单图、多图、视频和纯文本输入。
巴塞罗那超级计算中心语言技术实验室发布 Visual Salamandra,基于 Salamandra Instructed 7B,集成 SigLIP-So400m 视觉编码器、2 层 MLP 投影层和 late-fusion 技术,可处理单图、多图、视频和纯文本输入。
Meta 发布 Llama 4 Maverick(约 400B、128 专家)和 Scout(约 109B、16 专家),均为 17B 激活参数的 MoE 原生多模态模型,在最多 40 万亿 token、200 种语言数据上训练。
推荐理由:官方公告给出两款模型的参数、上下文长度与架构细节,读者可以据此评估部署门槛和与 transformers 的集成方式。
Hugging Face 团队宣布 Gradio 每月有超过 100 万开发者使用,并复盘五年增长经验。核心做法包括以 Gradio Blocks 等低层原语代替高层抽象(gr.Blocks 占 80% 用量)、用 share links 一行代码实现应用传播、聚焦机器学习 Web 应用这一细分场景、不设路线图只做快速迭代,以及让每个应用同时生成 API 端点以便本地部署或程序化调用。
Hugging Face 宣布把运营 3 年的 NLP 课程更新扩展为 LLM 课程, hf.co/learn 同步升级。已新增微调 LLM(第 11 章)和构建 Deepseek R1 类推理模型(第 12 章)等章节,并与 LlamaIndex、LangChain、Unsloth、Marimo、Maxime Labonne 合作。
Hugging Face 在从 AWS 迁向多云(Azure、GCP)后,选择 Infisical 替代 HashiCorp Vault 集中管理 secrets。
Hugging Face 宣布将 Intel Gaudi 硬件支持直接合入 Text Generation Inference(TGI)主代码库(PR #3091),取代此前维护的独立 fork,基于 TGI 多后端架构支持 Gaudi1/2/3 全系列硬件。
DeepSeek-V3 更新版 0324 上架 Hugging Face Hub,架构与原版相同并改为 MIT 许可,重点改进指令遵循、代码与数学能力。官方基准显示 MMLU-Pro 75.9→81.2、AIME 39.6→59.4、LiveCodeBench 39.2→49.2,常与 GPT-4.5 相当、普遍强于 Claude-Sonnet-3.7。
推荐理由:原文汇总了基准对比、能力改进细节和多种本地部署路径,读者可据此评估是否在自己的工作流中替换旧版 V3。
Hugging Face 发布 Sentence Transformers 训练和微调 reranker(Cross Encoder)模型的详细教程,覆盖数据集、损失函数、训练参数、评估器和 CrossEncoderTrainer 五个组件,并介绍 mine_hard_negatives 挖掘难负样本。
推荐理由:教程给出完整可复现的 reranker 微调配方和评测数据,读者可据此在自己领域训练出超过通用大模型的小型 reranker。
Hugging Face 的 Gradio 更新了 gr.Dataframe 组件,过去 6 周关闭了 70 多个相关 issue。新功能包括多单元格选择、行号与 pinned_columns 列固定、复制与全屏按钮、static_columns 静态列,以及 show_search 参数提供的搜索和过滤功能,还改进了键盘导航等无障碍体验。
Hugging Face 发布教程,讲解如何用 LM Studio、4bit GGUF 量化的 OlympicCoder 7B 和 VS Code 的 Continue 扩展搭建本地编码助手。
推荐理由:原文给出从 LM Studio 到 VS Code 的完整本地部署步骤,并说明 OlympicCoder 适合竞赛类编码的定位,方法可直接照做。
Hugging Face 于 3 月 14 日向白宫科技政策办公室提交了对白宫 AI 行动计划 RFI 的回应,主张开放 AI 系统与开放科学是提升性能、推广落地和安全保障的关键。
Hugging Face 已将首批 Model 和 Dataset 仓库从 LFS 迁移到 Xet 存储,共 4.5 TB,约占 Hub 下载流量的 6%。Xet 采用内容定义分块(约 64KB chunk)做字节级去重,只传输改动部分;迁移后团队修复了 CAS 下载开销问题(将 GET 延迟降低约 35%)和 Pod 负载不均衡问题。
NVIDIA 在 GTC 2025 上发布三项面向物理 AI 的开源资源:70 亿参数的 Cosmos Transfer 世界基础模型、含超过 32 万条轨迹共 15 TB 数据的 Physical AI Dataset,以及首个开放的人形机器人推理与技能基础模型 NVIDIA Isaac GR00T N1。
推荐理由:官方一次放出 Cosmos Transfer、开放数据集和 GR00T N1 三项资源,开发者可直接获取模型权重与数据用于机器人和自动驾驶研发。
Mistral AI 发布 Mistral Small 3.1,基于 Mistral Small 3 改进文本性能、增加多模态理解和 128k 上下文窗口,推理速度达 150 tokens 每秒。
推荐理由:官方给出基准对比、128k 上下文、单卡部署要求和开源下载入口,可据此评估其在小模型生态的定位。
Google 发布 Gemma 3 系列开源模型,提供 1B/4B/12B/27B 四种尺寸,4B 及以上支持图文输入和 140+ 种语言,上下文窗口扩展到 128K(1B 为 32K)。
推荐理由:文章梳理了 Gemma 3 各尺寸能力变化并给出 transformers、llama.cpp、MLX 的推理用法,便于判断上手方式。
Hugging Face 在 Open R1 第三次更新中发布了从 DeepSeek-R1 蒸馏的 CodeForces-CoTs 数据集(近 10 万样本)、2024 年 IOI 题目构成的 IOI 基准,以及基于 Qwen2.5 Coder 微调的 OlympicCoder-7B 和 OlympicCoder-32B。
推荐理由:Hugging Face 官方复盘训练过程,给出样本打包、学习率等可复用经验,并附带完整数据集、基准和评测代码。
Cohere For AI 发布开源权重视觉语言模型 Aya Vision,包含 8B 和 32B 两个规格,覆盖 23 种语言。32B 在 AyaVisionBench 上以 50% 到 64% 的胜率超过 Llama-3.2 90B Vision 等更大模型,8B 在同参数级领先;同时开源 AyaVisionBench 基准,并可通过 Hugging Face 和 WhatsApp 试用。
印度科学理工学院(IISc)与 ARTPARK 和 Hugging Face 合作,将开源多模态多语言数据集 Vaani 开放给全球开发者。
Hugging Face 发布 FastRTC,一个面向 Python 的实时通信库,用于简化实时音视频 AI 应用开发。库内自动处理语音检测与轮次切换,自带 WebRTC Gradio UI,支持 WebRTC 和 WebSocket,可将 Stream 挂载到任意 FastAPI 应用。
推荐理由:官方发布 Python 实时通信库,内置语音检测、Gradio UI 和免费电话接入,作者还演示了接入 LLM 的完整语音对话代码。
Diffusers 团队推出实验性 Remote VAE 功能,通过 huggingface-inference-toolkit 自定义 handler 将 VAE 解码委托给远程端点,以缓解高分辨率图像和视频生成时消费级 GPU 显存不足、offload 延迟和 tiling 画质损失问题。
Google 发布 SigLIP 2 多语言视觉语言编码器家族,在 sigmoid 损失之上加入解码器、Global-Local 损失和 Masked Prediction 等训练目标。新模型在零样本分类、图文检索和为 VLM 提取视觉表征的迁移能力上全面超过旧版 SigLIP,并新增动态分辨率的 naflex 变体和 1B 参数的 Giant 系列,模型已在 Hugging Face 开放。
Hugging Face 发布 SmolVLM2 系列,包含 2.2B、500M 和 256M 三种参数规模,主打让视频理解在手机到服务器等设备上运行。
推荐理由:官方发布三档小尺寸视频理解模型并给出端侧运行方案,读者可以据此评估轻量多模态模型在自己的设备上的可行性。
Google 发布 PaliGemma 2 mix 系列,这是在 PaliGemma 2 预训练模型基础上针对多种视觉语言任务微调的指令模型,基于 SigLIP 和 Gemma 2,提供 3B、10B、28B 三种规模。
Hugging Face 用 Math-Verify 重新评测了 Open LLM Leaderboard 上全部 3751 个模型,修复旧评测器的格式、SymPy 解析和比较缺陷。模型平均多解对 61 题、整体提升 4.66 分,Qwen 分数翻倍以上、DeepSeek 接近三倍,MATH-Hard 榜首被 Nvidia AceMath 占据。
推荐理由:原文给出了旧评测器三类具体缺陷与修复后的排名变化,读者可以借此判断自己模型的数学评测结果是否被低估。
Fireworks.ai 现已成为 Hugging Face Hub 支持的推理提供商,可在模型页面及 HF 生态中提供高速 serverless 推理。
Hugging Face 作者 hlky 和 Sayak 开源了一套视频生成数据集构建工具,覆盖获取、过滤和处理三阶段,使用 yt-dlp 下载、LAION-5B-WatermarkDetection 检测水印、OpenCV 评估运动,并用 Florence-2 生成多种字幕。
Hugging Face 联合 2A2I、TII 推出的 Open Arabic LLM Leaderboard 即将升级为第二版。第一版上线不到 7 个月吸引超 46,000 访客、提交超 700 个模型(1B 至 70B+ 参数),覆盖 180 多个组织;其中 70% 以上为 chat 和微调模型,超 50% 的模型小于 7B。新版将针对社区反馈,加强阿拉伯语特定任务评测与基准透明度。
Hugging Face 宣布将 Physical Intelligence 开发的 π0 和 π0-FAST 视觉-语言-动作(VLA)机器人基础模型移植到 LeRobot 仓库。
Hugging Face 在 OpenAI 发布 Deep Research 后发起 24 小时复现任务,开源智能体框架并在 GAIA 验证集取得 55.15%,高于此前开源框架 SoTA Magentic-One 的约 46%。
推荐理由:原文给出开源复现 Deep Research 的具体架构与 GAIA 得分对比,读者可迁移其 CodeAgent 方法到自己的智能体系统。
Hugging Face 博客发布教程,用 GRPO 强化学习在 Countdown 数字游戏上训练 Qwen2.5-3B-Instruct,复现 DeepSeek-R1 论文中的小型 aha moment。
推荐理由:原文提供完整的 GRPO 训练代码、配置和分步训练观察,读者可以照此在开源模型上复现小型推理涌现实验。
Hugging Face 推出《AI 艺术工具》通讯第一期,回顾 2024 年 AI 艺术领域的关键进展。
Mistral 发布 Mistral Small 3,一个延迟优化的 24B 参数模型,以 Apache 2.0 许可开源预训练和指令微调权重。模型 MMLU 准确率超 81%,延迟 150 tokens/s,官方称性能与 Llama 3.3 70B instruct 相当且在相同硬件上快 3 倍以上。
推荐理由:24B 参数、Apache 2.0 开源、可在单卡 RTX 4090 本地运行,读者可据此评估低延迟场景下的替代方案。
Hugging Face 与 AWS 合作发布指南,介绍如何用 Hugging Face Inference Endpoints、Amazon Bedrock Marketplace。
Hugging Face 发布博客宣布启动 Open-R1 项目,目标是在开放环境下重建 DeepSeek-R1 的数据与训练流程。博客解释了 DeepSeek-R1 基于DeepSeek-V3 的两阶段训练方法,包括 R1-Zero 用 GRPO 纯强化学习训练和 R1 的冷启动微调加多轮 RL 提炼,并指出 DeepSeek 未公开训练数据、训练代码和超参数细节。
Hugging Face Diffusers 团队发文综述当前开源视频生成模型现状,覆盖 CogVideoX、Mochi-1、HunyuanVideo、LTX Video 等模型及其高资源需求、泛化与延迟等局限。
推荐理由:Diffusers 团队原文梳理了开源视频生成模型现状,并给出实测内存数据和一套可复用的推理与微调优化方法。
Hugging Face 为 smolagents 加入视觉支持,使视觉语言模型可原生用于智能体流程。图像可在 agent.run 启动时传入,也可通过 step_callbacks 在每步动态写入 ActionStep 的 observations_images。
推荐理由:官方详解视觉语言模型如何接入 smolagents 智能体流程,并给出可复用的截图回调和浏览器智能体完整代码。
Hugging Face 发布 SmolVLM 家族两款新模型 SmolVLM-256M 和 SmolVLM-500M,各含 base 与 instruct 共 4 个 checkpoint,其中 256M 为迄今最小的 VLM。
推荐理由:官方详述 256M/500M 两款小模型的视觉编码器、数据配比和 tokenization 改动,适合想在受限设备上跑多模态的读者参考选型。
Hugging Face 与 FriendliAI 达成合作,将 FriendliAI Endpoints 集成到 Hugging Face Hub 的“Deploy this model”按钮中,实现模型一键部署。
Hugging Face 为 Text Generation Inference(TGI)引入 TGI Backends 多后端架构,通过新的 Rust Backend trait 让 TGI 作为统一前端接入不同推理引擎。
Hugging Face 官方博客宣布 transformers 集成 TimmWrapper,让任意 timm 视觉模型可直接使用 pipeline、Auto Classes、Trainer API 和 LoRA 微调。