Gradio 发布全新 gr.Dataframe 组件更新
Hugging Face 的 Gradio 更新了 gr.Dataframe 组件,过去 6 周关闭了 70 多个相关 issue。新功能包括多单元格选择、行号与 pinned_columns 列固定、复制与全屏按钮、static_columns 静态列,以及 show_search 参数提供的搜索和过滤功能,还改进了键盘导航等无障碍体验。
Hugging Face 的 Gradio 更新了 gr.Dataframe 组件,过去 6 周关闭了 70 多个相关 issue。新功能包括多单元格选择、行号与 pinned_columns 列固定、复制与全屏按钮、static_columns 静态列,以及 show_search 参数提供的搜索和过滤功能,还改进了键盘导航等无障碍体验。
Hugging Face 发布教程,讲解如何用 LM Studio、4bit GGUF 量化的 OlympicCoder 7B 和 VS Code 的 Continue 扩展搭建本地编码助手。
推荐理由:原文给出从 LM Studio 到 VS Code 的完整本地部署步骤,并说明 OlympicCoder 适合竞赛类编码的定位,方法可直接照做。
Hugging Face 于 3 月 14 日向白宫科技政策办公室提交了对白宫 AI 行动计划 RFI 的回应,主张开放 AI 系统与开放科学是提升性能、推广落地和安全保障的关键。
Hugging Face 已将首批 Model 和 Dataset 仓库从 LFS 迁移到 Xet 存储,共 4.5 TB,约占 Hub 下载流量的 6%。Xet 采用内容定义分块(约 64KB chunk)做字节级去重,只传输改动部分;迁移后团队修复了 CAS 下载开销问题(将 GET 延迟降低约 35%)和 Pod 负载不均衡问题。
NVIDIA 在 GTC 2025 上发布三项面向物理 AI 的开源资源:70 亿参数的 Cosmos Transfer 世界基础模型、含超过 32 万条轨迹共 15 TB 数据的 Physical AI Dataset,以及首个开放的人形机器人推理与技能基础模型 NVIDIA Isaac GR00T N1。
推荐理由:官方一次放出 Cosmos Transfer、开放数据集和 GR00T N1 三项资源,开发者可直接获取模型权重与数据用于机器人和自动驾驶研发。
Mistral AI 发布 Mistral Small 3.1,基于 Mistral Small 3 改进文本性能、增加多模态理解和 128k 上下文窗口,推理速度达 150 tokens 每秒。
推荐理由:官方给出基准对比、128k 上下文、单卡部署要求和开源下载入口,可据此评估其在小模型生态的定位。
Google 发布 Gemma 3 系列开源模型,提供 1B/4B/12B/27B 四种尺寸,4B 及以上支持图文输入和 140+ 种语言,上下文窗口扩展到 128K(1B 为 32K)。
推荐理由:文章梳理了 Gemma 3 各尺寸能力变化并给出 transformers、llama.cpp、MLX 的推理用法,便于判断上手方式。
Hugging Face 在 Open R1 第三次更新中发布了从 DeepSeek-R1 蒸馏的 CodeForces-CoTs 数据集(近 10 万样本)、2024 年 IOI 题目构成的 IOI 基准,以及基于 Qwen2.5 Coder 微调的 OlympicCoder-7B 和 OlympicCoder-32B。
推荐理由:Hugging Face 官方复盘训练过程,给出样本打包、学习率等可复用经验,并附带完整数据集、基准和评测代码。
Cohere For AI 发布开源权重视觉语言模型 Aya Vision,包含 8B 和 32B 两个规格,覆盖 23 种语言。32B 在 AyaVisionBench 上以 50% 到 64% 的胜率超过 Llama-3.2 90B Vision 等更大模型,8B 在同参数级领先;同时开源 AyaVisionBench 基准,并可通过 Hugging Face 和 WhatsApp 试用。
印度科学理工学院(IISc)与 ARTPARK 和 Hugging Face 合作,将开源多模态多语言数据集 Vaani 开放给全球开发者。
Hugging Face 发布 FastRTC,一个面向 Python 的实时通信库,用于简化实时音视频 AI 应用开发。库内自动处理语音检测与轮次切换,自带 WebRTC Gradio UI,支持 WebRTC 和 WebSocket,可将 Stream 挂载到任意 FastAPI 应用。
推荐理由:官方发布 Python 实时通信库,内置语音检测、Gradio UI 和免费电话接入,作者还演示了接入 LLM 的完整语音对话代码。
Diffusers 团队推出实验性 Remote VAE 功能,通过 huggingface-inference-toolkit 自定义 handler 将 VAE 解码委托给远程端点,以缓解高分辨率图像和视频生成时消费级 GPU 显存不足、offload 延迟和 tiling 画质损失问题。
Google 发布 SigLIP 2 多语言视觉语言编码器家族,在 sigmoid 损失之上加入解码器、Global-Local 损失和 Masked Prediction 等训练目标。新模型在零样本分类、图文检索和为 VLM 提取视觉表征的迁移能力上全面超过旧版 SigLIP,并新增动态分辨率的 naflex 变体和 1B 参数的 Giant 系列,模型已在 Hugging Face 开放。
Hugging Face 发布 SmolVLM2 系列,包含 2.2B、500M 和 256M 三种参数规模,主打让视频理解在手机到服务器等设备上运行。
推荐理由:官方发布三档小尺寸视频理解模型并给出端侧运行方案,读者可以据此评估轻量多模态模型在自己的设备上的可行性。
Google 发布 PaliGemma 2 mix 系列,这是在 PaliGemma 2 预训练模型基础上针对多种视觉语言任务微调的指令模型,基于 SigLIP 和 Gemma 2,提供 3B、10B、28B 三种规模。
Hugging Face 用 Math-Verify 重新评测了 Open LLM Leaderboard 上全部 3751 个模型,修复旧评测器的格式、SymPy 解析和比较缺陷。模型平均多解对 61 题、整体提升 4.66 分,Qwen 分数翻倍以上、DeepSeek 接近三倍,MATH-Hard 榜首被 Nvidia AceMath 占据。
推荐理由:原文给出了旧评测器三类具体缺陷与修复后的排名变化,读者可以借此判断自己模型的数学评测结果是否被低估。
Fireworks.ai 现已成为 Hugging Face Hub 支持的推理提供商,可在模型页面及 HF 生态中提供高速 serverless 推理。
Hugging Face 作者 hlky 和 Sayak 开源了一套视频生成数据集构建工具,覆盖获取、过滤和处理三阶段,使用 yt-dlp 下载、LAION-5B-WatermarkDetection 检测水印、OpenCV 评估运动,并用 Florence-2 生成多种字幕。
Hugging Face 联合 2A2I、TII 推出的 Open Arabic LLM Leaderboard 即将升级为第二版。第一版上线不到 7 个月吸引超 46,000 访客、提交超 700 个模型(1B 至 70B+ 参数),覆盖 180 多个组织;其中 70% 以上为 chat 和微调模型,超 50% 的模型小于 7B。新版将针对社区反馈,加强阿拉伯语特定任务评测与基准透明度。
Hugging Face 宣布将 Physical Intelligence 开发的 π0 和 π0-FAST 视觉-语言-动作(VLA)机器人基础模型移植到 LeRobot 仓库。
Hugging Face 在 OpenAI 发布 Deep Research 后发起 24 小时复现任务,开源智能体框架并在 GAIA 验证集取得 55.15%,高于此前开源框架 SoTA Magentic-One 的约 46%。
推荐理由:原文给出开源复现 Deep Research 的具体架构与 GAIA 得分对比,读者可迁移其 CodeAgent 方法到自己的智能体系统。
Hugging Face 博客发布教程,用 GRPO 强化学习在 Countdown 数字游戏上训练 Qwen2.5-3B-Instruct,复现 DeepSeek-R1 论文中的小型 aha moment。
推荐理由:原文提供完整的 GRPO 训练代码、配置和分步训练观察,读者可以照此在开源模型上复现小型推理涌现实验。
Hugging Face 推出《AI 艺术工具》通讯第一期,回顾 2024 年 AI 艺术领域的关键进展。
Mistral 发布 Mistral Small 3,一个延迟优化的 24B 参数模型,以 Apache 2.0 许可开源预训练和指令微调权重。模型 MMLU 准确率超 81%,延迟 150 tokens/s,官方称性能与 Llama 3.3 70B instruct 相当且在相同硬件上快 3 倍以上。
推荐理由:24B 参数、Apache 2.0 开源、可在单卡 RTX 4090 本地运行,读者可据此评估低延迟场景下的替代方案。
Hugging Face 与 AWS 合作发布指南,介绍如何用 Hugging Face Inference Endpoints、Amazon Bedrock Marketplace。
Hugging Face 发布博客宣布启动 Open-R1 项目,目标是在开放环境下重建 DeepSeek-R1 的数据与训练流程。博客解释了 DeepSeek-R1 基于DeepSeek-V3 的两阶段训练方法,包括 R1-Zero 用 GRPO 纯强化学习训练和 R1 的冷启动微调加多轮 RL 提炼,并指出 DeepSeek 未公开训练数据、训练代码和超参数细节。
Hugging Face Diffusers 团队发文综述当前开源视频生成模型现状,覆盖 CogVideoX、Mochi-1、HunyuanVideo、LTX Video 等模型及其高资源需求、泛化与延迟等局限。
推荐理由:Diffusers 团队原文梳理了开源视频生成模型现状,并给出实测内存数据和一套可复用的推理与微调优化方法。
Hugging Face 为 smolagents 加入视觉支持,使视觉语言模型可原生用于智能体流程。图像可在 agent.run 启动时传入,也可通过 step_callbacks 在每步动态写入 ActionStep 的 observations_images。
推荐理由:官方详解视觉语言模型如何接入 smolagents 智能体流程,并给出可复用的截图回调和浏览器智能体完整代码。
Hugging Face 发布 SmolVLM 家族两款新模型 SmolVLM-256M 和 SmolVLM-500M,各含 base 与 instruct 共 4 个 checkpoint,其中 256M 为迄今最小的 VLM。
推荐理由:官方详述 256M/500M 两款小模型的视觉编码器、数据配比和 tokenization 改动,适合想在受限设备上跑多模态的读者参考选型。
Hugging Face 与 FriendliAI 达成合作,将 FriendliAI Endpoints 集成到 Hugging Face Hub 的“Deploy this model”按钮中,实现模型一键部署。
Hugging Face 为 Text Generation Inference(TGI)引入 TGI Backends 多后端架构,通过新的 Rust Backend trait 让 TGI 作为统一前端接入不同推理引擎。
Hugging Face 官方博客宣布 transformers 集成 TimmWrapper,让任意 timm 视觉模型可直接使用 pipeline、Auto Classes、Trainer API 和 LoRA 微调。
Hugging Face 发布用 Sentence Transformers 训练静态嵌入模型的方法,新模型在 CPU 上比 all-mpnet-base-v2 等常见模型快 100 到 400 倍,同时保留至少 85% 的性能。
推荐理由:原文完整公开了静态嵌入模型的训练配方、脚本和数据集清单,并给出与主流模型的性能对比,可复用于低成本嵌入场景。
LlamaIndex 与 Hugging Face 发布多语言视觉文档检索嵌入模型 vdr-2b-multi-v1 及英文版 vdr-2b-v1,可直接对文档页截图编码检索,无需 OCR、数据抽取管线或分块。
Hugging Face 基于 Open LLM Leaderboard 上 2,742 个模型的评测数据,分析了模型推理的 CO₂ 排放趋势。模型越大排放越高,但收益递减;Qwen-2.5-14B 和 Phi-3-Medium 的得分-排放比最优,MoE 排放偏高。社区微调模型普遍比官方微调更省碳,10B 以下社区模型可平均得分 35、排放低于 5kg CO₂。
Hugging Face 发布 smolagents,一个约几千行代码的极简智能体库,支持以代码形式编写动作的 CodeAgent,可通过 E2B 沙箱安全执行,并保留传统 JSON 调用的 ToolCallingAgent。
推荐理由:官方发布并给出代码示例与基准对比,读者可以了解用代码写动作的智能体库如何上手以及何时该用智能体。
Hugging Face 发布教程,讲解如何用 torch.cuda.memory 快照工具可视化 PyTorch 训练各阶段的 GPU 内存占用。文章以 Qwen/Qwen2.5-1.5B 训练循环为例拆解参数、优化器状态、激活、梯度和优化器中间值的内存构成,并给出总内存估算公式与激活数量的线性启发式。
推荐理由:原文用 PyTorch 内存快照工具拆解训练各阶段的显存构成,并给出可复用的总内存估算公式和启发式,便于读者定位显存瓶颈。
Answer.AI 与 LightOn 联合发布 ModernBERT 编码器模型系列,提供 base(149M 参数)和 large(395M 参数)两个规格,可作为 BERT 类模型的直接替代。
推荐理由:Answer.AI 与 LightOn 官方发布,作者本人阐述了架构与训练改动,读者可据此评估它能否替换现有 BERT 类工作流。
IBM、Princeton、CMU 和 UIUC 发布基于完全开放数据训练的混合 Mamba2 模型 Bamba-9B,在 vLLM 中相比标准 transformer 实现最高 2.5 倍吞吐提升和 2 倍延迟加速。
TII 发布 Falcon3 开源模型家族,包含 Falcon3-1B-Base、3B、7B、10B 和 Mamba-7B 五个基座模型,均低于 10B 参数。