如何用 Sentence Transformers 训练与微调稀疏嵌入模型
Hugging Face 发布长文教程,讲解如何用 Sentence Transformers 训练和微调稀疏嵌入模型,并演示得到 sparse-encoder/example-inference-free-splade-distilbert-base-uncased-nq。
Hugging Face 发布长文教程,讲解如何用 Sentence Transformers 训练和微调稀疏嵌入模型,并演示得到 sparse-encoder/example-inference-free-splade-distilbert-base-uncased-nq。
Google Gemma 3n 正式开源,发布 E2B 和 E4B 两个尺寸、各含 base 与 instruct 版本,支持图像、文本、音频和视频输入。E2B/E4B 实际参数为 5B/8B,但借助 MatFormer 架构与 Per-Layer Embeddings,仅需 2GB/3GB GPU 内存即可运行,E4B 还在 LMArena 上取得 1300+ 分数。
推荐理由:原文给出模型的有效参数设计、显存需求和各开源库用法,端侧开发者可以据此选择部署方式。
Hugging Face 发布教程,展示用 QLoRA 配合 diffusers 在单张 GPU 上以约 9GB 峰值显存微调 FLUX.1-dev 学习 Alphonse Mucha 画风,700 步在 RTX 4090 上约 41 分钟完成,标准 BF16 LoRA 则需 26GB。
推荐理由:官方博客给出完整的 QLoRA 微调配方和实测显存与耗时数据,方法可直接迁移到消费级显卡上的 FLUX.1-dev 定制训练。
Featherless AI 成为 Hugging Face Hub 支持的 Inference Provider,用户可在模型页面直接使用其 serverless 推理服务。
NVIDIA 发布 Isaac GR00T N1.5——首个开源通用人形机器人基础模型 GR00T N1 的首次重大更新,并提供用 LeRobot SO-101 机械臂遥操作数据进行微调的完整教程。
Hugging Face 与 NVIDIA 在 GTC Paris 上宣布推出 Training Cluster as a Service,让全球研究机构可按需申请 GPU 集群并只为训练运行时长付费。
Mistral AI 发布首个推理模型 Magistral,含 24B 开源的 Magistral Small(Apache 2.0)和企业版 Magistral Medium。
推荐理由:原文给出两版本的具体评测分数、开源许可和部署渠道,读者可据此评估其在推理模型中的定位与可用性。
Hugging Face 发布 ScreenSuite,一套覆盖感知、定位、单步操作和多步智能体四类能力的 GUI Agent 评测套件,整合 13 个基准,如 ScreenQA-Short、ScreenSpot-Pro、AndroidWorld 和 OSWorld。
Hugging Face 在 nanoVLM 仓库中从零实现 KV Caching,生成速度提升 38%。文章讲解自回归生成中重复计算 K/V 的冗余来源,展示通过逐层缓存字典、start_pos 位置对齐以及将 generate 循环拆分为 prefill 和 decode 两阶段来消除冗余计算,并指出这是速度与显存之间的权衡。
Arm 生态负责人 Michael Gamble 构建了一个在 Arm CPU 上本地运行的音频生成应用,无需 GPU 或云端推理。该应用基于 Stability AI 的 Stable Audio Open 模型(经 Hugging Face 获取),用 PyTorch 和 TorchAudio 执行推理,通过减少扩散步数(steps=7)和全线程利用实现数秒内生成。
H Company 发布开源 Action VLM 系列 Holo1(含 Holo1-3B 与 Holo1-7B),并同步开源含 1,639 项 UI 任务的 WebClick 多模态定位基准。
推荐理由:官方给出模型规格、定位准确率和每任务成本数字,读者可据此评估这套开源 GUI 自动化方案的实际性价比。
Hugging Face 在 TRL v0.18.0 通过 PR #3394 引入 vllm_mode="colocate",让 vLLM 不再以独立 HTTP 服务器运行,而是嵌入同一分布式进程组,与 GRPO 训练共享同一批 GPU,消除训练与生成之间的互相等待。
Hugging Face 发布 450M 参数的开源视觉-语言-动作模型 SmolVLA,基于 lerobot 标签下的社区共享数据集预训练,可在消费级硬件(甚至 CPU 或 MacBook)上运行和训练。
TRL 的 GRPOTrainer 通过 compute_liger_loss 接入 liger_kernel 的 GRPO loss。
Hugging Face 与 Dell 在 Dell Tech World 上发布新版 Dell Enterprise Hub,提供模型与应用套件,可在 Dell AI 服务器和 AI PC 上本地部署 AI。
Mistral AI 与 All Hands AI 联合发布面向软件工程任务的智能体模型 Devstral,以 Apache 2.0 许可开源,在 SWE-Bench Verified 上取得 46.8%,超过此前开源 SoTA 6 个百分点以上,并超越 GPT-4.1-mini 超过 20%。
推荐理由:原文给出 SWE-Bench Verified 具体分数和部署门槛,可判断这款开源编码模型在本地与隐私场景的可行性。
TII 发布 Falcon-H1 系列开源模型,包含 0.5B、1.5B、1.5B-Deep、3B、7B、34B 六种规模及对应 instruct 版本,采用注意力与 Mamba-2 并行的混合架构,基于 Apache 2.0 类宽松许可。
Hugging Face 联合 TII 推出 Falcon-Arabic,一个基于 Falcon 3 架构的 7B 参数多语言大模型,支持阿拉伯语和英语。模型通过扩展 32,000 个阿拉伯语 token 进行持续预训练,上下文长度为 32,000 tokens。
Hugging Face 发布 nanoVLM,一个纯 PyTorch 的轻量工具包,可在免费 Colab 上启动视觉语言模型训练,灵感来自 Andrej Karpathy 的 nanoGPT。
推荐理由:原文拆解了 nanoVLM 的架构、训练与推理全流程,代码轻量可读,适合想从头理解 VLM 训练机制的读者上手实践。
Microsoft 与 Hugging Face 在 Microsoft Build 上宣布扩大合作,Azure AI Foundry 现提供 10,000+ Hugging Face 开放模型,可数次点击部署以支持文本、音频和图像 AI 应用。
TII 发布基于 BitNet 架构的 Falcon-Edge 系列三值语言模型,提供 1B 和 3B 两种参数规模,各含 base 和 instruct 版本。
Hugging Face 宣布 Transformers 将成为跨框架的模型定义标准,现支持 300+ 架构,平均每周新增约 3 个,并为 Llama、Qwen、GLM 等热门架构提供 day-0 支持。
推荐理由:Hugging Face 官方说明 Transformers 转型为跨框架模型定义标准,读者可以据此判断训练与推理工具链如何围绕它互通。
Hugging Face 与 Kaggle 推出平台整合,提升 Hugging Face 模型在 Kaggle 上的可见性与可发现性。
Hugging Face LeRobot 团队认为机器人泛化本质上是一个数据问题,正通过简化录制流程、简化上传至 Hugging Face Hub、降低硬件成本,让社区数据集快速增长。目前社区贡献主要集中在 So100 和 Koch 机械臂与操作任务,但自动驾驶、辅助机器人、移动导航等领域同样受益。随着数据采集大众化,数据策展成为下一个挑战。
Hugging Face 博客对比 Qwen-3 与 Qwen-2.5、QwQ 的 Jinja chat template,总结出四点设计差异:Qwen-3 通过 enable_thinking 标志配合空 <think></think> 让推理变为可选项,而 QwQ 强制每次推理。
Hugging Face 官方博客介绍如何用 Gradio 将 Python 函数构建为 MCP 服务器,只需安装 gradio[mcp] 并在 .launch() 中设置 mcp_server=True,即可让 LLM 通过 Claude Desktop、Cursor、Cline 等 MCP Client 调用该应用作为工具。
推荐理由:官方教程演示只需在 launch 中设 mcp_server=True 即可把任意 Gradio 应用变成 MCP server,含资源和鉴权等进阶用法。
Hugging Face 发布 Tiny Agents 教程,展示在 InferenceClient 之上实现 MCP 客户端后,Agent 本质上只是一个 while 循环,全部代码约 50 行 TypeScript。
推荐理由:作者把 MCP 客户端到 Agent 的实现压缩成约 50 行 TypeScript,并提供可运行的开源代码,适合想理解 Agent 与 MCP 基本结构的开发者直接上手。
TNG 基于 olmOCR-7B-0225-preview 微调出一款忠实 OCR 引擎,解决原模型忽略页眉页脚信息的问题,已开源到 HuggingFace。团队用 Qwen2.5-VL-72B-Instruct 生成了 8000 份文档的数据集,在 8xH100 节点上训练 2.5 epochs,默认超参数即可取得良好效果。
Hugging Face 官方博客发文《17 Reasons Why Gradio Isn't Just Another UI Library》,称 Gradio 不只是 Python UI 库,而是可通过 UI 和 API 与机器学习模型交互的框架。
Cohere 正式成为 Hugging Face Hub 支持的 Inference Provider,也是首个在 Hub 上直接分享并提供模型推理的模型创建方。
Hugging Face 宣布收购开源机器人公司 Pollen Robotics,这是其第五次收购,将开售旗舰人形机器人 Reachy 2,售价 $70,000,已用于 Cornell 和 Carnegie Mellon 等实验室。
推荐理由:官方宣布收购开源机器人公司并开放 Reachy 2 订购,读者可据此了解 Hugging Face 从软件平台走向机器人硬件的路线。
Protect AI 与 Hugging Face 自 2024 年 10 月合作以来,截至 2025 年 4 月 1 日已扫描 Hub 上 141 万个仓库中的 447 万个模型版本,累计在 51,700 个模型中发现 352,000 个不安全或可疑问题。
巴塞罗那超级计算中心语言技术实验室发布 Visual Salamandra,基于 Salamandra Instructed 7B,集成 SigLIP-So400m 视觉编码器、2 层 MLP 投影层和 late-fusion 技术,可处理单图、多图、视频和纯文本输入。
Meta 发布 Llama 4 Maverick(约 400B、128 专家)和 Scout(约 109B、16 专家),均为 17B 激活参数的 MoE 原生多模态模型,在最多 40 万亿 token、200 种语言数据上训练。
推荐理由:官方公告给出两款模型的参数、上下文长度与架构细节,读者可以据此评估部署门槛和与 transformers 的集成方式。
Hugging Face 团队宣布 Gradio 每月有超过 100 万开发者使用,并复盘五年增长经验。核心做法包括以 Gradio Blocks 等低层原语代替高层抽象(gr.Blocks 占 80% 用量)、用 share links 一行代码实现应用传播、聚焦机器学习 Web 应用这一细分场景、不设路线图只做快速迭代,以及让每个应用同时生成 API 端点以便本地部署或程序化调用。
Hugging Face 宣布把运营 3 年的 NLP 课程更新扩展为 LLM 课程, hf.co/learn 同步升级。已新增微调 LLM(第 11 章)和构建 Deepseek R1 类推理模型(第 12 章)等章节,并与 LlamaIndex、LangChain、Unsloth、Marimo、Maxime Labonne 合作。
Hugging Face 在从 AWS 迁向多云(Azure、GCP)后,选择 Infisical 替代 HashiCorp Vault 集中管理 secrets。
Hugging Face 宣布将 Intel Gaudi 硬件支持直接合入 Text Generation Inference(TGI)主代码库(PR #3091),取代此前维护的独立 fork,基于 TGI 多后端架构支持 Gaudi1/2/3 全系列硬件。
DeepSeek-V3 更新版 0324 上架 Hugging Face Hub,架构与原版相同并改为 MIT 许可,重点改进指令遵循、代码与数学能力。官方基准显示 MMLU-Pro 75.9→81.2、AIME 39.6→59.4、LiveCodeBench 39.2→49.2,常与 GPT-4.5 相当、普遍强于 Claude-Sonnet-3.7。
推荐理由:原文汇总了基准对比、能力改进细节和多种本地部署路径,读者可据此评估是否在自己的工作流中替换旧版 V3。
Hugging Face 发布 Sentence Transformers 训练和微调 reranker(Cross Encoder)模型的详细教程,覆盖数据集、损失函数、训练参数、评估器和 CrossEncoderTrainer 五个组件,并介绍 mine_hard_negatives 挖掘难负样本。
推荐理由:教程给出完整可复现的 reranker 微调配方和评测数据,读者可据此在自己领域训练出超过通用大模型的小型 reranker。