如何用 Sentence Transformers 训练与微调稀疏嵌入模型
Hugging Face 发布长文教程,讲解如何用 Sentence Transformers 训练和微调稀疏嵌入模型,并演示得到 sparse-encoder/example-inference-free-splade-distilbert-base-uncased-nq。
Hugging Face 发布长文教程,讲解如何用 Sentence Transformers 训练和微调稀疏嵌入模型,并演示得到 sparse-encoder/example-inference-free-splade-distilbert-base-uncased-nq。
Hugging Face 发布教程,展示用 QLoRA 配合 diffusers 在单张 GPU 上以约 9GB 峰值显存微调 FLUX.1-dev 学习 Alphonse Mucha 画风,700 步在 RTX 4090 上约 41 分钟完成,标准 BF16 LoRA 则需 26GB。
推荐理由:官方博客给出完整的 QLoRA 微调配方和实测显存与耗时数据,方法可直接迁移到消费级显卡上的 FLUX.1-dev 定制训练。
TNG 在 24 块 H100 GPU 集群上自托管多个 LLM,日均消耗超 1 亿 token、生成超 1000 万 token。文章分析 vLLM 默认 chunked-prefill 策略下长提示词会阻塞队列:prefill 各请求只能顺序执行,导致后续请求首 token 等待时间变长。
Hugging Face 官方博客介绍 Kernel Hub,开发者可通过 kernels 库的 get_kernel 一行代码加载预编译的优化计算内核,自动匹配 Python、PyTorch 和 CUDA 版本。
推荐理由:原文给出从加载到基准测试的完整可复现步骤,读者可据此评估把优化内核接入自己模型的实际收益。
NVIDIA 发布 Isaac GR00T N1.5——首个开源通用人形机器人基础模型 GR00T N1 的首次重大更新,并提供用 LeRobot SO-101 机械臂遥操作数据进行微调的完整教程。
Hugging Face 在 nanoVLM 仓库中从零实现 KV Caching,生成速度提升 38%。文章讲解自回归生成中重复计算 K/V 的冗余来源,展示通过逐层缓存字典、start_pos 位置对齐以及将 generate 循环拆分为 prefill 和 decode 两阶段来消除冗余计算,并指出这是速度与显存之间的权衡。
Arm 生态负责人 Michael Gamble 构建了一个在 Arm CPU 上本地运行的音频生成应用,无需 GPU 或云端推理。该应用基于 Stability AI 的 Stable Audio Open 模型(经 Hugging Face 获取),用 PyTorch 和 TorchAudio 执行推理,通过减少扩散步数(steps=7)和全线程利用实现数秒内生成。
Hugging Face 在 TRL v0.18.0 通过 PR #3394 引入 vllm_mode="colocate",让 vLLM 不再以独立 HTTP 服务器运行,而是嵌入同一分布式进程组,与 GRPO 训练共享同一批 GPU,消除训练与生成之间的互相等待。
Hugging Face 发布研究,让 CodeAgent 以强制 JSON 结构同时生成 thoughts 和 code,在 GAIA、MATH、SimpleQA、Frames 等基准上比常规 CodeAgent 平均高出 2-7 个百分点。
推荐理由:原文给出结构化输出结合 CodeAgent 的实测数据与适用边界,读者可据此判断自己的模型规模是否适合启用该方案。
TRL 的 GRPOTrainer 通过 compute_liger_loss 接入 liger_kernel 的 GRPO loss。
Hugging Face 发布 Python 版 Tiny Agents,将 huggingface_hub SDK 扩展为 MCP Client,用约 70 行代码即可构建可调用 MCP 工具的 Agent。
推荐理由:官方博客展示了 MCP Client 如何让约 70 行 Python 代码搭起可调用工具的 Agent,核心思路可迁移到自己的项目。
Hugging Face 发布 nanoVLM,一个纯 PyTorch 的轻量工具包,可在免费 Colab 上启动视觉语言模型训练,灵感来自 Andrej Karpathy 的 nanoGPT。
推荐理由:原文拆解了 nanoVLM 的架构、训练与推理全流程,代码轻量可读,适合想从头理解 VLM 训练机制的读者上手实践。
Hugging Face 发布 Diffusers 量化后端解读文章,以 black-forest-labs/FLUX.1-dev 为例实测 bitsandbytes、torchao、Quanto、GGUF 和 FP8 Layerwise Casting 五种方案。
推荐理由:文章系统对比了 Diffusers 各量化后端在 Flux-dev 上的内存、速度与画质差异,并给出选型建议和可复现代码。
Hugging Face 发布长文,回顾 2024 年 4 月以来视觉语言模型(VLM)的关键变化与趋势。
推荐理由:Hugging Face 系统梳理了过去一年 VLM 的新架构、多模态 RAG、智能体与安全模型,可作为领域入门与选型参考。
Hugging Face LeRobot 团队认为机器人泛化本质上是一个数据问题,正通过简化录制流程、简化上传至 Hugging Face Hub、降低硬件成本,让社区数据集快速增长。目前社区贡献主要集中在 So100 和 Koch 机械臂与操作任务,但自动驾驶、辅助机器人、移动导航等领域同样受益。随着数据采集大众化,数据策展成为下一个挑战。
Hugging Face 博客对比 Qwen-3 与 Qwen-2.5、QwQ 的 Jinja chat template,总结出四点设计差异:Qwen-3 通过 enable_thinking 标志配合空 <think></think> 让推理变为可选项,而 QwQ 强制每次推理。
Hugging Face 官方博客介绍如何用 Gradio 将 Python 函数构建为 MCP 服务器,只需安装 gradio[mcp] 并在 .launch() 中设置 mcp_server=True,即可让 LLM 通过 Claude Desktop、Cursor、Cline 等 MCP Client 调用该应用作为工具。
推荐理由:官方教程演示只需在 launch 中设 mcp_server=True 即可把任意 Gradio 应用变成 MCP server,含资源和鉴权等进阶用法。
Hugging Face 发布 Tiny Agents 教程,展示在 InferenceClient 之上实现 MCP 客户端后,Agent 本质上只是一个 while 循环,全部代码约 50 行 TypeScript。
推荐理由:作者把 MCP 客户端到 Agent 的实现压缩成约 50 行 TypeScript,并提供可运行的开源代码,适合想理解 Agent 与 MCP 基本结构的开发者直接上手。
TNG 基于 olmOCR-7B-0225-preview 微调出一款忠实 OCR 引擎,解决原模型忽略页眉页脚信息的问题,已开源到 HuggingFace。团队用 Qwen2.5-VL-72B-Instruct 生成了 8000 份文档的数据集,在 8xH100 节点上训练 2.5 epochs,默认超参数即可取得良好效果。
TNG 在 Hugging Face 博客发布 LLM 性能系列第二篇,讲解 prefill 与 decode 两个阶段对延迟、吞吐和 GPU 利用率的影响,并比较 static batching、continuous batching 和 prefill-first 等并发策略。
Hugging Face 官方博客发文《17 Reasons Why Gradio Isn't Just Another UI Library》,称 Gradio 不只是 Python UI 库,而是可通过 UI 和 API 与机器学习模型交互的框架。
Mistral 介绍用“LLM As A Judge”评估 RAG 系统的方法,即由一个 judge LLM 按 1-10、True/False 或定性等级为 generator LLM 的回答打分。
Hugging Face 宣布把运营 3 年的 NLP 课程更新扩展为 LLM 课程, hf.co/learn 同步升级。已新增微调 LLM(第 11 章)和构建 Deepseek R1 类推理模型(第 12 章)等章节,并与 LlamaIndex、LangChain、Unsloth、Marimo、Maxime Labonne 合作。
TNG Technology Consulting 分享自托管 LLM 服务时的请求排队优化经验,指出单个"重度用户"大量请求会通过 vLLM 等推理引擎的 FIFO 队列阻塞其他用户。
Hugging Face 在从 AWS 迁向多云(Azure、GCP)后,选择 Infisical 替代 HashiCorp Vault 集中管理 secrets。
Hugging Face 发布 Sentence Transformers 训练和微调 reranker(Cross Encoder)模型的详细教程,覆盖数据集、损失函数、训练参数、评估器和 CrossEncoderTrainer 五个组件,并介绍 mine_hard_negatives 挖掘难负样本。
推荐理由:教程给出完整可复现的 reranker 微调配方和评测数据,读者可据此在自己领域训练出超过通用大模型的小型 reranker。
Hugging Face 发布教程,讲解如何用 LM Studio、4bit GGUF 量化的 OlympicCoder 7B 和 VS Code 的 Continue 扩展搭建本地编码助手。
推荐理由:原文给出从 LM Studio 到 VS Code 的完整本地部署步骤,并说明 OlympicCoder 适合竞赛类编码的定位,方法可直接照做。
Hugging Face 发布端侧推理教程,用 React Native、llama.rn(llama.cpp 绑定)和 react-native-fs 构建可从 Hub 下载 GGUF 模型并完全离线对话的移动应用,代码在 EdgeLLM 仓库。
推荐理由:教程讲解模型选择与 GGUF 量化差异,并用 llama.rn 完整走通端侧聊天应用,方法可直接复用。
Mistral AI 推出 TranscriptToPRDTicket 智能体工作流,由 Mistral Large 2 驱动,可自动将会议记录生成 PRD 并创建开发任务。该流程包含 PRDAgent 和 TicketCreationAgent 两个组件,能在 Linear、Jira 等项目管理工具中自动创建结构化任务票。完整实现已发布在 Google Colab 笔记本中供使用。
Hugging Face 博客讲解如何用 smolagents 构建一个配备 DuckDuckGoSearchTool 和 VisitWebpageTool 的 CodeAgent,并通过 Arize Phoenix 结合 OpenTelemetry + OpenInference 实现对 Agent 每一步调用的实时追踪与调试。
Diffusers 团队推出实验性 Remote VAE 功能,通过 huggingface-inference-toolkit 自定义 handler 将 VAE 解码委托给远程端点,以缓解高分辨率图像和视频生成时消费级 GPU 显存不足、offload 延迟和 tiling 画质损失问题。
这篇 Hugging Face 博客给出每天 10 亿级分类或嵌入推理的成本优化框架,用 Inference Endpoints、Infinity 和 Grafana k6 对三种用例实测。
推荐理由:原文给出可复现的成本与延迟优化框架和实测数字,读者可按自己的任务估算大规模分类和嵌入推理开销。
Hugging Face 作者 hlky 和 Sayak 开源了一套视频生成数据集构建工具,覆盖获取、过滤和处理三阶段,使用 yt-dlp 下载、LAION-5B-WatermarkDetection 检测水印、OpenCV 评估运动,并用 Florence-2 生成多种字幕。
Hugging Face 宣布将 Physical Intelligence 开发的 π0 和 π0-FAST 视觉-语言-动作(VLA)机器人基础模型移植到 LeRobot 仓库。
OpenAI 展示如何基于 ChatGPT 构建定制数学辅导应用。文章介绍了 ChatGPT 在个性化一对一教学场景中的使用方式与搭建思路。
Hugging Face 博客发布教程,用 GRPO 强化学习在 Countdown 数字游戏上训练 Qwen2.5-3B-Instruct,复现 DeepSeek-R1 论文中的小型 aha moment。
推荐理由:原文提供完整的 GRPO 训练代码、配置和分步训练观察,读者可以照此在开源模型上复现小型推理涌现实验。
Hugging Face 与 AWS 合作发布指南,介绍如何用 Hugging Face Inference Endpoints、Amazon Bedrock Marketplace。
Hugging Face Diffusers 团队发文综述当前开源视频生成模型现状,覆盖 CogVideoX、Mochi-1、HunyuanVideo、LTX Video 等模型及其高资源需求、泛化与延迟等局限。
推荐理由:Diffusers 团队原文梳理了开源视频生成模型现状,并给出实测内存数据和一套可复用的推理与微调优化方法。
Hugging Face 与 NVIDIA 发布 KVPress 教程,介绍如何通过压缩 KV Cache 实现省内存的长上下文 LLM 推理。
Hugging Face 发布用 Sentence Transformers 训练静态嵌入模型的方法,新模型在 CPU 上比 all-mpnet-base-v2 等常见模型快 100 到 400 倍,同时保留至少 85% 的性能。
推荐理由:原文完整公开了静态嵌入模型的训练配方、脚本和数据集清单,并给出与主流模型的性能对比,可复用于低成本嵌入场景。