Hugging Face 发布视频生成数据集构建工具与脚本
Hugging Face 作者 hlky 和 Sayak 开源了一套视频生成数据集构建工具,覆盖获取、过滤和处理三阶段,使用 yt-dlp 下载、LAION-5B-WatermarkDetection 检测水印、OpenCV 评估运动,并用 Florence-2 生成多种字幕。
Hugging Face 作者 hlky 和 Sayak 开源了一套视频生成数据集构建工具,覆盖获取、过滤和处理三阶段,使用 yt-dlp 下载、LAION-5B-WatermarkDetection 检测水印、OpenCV 评估运动,并用 Florence-2 生成多种字幕。
OpenAI 展示如何基于 ChatGPT 构建定制数学辅导应用。文章介绍了 ChatGPT 在个性化一对一教学场景中的使用方式与搭建思路。
Hugging Face 博客发布教程,用 GRPO 强化学习在 Countdown 数字游戏上训练 Qwen2.5-3B-Instruct,复现 DeepSeek-R1 论文中的小型 aha moment。
推荐理由:原文提供完整的 GRPO 训练代码、配置和分步训练观察,读者可以照此在开源模型上复现小型推理涌现实验。
Hugging Face 与 AWS 合作发布指南,介绍如何用 Hugging Face Inference Endpoints、Amazon Bedrock Marketplace。
Hugging Face Diffusers 团队发文综述当前开源视频生成模型现状,覆盖 CogVideoX、Mochi-1、HunyuanVideo、LTX Video 等模型及其高资源需求、泛化与延迟等局限。
推荐理由:Diffusers 团队原文梳理了开源视频生成模型现状,并给出实测内存数据和一套可复用的推理与微调优化方法。
Hugging Face 与 NVIDIA 发布 KVPress 教程,介绍如何通过压缩 KV Cache 实现省内存的长上下文 LLM 推理。
Hugging Face 官方博客宣布 transformers 集成 TimmWrapper,让任意 timm 视觉模型可直接使用 pipeline、Auto Classes、Trainer API 和 LoRA 微调。
Hugging Face 发布用 Sentence Transformers 训练静态嵌入模型的方法,新模型在 CPU 上比 all-mpnet-base-v2 等常见模型快 100 到 400 倍,同时保留至少 85% 的性能。
推荐理由:原文完整公开了静态嵌入模型的训练配方、脚本和数据集清单,并给出与主流模型的性能对比,可复用于低成本嵌入场景。
Hugging Face 基于 Open LLM Leaderboard 上 2,742 个模型的评测数据,分析了模型推理的 CO₂ 排放趋势。模型越大排放越高,但收益递减;Qwen-2.5-14B 和 Phi-3-Medium 的得分-排放比最优,MoE 排放偏高。社区微调模型普遍比官方微调更省碳,10B 以下社区模型可平均得分 35、排放低于 5kg CO₂。
Hugging Face 发布教程,讲解如何用 torch.cuda.memory 快照工具可视化 PyTorch 训练各阶段的 GPU 内存占用。文章以 Qwen/Qwen2.5-1.5B 训练循环为例拆解参数、优化器状态、激活、梯度和优化器中间值的内存构成,并给出总内存估算公式与激活数量的线性启发式。
推荐理由:原文用 PyTorch 内存快照工具拆解训练各阶段的显存构成,并给出可复用的总内存估算公式和启发式,便于读者定位显存瓶颈。
Hugging Face 博客介绍 NVIDIA 开源的 LogitsProcessorZoo,一组与 Transformers 的 generate 方法兼容的模块化 logits 处理器,通过直接修改输出概率分布来控制生成。
推荐理由:原文给出四个 logits 处理器的参数、代码和实际输出对比,读者可以直接照着控制生成长度、引用、结尾短语和选择题格式。
Hugging Face 在 Google Cloud 两款 Xeon 实例上评测了 Agentic AI 的文本嵌入与文本生成两类负载。
Hugging Face 博客作者搭建了一个 Keras chatbot arena,用 Gradio、Spaces、JAX 和 TPU 测试 LLM 在对话中被指出错误后能否自行修复。
Hugging Face 与 Capital Fund Management(CFM)分享如何用 Llama 3.1-70b 通过 Inference Endpoints 辅助标注 FNSPID 金融新闻数据,并用 Argilla 人工复核。
推荐理由:文章完整给出 LLM 辅助标注加小模型微调的流程与成本数据,读者可复用这套方法平衡精度与推理开销。
Hugging Face 博客以迭代推导方式讲解位置编码设计,从整数编码、二进制编码到正弦编码,最终推导出 Llama 3.2 等现代 Transformer 采用的 RoPE。
推荐理由:文章把 RoPE 的设计过程拆成可跟随的迭代推导,从整数编码一步步走到旋转矩阵,适合想理解位置编码原理的读者。
Hugging Face 详解 LayerSkip 提出的 self-speculative decoding:用同一模型的浅层生成草稿 token、深层做验证,兼得加速、内存节省与更低延迟。
Intel Labs 与 Hugging Face 推出 Universal Assisted Generation(UAG),通过双向 tokenizer 翻译让辅助生成不再要求目标模型与助手模型共享同一 tokenizer,可将任意 decoder 或 MoE 模型的推理加速 1.5x-2.0x 且几乎零开销。
推荐理由:原文解释了跨 tokenizer 助手模型的实现原理并给出多组加速数据,还提供 Transformers 4.46.0 的可用代码。
Digital Green 与 Hugging Face Expert Support 合作,为面向小农户的农业问答机器人 Farmer.chat 搭建了 LLM-as-a-judge 评测体系,覆盖提示词清晰度、问题类型、回答率和 RAG 准确性等指标,LLM 评分与约 360 题的人工评估高度相关。
Hugging Face 的 Speech-to-Speech(S2S)项目通过 VAD、STT、语言模型和 TTS 组成的级联 pipeline 实现语音对话,支持英、法、西、中、日、韩六种语言及自动语言检测。
Llama 3.2 两周前登陆 Hugging Face/Transformers,而 Keras 从第一天起就支持它,可直接从 safetensors 格式的 Hugging Face checkpoint 加载,如 "hf://meta-llama/Llama-3.2-1B-Instruct"。
Hugging Face 修复 transformers 中梯度累积下默认损失函数计算错误的问题,此前开启与关闭梯度累积的训练损失不一致。对于因果 LM 等词元级任务,正确做法是所有 batch 损失求和后除以全部非填充 token 数,而非对每个 batch 损失取平均。
Hugging Face 博客发布教程,演示如何用 Dask 和 Coiled 把 FineWeb-Edu 分类器推理从 pandas 处理 100 行扩展到云端多 GPU 并行处理 2.11 亿行。
Intel labs 与 Hugging Face 提出动态推测解码,通过基于草稿模型置信度阈值动态调整每轮推测 lookahead,文本生成最高加速 2.7x,并从 Transformers 4.45.0 起成为辅助生成的默认模式。
Hugging Face Xet 团队研究提升 Hub 上 Parquet 文件的存储去重效率,目前 Hub 上 Parquet 文件占用超过 2.2PB 存储。
Hugging Face 发布教程,讲解如何将顶点着色网格转换为 UV 映射的带贴图网格,并开源了 InstantTexture 库实现一键转换。教程详解用 xatlas 生成 UV 映射、通过重心插值填充 1024 尺寸纹理,再结合 inpainting、中值滤波、高斯模糊和降采样消除纹理孔洞。这类顶点着色网格常见于 InstantMesh 等生成式 3D 模型的输出。
Hugging Face 介绍其 Daily Papers 页面的多项实用功能。过去一年该页面已收录超过 3,700 篇论文,订阅者超过 12k。用户可一键认领论文、提交推荐论文、@作者讨论、用 @librarian-bot 获取相似论文推荐,还能通过多语言评论翻译和 arXiv 扩展跳转体验相关 Space demo。
Hugging Face 指导如何用 Optimum-Intel 和 OpenVINO GenAI 优化并部署 Transformers 模型,以 meta-llama/Meta-Llama-3.1-8B 为例,通过 NNCF 进行 INT8/INT4 weight-only 量化(如 AWQ、scale estimation、混合精度)。
Hugging Face 发布把 Llama3 8B 微调到 BitNet 1.58 比特(三元权重 -1/0/1)的方法,模型在 HF1BitLLM 组织开源,其中两个在 10B tokens 上训练、一个在 100B tokens 上训练,MMLU 成绩超过 Llama 1 7B。
Hugging Face LeRobot 团队提出 LeRobotDataset 格式,用视频编码存储机器人数据集的视觉模态,数据集平均仅为其原大小的 14%(最佳情况可达 0.2%),且保持完整训练能力。解码方面,单帧加载时间与 PNG 压缩图像相当,解码多连续帧时仅为 PNG 加载时间的 25%-50%。该格式轻量、易分享(与 Hub 原生集成)并配有在线可视化工具。
Hugging Face 官方博客盘点 Hub 上五个常被忽视的工具:ZeroGPU(免费 A100 GPU,每工作负载 40GB vRAM)、多进程 Docker Space(用 supervisord)、Gradio API、Webhooks 和 Nomic Atlas 语义搜索。
推荐理由:作者用免费语义搜索项目实际串起 ZeroGPU、多进程 Docker、Gradio API、Webhooks 和 Nomic Atlas 的用法,附可直接复用的代码示例。
Hugging Face 通过新 PR 和 DataCollatorWithFlattening 使无填充打包的指令微调训练兼容 Flash Attention 2,TRL 的 SFTTrainer 也可通过 padding_free=True 使用。
这篇 Hugging Face 教程讲解如何在 Google Cloud A3 节点(8 x H100)上,用 TGI 的 Deep Learning Containers 在 Vertex AI 上部署 Meta Llama 3.1 405B 的 FP8 量化版 Meta-Llama-3.1-405B-Instruct-FP8。
Hugging Face 复现 Google 的 Infini-attention 论文后发现,压缩记忆次数越多,性能反而越差,90% 的时间花在调试收敛问题上。
Hugging Face 发布 ggml 入门教程,介绍这个专注于 Transformer 推理的 C/C++ 开源机器学习库。教程讲解 ggml_context、ggml_cgraph、ggml_backend 等核心概念,给出在 Ubuntu 上编译运行矩阵乘法示例的完整步骤,并演示了使用 backend、打印计算图和导出 graphviz 格式的方法。
Hugging Face 与 Albumentations AI 合作推出面向文档图像的多模态数据增强 pipeline,可同时修改图像内容与文本标注,用于 VLM 微调。
Hugging Face 发布教程,介绍如何用 Quanto 对 Diffusers 中的 Transformer 扩散管线(PixArt-Sigma、Stable Diffusion 3、Aura Flow)做 FP8/INT8/INT4 量化以降低显存占用。
Hugging Face 发布教程,演示如何用 WWDC24 的新 Core ML 特性在 Mac 上复现 Mistral 7B 的端侧运行。
推荐理由:原文复现 WWDC24 的 Mistral 7B 端侧运行示例,讲解 MLTensor、状态缓存和 4-bit 量化等新特性与完整转换步骤。
Hugging Face 团队发布教程,讲解如何用 distilabel 从 Argilla 2.0 技术文档合成三元组数据,微调 BAAI/bge-base-en-v1.5 嵌入模型(结合 TripletLoss 与 MatryoshkaLoss)。
Numina 与 Hugging Face 合作微调的 NuminaMath 7B TIR 赢得首届 AIMO Progress Prize,在私有测试集 50 题中解出 29 题。
推荐理由:原文由获奖团队完整给出两阶段微调、SC-TIR 推理和防过拟合验证的做法,方法可迁移到数学推理模型训练。
TRL 库现已支持对视觉语言模型做 DPO 偏好优化训练,官方博客以 Idefics2-8b 为例给出完整教程。
推荐理由:原文给出从数据格式化、显存估算到 LoRA 量化的完整 DPO 训练流程,读者可直接迁移到自己的 VLM 微调场景。