Hugging Face 博客详解如何用 NVIDIA LogitsProcessorZoo 控制大语言模型生成
Hugging Face 博客介绍 NVIDIA 开源的 LogitsProcessorZoo,一组与 Transformers 的 generate 方法兼容的模块化 logits 处理器,通过直接修改输出概率分布来控制生成。
推荐理由:原文给出四个 logits 处理器的参数、代码和实际输出对比,读者可以直接照着控制生成长度、引用、结尾短语和选择题格式。
Hugging Face 博客介绍 NVIDIA 开源的 LogitsProcessorZoo,一组与 Transformers 的 generate 方法兼容的模块化 logits 处理器,通过直接修改输出概率分布来控制生成。
推荐理由:原文给出四个 logits 处理器的参数、代码和实际输出对比,读者可以直接照着控制生成长度、引用、结尾短语和选择题格式。
Hugging Face 在 Google Cloud 两款 Xeon 实例上评测了 Agentic AI 的文本嵌入与文本生成两类负载。
Hugging Face 博客作者搭建了一个 Keras chatbot arena,用 Gradio、Spaces、JAX 和 TPU 测试 LLM 在对话中被指出错误后能否自行修复。
Hugging Face 与 Capital Fund Management(CFM)分享如何用 Llama 3.1-70b 通过 Inference Endpoints 辅助标注 FNSPID 金融新闻数据,并用 Argilla 人工复核。
推荐理由:文章完整给出 LLM 辅助标注加小模型微调的流程与成本数据,读者可复用这套方法平衡精度与推理开销。
Hugging Face 博客以迭代推导方式讲解位置编码设计,从整数编码、二进制编码到正弦编码,最终推导出 Llama 3.2 等现代 Transformer 采用的 RoPE。
推荐理由:文章把 RoPE 的设计过程拆成可跟随的迭代推导,从整数编码一步步走到旋转矩阵,适合想理解位置编码原理的读者。
Hugging Face 详解 LayerSkip 提出的 self-speculative decoding:用同一模型的浅层生成草稿 token、深层做验证,兼得加速、内存节省与更低延迟。
Digital Green 与 Hugging Face Expert Support 合作,为面向小农户的农业问答机器人 Farmer.chat 搭建了 LLM-as-a-judge 评测体系,覆盖提示词清晰度、问题类型、回答率和 RAG 准确性等指标,LLM 评分与约 360 题的人工评估高度相关。
Hugging Face 的 Speech-to-Speech(S2S)项目通过 VAD、STT、语言模型和 TTS 组成的级联 pipeline 实现语音对话,支持英、法、西、中、日、韩六种语言及自动语言检测。
Llama 3.2 两周前登陆 Hugging Face/Transformers,而 Keras 从第一天起就支持它,可直接从 safetensors 格式的 Hugging Face checkpoint 加载,如 "hf://meta-llama/Llama-3.2-1B-Instruct"。
Hugging Face 博客发布教程,演示如何用 Dask 和 Coiled 把 FineWeb-Edu 分类器推理从 pandas 处理 100 行扩展到云端多 GPU 并行处理 2.11 亿行。
Intel labs 与 Hugging Face 提出动态推测解码,通过基于草稿模型置信度阈值动态调整每轮推测 lookahead,文本生成最高加速 2.7x,并从 Transformers 4.45.0 起成为辅助生成的默认模式。
Hugging Face Xet 团队研究提升 Hub 上 Parquet 文件的存储去重效率,目前 Hub 上 Parquet 文件占用超过 2.2PB 存储。
Hugging Face 发布教程,讲解如何将顶点着色网格转换为 UV 映射的带贴图网格,并开源了 InstantTexture 库实现一键转换。教程详解用 xatlas 生成 UV 映射、通过重心插值填充 1024 尺寸纹理,再结合 inpainting、中值滤波、高斯模糊和降采样消除纹理孔洞。这类顶点着色网格常见于 InstantMesh 等生成式 3D 模型的输出。
Hugging Face 介绍其 Daily Papers 页面的多项实用功能。过去一年该页面已收录超过 3,700 篇论文,订阅者超过 12k。用户可一键认领论文、提交推荐论文、@作者讨论、用 @librarian-bot 获取相似论文推荐,还能通过多语言评论翻译和 arXiv 扩展跳转体验相关 Space demo。
Hugging Face 发布 FineVideo 数据集,包含 43k 段视频共 3.4k 小时,附丰富描述、叙事细节、场景切分和 QA 对,并撰文披露完整构建流程。
Hugging Face 指导如何用 Optimum-Intel 和 OpenVINO GenAI 优化并部署 Transformers 模型,以 meta-llama/Meta-Llama-3.1-8B 为例,通过 NNCF 进行 INT8/INT4 weight-only 量化(如 AWQ、scale estimation、混合精度)。
Hugging Face LeRobot 团队提出 LeRobotDataset 格式,用视频编码存储机器人数据集的视觉模态,数据集平均仅为其原大小的 14%(最佳情况可达 0.2%),且保持完整训练能力。解码方面,单帧加载时间与 PNG 压缩图像相当,解码多连续帧时仅为 PNG 加载时间的 25%-50%。该格式轻量、易分享(与 Hub 原生集成)并配有在线可视化工具。
Hugging Face 官方博客盘点 Hub 上五个常被忽视的工具:ZeroGPU(免费 A100 GPU,每工作负载 40GB vRAM)、多进程 Docker Space(用 supervisord)、Gradio API、Webhooks 和 Nomic Atlas 语义搜索。
推荐理由:作者用免费语义搜索项目实际串起 ZeroGPU、多进程 Docker、Gradio API、Webhooks 和 Nomic Atlas 的用法,附可直接复用的代码示例。
这篇 Hugging Face 教程讲解如何在 Google Cloud A3 节点(8 x H100)上,用 TGI 的 Deep Learning Containers 在 Vertex AI 上部署 Meta Llama 3.1 405B 的 FP8 量化版 Meta-Llama-3.1-405B-Instruct-FP8。
Hugging Face 复现 Google 的 Infini-attention 论文后发现,压缩记忆次数越多,性能反而越差,90% 的时间花在调试收敛问题上。
Hugging Face 发布 ggml 入门教程,介绍这个专注于 Transformer 推理的 C/C++ 开源机器学习库。教程讲解 ggml_context、ggml_cgraph、ggml_backend 等核心概念,给出在 Ubuntu 上编译运行矩阵乘法示例的完整步骤,并演示了使用 backend、打印计算图和导出 graphviz 格式的方法。
Hugging Face 与 Albumentations AI 合作推出面向文档图像的多模态数据增强 pipeline,可同时修改图像内容与文本标注,用于 VLM 微调。
Hugging Face 发布教程,介绍如何用 Quanto 对 Diffusers 中的 Transformer 扩散管线(PixArt-Sigma、Stable Diffusion 3、Aura Flow)做 FP8/INT8/INT4 量化以降低显存占用。
Hugging Face 发布教程,演示如何用 WWDC24 的新 Core ML 特性在 Mac 上复现 Mistral 7B 的端侧运行。
推荐理由:原文复现 WWDC24 的 Mistral 7B 端侧运行示例,讲解 MLTensor、状态缓存和 4-bit 量化等新特性与完整转换步骤。
Hugging Face 团队发布教程,讲解如何用 distilabel 从 Argilla 2.0 技术文档合成三元组数据,微调 BAAI/bge-base-en-v1.5 嵌入模型(结合 TripletLoss 与 MatryoshkaLoss)。
Numina 与 Hugging Face 合作微调的 NuminaMath 7B TIR 赢得首届 AIMO Progress Prize,在私有测试集 50 题中解出 29 题。
推荐理由:原文由获奖团队完整给出两阶段微调、SC-TIR 推理和防过拟合验证的做法,方法可迁移到数学推理模型训练。
TRL 库现已支持对视觉语言模型做 DPO 偏好优化训练,官方博客以 Idefics2-8b 为例给出完整教程。
推荐理由:原文给出从数据格式化、显存估算到 LoRA 量化的完整 DPO 训练流程,读者可直接迁移到自己的 VLM 微调场景。
Banque des Territoires(CDC 集团)、Polyconseil 与 Hugging Face 于今年 1 月启动合作,为支持法国学校生态改造计划 EduRénov 构建基于 RAG 的主权数据方案,第一阶段已完成。
Intel 与 MILA 重构了多模态蛋白质语言模型 ProtST,并发布在 Hugging Face Hub 上,演示如何用 Intel Gaudi 2 加速器和 Optimum for Intel Gaudi 库进行推理与微调。
Hugging Face 发布 Florence-2 微调教程。微软 2024 年 6 月发布的 Florence-2 有 0.2B 和 0.7B 两种规模,官方模型不含 VQA 能力。
Hugging Face 发布博客,解释通过 Accelerate 使用 DeepSpeed 与 PyTorch FSDP 训练 Mistral-7B 时结果不一致的原因:DeepSpeed 默认把主权重上转 fp32,而 FSDP 原生不强制上转。
Hugging Face 将 assisted generation(基于 Speculative Sampling)适配并优化到 Intel Gaudi 处理器,现已合入 Optimum Habana,通过 .generate() 的 assistant_model 参数指定 draft 模型即可使用。
Hugging Face 介绍其 Text Generation Inference(TGI)附带的 TGI Benchmarking 工具,用于在吞吐之外同时测量延迟(含 TTFT),帮助用户根据场景权衡调优 LLM 部署。
Hugging Face 发布教程,介绍如何使用 Sentence Transformers 库微调或从零训练嵌入模型,覆盖数据集、损失函数、训练参数、评估器和 Trainer 五个组件。
Hugging Face 与 Intel 在 OPEA 框架下演示企业 RAG 应用构建:嵌入模型 BAAI/bge-base-en-v1.5 跑在 Xeon CPU(AMX-FP16 带来 2-3x 性能提升),LLM 经 TGI 服务跑在 Gaudi 2 加速器上,示例为 Intel/neural-chat-7b-v3-3。
Hugging Face 展示如何用自定义 inference handler 在 Inference Endpoints 上部署 Whisper ASR,并结合 Pyannote diarization pipeline 实现说话人分离,以及通过投机解码加速推理。
Hugging Face Leaderboards 团队与 Dottxt 合作研究发现,MMLU 评测对提示词格式高度敏感,各模型分数随 8 种格式波动约 10 个点,Qwen1.5-7B 在不同提示下准确率从 22.9% 到 51.2%,且模型排名也随格式变化。
Hugging Face 博客介绍 Gradio 的 reload 模式,用 gradio app.py 代替 python app.py 启动即可在不重启服务器的情况下载入最新代码改动。
Zama 团队将其基于全同态加密(FHE)的隐私保护机器学习框架 Concrete ML 的预编译模型上线 Hugging Face Endpoints,用户可一键部署 FHE 友好模型(如加密垃圾邮件检测的决策树)并在加密数据上直接推理。
Hugging Face 发布视觉语言模型入门教程,介绍其图像编码器、投影层与文本解码器等核心结构,并列出 LLaVA 1.6、KOSMOS-2、Qwen-VL 等开源模型。