Hugging Face 发布 LCM LoRA,让 SDXL 4 步生成图像
Hugging Face 与 LCM 团队发布 LCM LoRA,通过训练少量 LoRA 适配层而非完整蒸馏模型,让 Stable Diffusion 和 SDXL 的推理步数从 25-50 步降到 4-8 步。
推荐理由:LCM LoRA 只训练少量适配层就能让任意 SDXL 微调模型 4 步出图,文中给出 diffusers 代码和多硬件基准,方法可直接复用。
Hugging Face 与 LCM 团队发布 LCM LoRA,通过训练少量 LoRA 适配层而非完整蒸馏模型,让 Stable Diffusion 和 SDXL 的推理步数从 25-50 步降到 4-8 步。
推荐理由:LCM LoRA 只训练少量适配层就能让任意 SDXL 微调模型 4 步出图,文中给出 diffusers 代码和多硬件基准,方法可直接复用。
Hugging Face 宣布 🤗 optimum-neuron 已支持在 AWS Inferentia2 上部署 LLM 进行文本生成,并以 Llama 2 7B 和 13B 为例演示。
Hugging Face 在 Enterprise Hub 计划中推出 Storage Regions,让组织决定模型和数据集的存储位置,目前支持 US 和 EU 两个区域,Asia-Pacific 即将推出。
Hugging Face 发布教程,介绍如何用 Hugging Face GitHub 公共仓库代码微调 bigcode/starcoder (15.5B) 等模型,打造个人编程助手 HugCoder。
推荐理由:原文完整给出从数据采集到部署的微调流程,并附 QLoRA 与全量微调的成本和评测对比,方法可迁移到自有代码库。
Hugging Face 官方博客介绍如何用一行 spotlight.show(ds) 代码,通过 Renumics Spotlight 交互式可视化 datasets 库中的数据集,无需复制或预处理数据。
Hugging Face Diffusers 团队发文讲解如何优化 SDXL 的推理速度和内存占用,测试在 A100(40GB)上进行,每轮生成 4 张图取第 3 次结果。
推荐理由:官方在 A100 上实测了多种 SDXL 推理优化手段并附完整数据表,读者可以按自己的显存和延迟需求直接选用对应技巧。
Hugging Face 展示如何通过 Inference Endpoints 与 Text Embeddings Inference(TEI)部署开源嵌入模型,用于 RAG 等检索增强场景。
Hugging Face 推出 @gradio/lite,通过 Pyodide 让 Gradio 应用直接在浏览器中运行,无需服务器端基础设施。开发者在 HTML 中引入 JS/CSS 并在 <gradio-lite> 标签内写 Python 代码即可,支持 <gradio-file> 多文件和 <gradio-requirements> 通过 micropip 安装依赖。
推荐理由:原文给出完整的上手代码和依赖、加载时间等限制说明,读者可直接照做评估浏览器端部署是否适合自己。
Hugging Face 上超过 130,000 个支持 ONNX 的模型可借助 ONNX Runtime 加速,包括 BERT、GPT2、Whisper 等多种 LLM 和云模型。
Hugging Face 宣布 tokenizers 新增 chat_template 属性,用于保存模型训练时的对话格式,避免因格式不匹配导致难以察觉的性能严重下降。
推荐理由:原文指出对话格式不匹配会导致静默性能下降,并给出将 Jinja 聊天模板随 tokenizer 保存和使用的具体做法。
Hugging Face 宣布 Diffusers 现已支持通过 JAX 在 Cloud TPU 上部署 Stable Diffusion XL(SDXL),实现高性能、低成本的推理。
Hugging Face 发布教程,介绍如何 fork 并配置 AI Comic Factory,通过 Inference API 部署到自己的私有 Space,避免长时间排队。
Hugging Face 发布了一项针对 Llama 2 在 Amazon SageMaker 上部署的基准测试,分析了 60 种不同部署配置。测试覆盖 7B、13B、70B 三种参数规模,在 g5 与 p4d 系列 EC2 实例上,以 1/5/10/20 并发请求,比较有无 GPTQ 4-bit 量化的延迟与吞吐。
Hugging Face 推出 Inference for PROs,为 PRO 订阅用户提供精选模型的高速推理 API 端点和更高的免费 Inference API 速率限制。
个人理财应用 Rocket Money 用 BERT 系列模型替代维护成本高的 regex 系统,为 4000+ 类别的交易文本分类提供支持,其原有 regex 系统每月处理超 1 亿笔交易。在对比自建方案、AWS Sagemaker 和 Hugging Face Inference API 后,经三个月评估选择 Hugging Face 托管模型,一周内即承接部分流量并通过最坏情况负载测试。
Hugging Face 官方博客系统讲解 LLM 推理优化的三类技术:8-bit/4-bit 量化、Flash Attention 注意力算法,以及 RoPE、ALiBi、MQA、GQA 等架构改进。
推荐理由:Hugging Face 官方以实测代码系统讲解量化、Flash Attention 与模型架构三类 LLM 推理优化方法,可迁移到部署实践。
Hugging Face 团队发布教程,讲解如何用 PyTorch FSDP 在 2 节点共 16 张 A100 80GB 上全参数微调 meta-llama/Llama-2-70b-chat-hf,训练耗时约 13.5 小时。
Hugging Face 官方博客概述 Transformers 原生支持的 bitsandbytes 与 auto-gptq 两种量化方案的优缺点,并附基准测试。
Hugging Face 推出企业级代码助手 SafeCoder,基于 BigCode 项目开源的 StarCoder 模型(15.5B 参数、80+ 编程语言、8192-token 上下文窗口),训练数据为 The Stack 中 1 trillion 代码 token。
TII 发布 Falcon 180B,为当时最大的开放语言模型,拥有 1800 亿参数,使用 RefinedWeb 数据集在 3.5 万亿 token 上完成预训练。
推荐理由:原文给出了参数量、训练规模、评测对比和完整部署硬件门槛,读者可以据此评估是否在自己的场景中采用这个开源模型。
消费奖励应用公司 Fetch 在 AWS 上用 Hugging Face 与 Amazon SageMaker 优化其 ML 流水线,12 个月内构建、训练并部署了 5 个以上模型,将最慢扫描的延迟降低 50%,文档理解模型准确率提升 200%。
Hugging Face 官方教程讲解如何在 🧨 Diffusers 中运行 AudioLDM 2 文生音频管线,并通过 Flash Attention、float16 半精度、torch.compile 编译 UNet、切换 DPMSolverMultistepScheduler 将 10 秒音频的生成时间从约 14 秒降到 1 秒以内,且音质几乎不降。
推荐理由:官方教程给出四种可复用的推理优化方法,把 10 秒音频的生成时间从约 14 秒压到 1 秒以内,可直接迁移到自己的管线。
Hugging Face 宣布自 2023 年 10 月 1 日起,通过 Git 操作 Hugging Face Hub 时不再支持密码认证,用户需改用个人访问令牌或 SSH 密钥。令牌具有唯一、可撤销、随机等安全优势。目前仍在使用密码的用户将收到邮件提醒,需在截止日期前完成切换,可通过 git remote set-url 命令更新仓库地址。
Hugging Face 宣布将 AutoGPTQ 库集成进 Transformers,用户可用 GPTQ 算法以 8、4、3 或 2-bit 精度量化和运行模型,4-bit 量化精度损失可忽略,小 batch 下推理速度接近 fp16 基线。
推荐理由:官方宣布 AutoGPTQ 集成进 Transformers,读者可据此了解 4-bit 量化 LLM 的内存收益、用法与局限。
Hugging Face 发布面向企业的代码助手解决方案 SafeCoder,支持客户在自有基础设施内微调并自托管 Code LLM,训练和推理过程中代码不离开客户 VPC。
Hugging Face Hub 现已登陆 AWS Marketplace,用户可通过 AWS 账户直接为 Hugging Face 服务付费。订阅后,组织内所有成员使用 Inference Endpoints、Spaces Hardware Upgrades、AutoTrain 等服务的费用将自动出现在 AWS 账单中,价格与 Hugging Face 公开定价一致。
Hugging Face 博客发布 Bark 文本转语音模型的推理优化教程,基于 Transformers、Optimum 和 Accelerate 三种技术:BetterTransformer 提速 20% 到 30%,fp16 减少一半显存,CPU offload 让 bark-large 显存从 5GB 降到 2GB。
Hugging Face 与 BentoML 联合演示如何将开源文生图模型 DeepFloyd IF 部署到生产环境。DeepFloyd IF 直接在像素空间工作,由冻结文本编码器 T5-XXL-1.1 和三个级联像素扩散模块组成,可将 64x64 px 图像逐步放大至 1024x1024 px。
Hugging Face 发布 swift-transformers 等 alpha 工具,帮助 Swift 开发者在 Apple 设备上用 Core ML 运行 Llama 2 等语言模型。
推荐理由:官方一手发布了在 Apple 设备上跑 LLM 的 Swift 工具链,并给出 Core ML 转换、优化和已知坑的实操经验。
Hugging Face 发布教程,讲解如何通过 Inference Endpoints 和自定义 handler 部署 MusicGen 音乐生成模型。
Hugging Face 发布博客,介绍其开源文本生成与大语言模型生态,覆盖 Llama 2 等开源模型、许可证对比、text-generation-inference 服务方案及 PEFT 微调工具。文中列出 Falcon 40B、MPT-30B、XGen、StarCoder 等模型的许可与用途,说明 TGI 已支撑 HuggingChat,并介绍 LoRA 等参数高效微调方法。
Hugging Face 展示如何在 Intel 第四代 Xeon(Sapphire Rapids)CPU 集群上微调 Stable Diffusion 模型,采用 textual inversion 技术,仅需 5 张示例图片。
Hugging Face 官方教程讲解用 Inference Endpoints 部署开源 LLM,以 tiiuae/falcon-40b-instruct 为例,建议改用 1x Nvidia A100 实例获得最佳性能,约 10 分钟后端点上线。
Hugging Face 对话中,Writer 联合创始人兼 CTO Waseem Alshikh 讲述公司从 Hugging Face 用户到客户、再到开源模型贡献者的历程。
Hugging Face 在 Habana Gaudi2 上对 866M 参数的视觉语言模型 BridgeTower Large 进行微调加速。基于 Optimum Habana v1.7,配合硬件加速数据加载,Gaudi2 微调速度达到 A100 的 2.5 倍、H100 的 1.4 倍,吞吐最高达 768.7 samples/s。这些数据加载优化技术同样适用于其他受数据加载瓶颈约束的视觉模型。
Hugging Face 与 Elixir 社区合作展示如何用 Livebook 构建基于 Whisper 的聊天应用并部署到 Hugging Face Spaces,全程不到 15 分钟。
Hugging Face 宣布 AMD 正式加入其 Hardware Partner Program,双方将联手优化 transformer 模型在 AMD CPU 和 GPU 平台上的训练与推理性能。
Hugging Face 撰文介绍 GLAM(美术馆、图书馆、档案馆和博物馆)行业如何使用并贡献 Hugging Face Hub。Hub 目前托管超过 190,000 个模型、33,000 个数据集和 100,000 多个应用与演示,用户可按任务和语言筛选模型,并通过浏览器界面直接上传 CSV 数据集,或用 Spaces 托管 Gradio、Streamlit 及 Docker 应用。
Hugging Face 推出基于 Text Generation Inference(TGI)的 LLM Inference Container,用于在 Amazon SageMaker 上部署开源大模型,示例将 Open Assistant 12B(Pythia)部署到 ml.g5.12xlarge 实例(4 张 NVIDIA A10G、96GB GPU 显存)。
Hugging Face 与 OpenVINO NNCF 合作提出 Stable Diffusion 的 CPU 优化工作流,通过量化感知训练(QAT)结合知识蒸馏和 Token Merging,相比 PyTorch 实现 5.1x 推理加速和 4x 模型体积缩减。