Rocket Money 携手 Hugging Face:在生产环境中扩展波动性 ML 模型
个人理财应用 Rocket Money 用 BERT 系列模型替代维护成本高的 regex 系统,为 4000+ 类别的交易文本分类提供支持,其原有 regex 系统每月处理超 1 亿笔交易。在对比自建方案、AWS Sagemaker 和 Hugging Face Inference API 后,经三个月评估选择 Hugging Face 托管模型,一周内即承接部分流量并通过最坏情况负载测试。
个人理财应用 Rocket Money 用 BERT 系列模型替代维护成本高的 regex 系统,为 4000+ 类别的交易文本分类提供支持,其原有 regex 系统每月处理超 1 亿笔交易。在对比自建方案、AWS Sagemaker 和 Hugging Face Inference API 后,经三个月评估选择 Hugging Face 托管模型,一周内即承接部分流量并通过最坏情况负载测试。
3D Gaussian Splatting 是一种光栅化技术,源自论文 "3D Gaussian Splatting for Real-Time Radiance Field Rendering",可从少量图像实时渲染照片级真实感场景。
Hugging Face 推出 Object Detection Leaderboard,对 Hub 上的目标检测模型按指标排名。文章讲解了 IoU、AP、AR 等指标的计算方法,并指出评测中可能导致不同报告结果不一致的偏差与陷阱。开发者可据此在数百个开源模型中挑选最适合自身应用的目标检测模型。
Hugging Face 官方博客系统讲解 LLM 推理优化的三类技术:8-bit/4-bit 量化、Flash Attention 注意力算法,以及 RoPE、ALiBi、MQA、GQA 等架构改进。
推荐理由:Hugging Face 官方以实测代码系统讲解量化、Flash Attention 与模型架构三类 LLM 推理优化方法,可迁移到部署实践。
Hugging Face 团队发布教程,讲解如何用 PyTorch FSDP 在 2 节点共 16 张 A100 80GB 上全参数微调 meta-llama/Llama-2-70b-chat-hf,训练耗时约 13.5 小时。
Hugging Face 官方博客概述 Transformers 原生支持的 bitsandbytes 与 auto-gptq 两种量化方案的优缺点,并附基准测试。
Hugging Face 官方教程讲解如何在 🧨 Diffusers 中运行 AudioLDM 2 文生音频管线,并通过 Flash Attention、float16 半精度、torch.compile 编译 UNet、切换 DPMSolverMultistepScheduler 将 10 秒音频的生成时间从约 14 秒降到 1 秒以内,且音质几乎不降。
推荐理由:官方教程给出四种可复用的推理优化方法,把 10 秒音频的生成时间从约 14 秒压到 1 秒以内,可直接迁移到自己的管线。
Hugging Face 博客发布 Bark 文本转语音模型的推理优化教程,基于 Transformers、Optimum 和 Accelerate 三种技术:BetterTransformer 提速 20% 到 30%,fp16 减少一半显存,CPU offload 让 bark-large 显存从 5GB 降到 2GB。
Hugging Face 与 BentoML 联合演示如何将开源文生图模型 DeepFloyd IF 部署到生产环境。DeepFloyd IF 直接在像素空间工作,由冻结文本编码器 T5-XXL-1.1 和三个级联像素扩散模块组成,可将 64x64 px 图像逐步放大至 1024x1024 px。
Hugging Face 官方博客介绍 TRL 库新支持的 DPO 方法,无需奖励模型和 RL 步骤即可直接在偏好数据上优化语言模型。
推荐理由:原文提供了从 SFT 到 DPO 微调 Llama v2 的完整代码与训练脚本,读者可复用到自己的数据集上。
Hugging Face 发布教程,讲解如何通过 Inference Endpoints 和自定义 handler 部署 MusicGen 音乐生成模型。
Hugging Face 正在用机器学习为 Hub 上缺少语言元数据的数据集检测语言,并由 librarian-bot 自动发起 pull request 补充元数据。
Zama 提出用全同态加密(FHE)解决 LLM 隐私问题,让用户数据和模型 IP 同时得到保护。团队基于 Hugging Face transformers 库改写 GPT2 的多头注意力层,用 Concrete-Python 将推理部分转换为 FHE 等价实现,非线性函数通过 PBS(可编程自举)完成。实验表明 4-bit 量化下模型在约 80 句的数据集上保持 96% 的原始预测精度。
Hugging Face 博客发布教程,演示用 Shap-E 从文本生成 3D 模型,再经 Blender 减面、Dream Textures 生成无缝贴图和 UV 展开,导出 FBX 并导入 Unity。作者选择 PS1 低多边形风格以规避当前 text-to-3D 保真度不足的问题,并配以顶点光照、浓雾和故障风后期处理还原复古观感。
Apple 与 Hugging Face 将 Stable Diffusion XL 移植到 Core ML,发布完整 pipeline 和 mixed-bit palettization 量化版本,UNet 以平均 4.5 位压缩后体积从 4.8GB 降至 1.4GB(减少 71%)。
推荐理由:原文给出 Stable Diffusion XL 在 Mac 上的 Core ML 移植细节、压缩到 4.5 位后体积从 4.8GB 降到 1.4GB 的数据,以及可复用的混合位宽量化方法。
Hugging Face 推出实验性演示 AI WebTV,循环播放由开源文生视频模型 Zeroscope(zeroscope_v2_576 生成 576x320、zeroscope_v2_XL 放大至 1024x576)生成的短视频,配乐由 MusicGen 生成,提示词由 ChatGPT 根据人工撰写的主题生成。
Hugging Face 发布博客,介绍其开源文本生成与大语言模型生态,覆盖 Llama 2 等开源模型、许可证对比、text-generation-inference 服务方案及 PEFT 微调工具。文中列出 Falcon 40B、MPT-30B、XGen、StarCoder 等模型的许可与用途,说明 TGI 已支撑 HuggingChat,并介绍 LoRA 等参数高效微调方法。
Hugging Face 展示如何在 Intel 第四代 Xeon(Sapphire Rapids)CPU 集群上微调 Stable Diffusion 模型,采用 textual inversion 技术,仅需 5 张示例图片。
作者发布了教程,讲解如何用 Transformers.js 制作完全在浏览器中实时运行的 ML 网页游戏 Doodle Dash,灵感来自 Google 的 Quick, Draw!
推荐理由:原文给出了从微调 apple/mobilevit-small 到用 Transformers.js 在浏览器端实时推理的完整流程,方法可直接复用于自制浏览器端 ML 游戏。
Hugging Face 官方教程讲解用 Inference Endpoints 部署开源 LLM,以 tiiuae/falcon-40b-instruct 为例,建议改用 1x Nvidia A100 实例获得最佳性能,约 10 分钟后端点上线。
Hugging Face 发布教程,展示用 Node.js 搭建文本到网页应用的生成器,模型采用部署在 Inference Endpoints 上的 WizardCoder-15B,通过 Express.js 流式渲染生成 HTML。
推荐理由:Hugging Face 官方教程给出从 Endpoint 部署到流式渲染的完整代码,读者可以照着复现一个文本生成网页应用的服务。
Hugging Face 在 Habana Gaudi2 上对 866M 参数的视觉语言模型 BridgeTower Large 进行微调加速。基于 Optimum Habana v1.7,配合硬件加速数据加载,Gaudi2 微调速度达到 A100 的 2.5 倍、H100 的 1.4 倍,吞吐最高达 768.7 samples/s。这些数据加载优化技术同样适用于其他受数据加载瓶颈约束的视觉模型。
Meta AI 的 MMS 支持 1100 多种语言的语音识别、语言识别与语音合成,其无监督 checkpoint 在 1400 多种语言、超 50 万小时音频上预训练,参数规模为 300M 和 1B。
Hugging Face 发文回应 AAAI 2023 论文"Transformer 对时间序列预测无效"的说法,指出简单线性模型 DLinear 并不优于 Transformer。
Apple 在 WWDC'23 中更新 Core ML 与 coremltools 的压缩优化能力,配合开源仓库 ml-stable-diffusion,支持将 Stable Diffusion 量化为 8/6/4/2-bit palettization,推荐 6-bit 以在精度损失很小的前提下加快推理并节省内存。
推荐理由:作者亲测 6-bit palettization 带来的生成速度提升,并给出完整转换命令和 Hub 模型,读者可按步骤迁移到自己微调的模型。
Hugging Face 与 Elixir 社区合作展示如何用 Livebook 构建基于 Whisper 的聊天应用并部署到 Hugging Face Spaces,全程不到 15 分钟。
Hugging Face 撰文介绍 GLAM(美术馆、图书馆、档案馆和博物馆)行业如何使用并贡献 Hugging Face Hub。Hub 目前托管超过 190,000 个模型、33,000 个数据集和 100,000 多个应用与演示,用户可按任务和语言筛选模型,并通过浏览器界面直接上传 CSV 数据集,或用 Spaces 托管 Gradio、Streamlit 及 Docker 应用。
这篇教程讲解如何用 Hugging Face Unity API 在 Unity 游戏中实现语音识别,可将语音转文本用于指令输入、NPC 对话或无障碍功能。步骤包括搭建含开始/停止按钮的 UI 场景、用 Microphone.Start() 录制最长 10 秒、44100 Hz 的音频,并将录音编码为 WAV 格式供 API 调用,最终把识别结果显示在 TextMeshPro 文本中。
Hugging Face 与 OpenVINO NNCF 合作提出 Stable Diffusion 的 CPU 优化工作流,通过量化感知训练(QAT)结合知识蒸馏和 Token Merging,相比 PyTorch 实现 5.1x 推理加速和 4x 模型体积缩减。
Hugging Face 与 bitsandbytes 合作,在 transformers 中支持 4bit 量化加载,并集成 Dettmers 等人新提出的 QLoRA 微调方法。
推荐理由:官方详细讲解 transformers 中 4bit 量化和 QLoRA 的用法与配置,附带在消费级 GPU 上微调 Llama 7B/13B 的实测结果。
Hugging Face 探索用指令微调让 Stable Diffusion 学会根据指令处理输入图像,如“给自然图像加卡通滤镜”。
Hugging Face 与 Intel 合作推出 Q8-Chat 演示,基于 SmoothQuant 8-bit 量化,在单路 32 核 Intel Sapphire Rapids CPU、batch size 为 1 的条件下实现类 ChatGPT 聊天体验。
Hugging Face 博客详解 BigCode 数据集的大规模近似去重方法,核心流程为 MinHash 指纹计算加 LSH 分桶再图聚类去重。
Hugging Face 发布教程,讲解如何用 ROCm 在单张 AMD GPU 上运行 4-bit GPTQ 量化的 Vicuna-13B 模型。经 RX6900XT(16GB 显存)实测,量化模型仅需 7.52GB 显存,而 fp16 需超过 28GB,延迟与精度损失极小。
Hugging Face 在 Transformers 中推出 Assisted Generation 解码方法,用小模型生成候选 token、大模型前向传播验证,降低自回归文本生成延迟。
推荐理由:原文解释了文本生成延迟来自内存带宽而非计算,并给出 Assisted Generation 的原理、代码和延迟数据,方法可直接复现。
Hugging Face 团队将 BigCode 的 StarCoder(16B 参数、8,192 token 上下文)微调为编程助手 StarChat alpha。
推荐理由:原文完整展示了用 OpenAssistant 对话数据和 DeepSpeed ZeRO-3 将 StarCoder 微调为编程助手的可复现流程,并附评估方法。
Hugging Face 发布博客,梳理文本生成视频模型从 GAN、Transformer 到扩散模型的演进脉络,并对比文本生成图像任务解释其在计算成本、数据集和视频描述上的挑战。
推荐理由:系统梳理了文本生成视频模型的技术演进、数据集挑战与代表工作,并给出 Diffusers 上的可复用代码与演示入口。
Hugging Face Unity API 是对 Hugging Face Inference API 的易用集成,可在 Unity 项目中调用 Hugging Face 模型。
Hugging Face 发布端到端教程,演示用 TensorFlow 和 TPU 在 WikiText (v1) 数据集上从零训练 RoBERTa base 模型,涵盖训练 Unigram tokenizer、生成 TFRecord 分片上传 GCS、以及用 TPUStrategy 进行数据并行训练。
推荐理由:原文给出从 tokenizer 训练到 TPU 训练的完整流程与代码,读者可据此把 TensorFlow 训练管线迁移到 TPU。
Hugging Face 官方博客演示用 🧨 diffusers 在免费版 Google Colab(13GB CPU 内存、T4 15GB 显存)上运行 DeepFloyd 的开源文生图模型 IF,并支持图像变化和局部重绘。
推荐理由:官方博客给出在 13GB 内存免费 Colab 上跑通 40GB 参数 IF 的完整低显存方案,含可复用的代码和量化技巧。