Hugging Face 推出新定价,逐步停用 Inference API 付费层
Hugging Face 宣布新定价:逐步停用 Inference API 付费层,该 API 仍免费开放;企业级推理推荐使用新方案 Inference Endpoints,Spaces 也新增硬件升级。这些服务无需订阅,只需在账单设置中绑定信用卡,可绑定到组织;付费服务与订阅在每月月初扣费,账单设置中可管理 PRO 订阅、付款方式并查看过去三个月用量。
Hugging Face 宣布新定价:逐步停用 Inference API 付费层,该 API 仍免费开放;企业级推理推荐使用新方案 Inference Endpoints,Spaces 也新增硬件升级。这些服务无需订阅,只需在账单设置中绑定信用卡,可绑定到组织;付费服务与订阅在每月月初扣费,账单设置中可管理 PRO 订阅、付款方式并查看过去三个月用量。
Hugging Face 基于大量实验讲解如何用 🧨 Diffusers 的 train_dreambooth.py 微调 Stable Diffusion,并给出推荐设置:低学习率配合逐步增加步数,人脸训练约需 800-1200 步(batch size 2、LR 1e-6),训练人脸时应使用 prior preservation 防止过拟合。
推荐理由:Hugging Face 用多组实验给出 Dreambooth 微调 Stable Diffusion 的学习率、步数、先验保留等关键超参建议,可直接照做。
Hugging Face 宣布将 Intel OpenVINO 加入 Optimum Intel,基于 OpenVINO 2022.2,可用 OVModels 在多种 Intel 处理器上运行托管在 hub 或本地的 Transformers 模型,并通过 NNCF 进行量化。
这是一篇 Hugging Face 教程,讲解如何以三种递进的抽象层级在多 GPU 上进行分布式数据并行(DDP)训练:原生 PyTorch 的 pytorch.distributed 模块、🤗 Accelerate 的轻量封装(代码几乎无需改动即可在单 GPU 和 TPU 上运行),以及 🤗 Transformers 的高层 Trainer API。
Hugging Face 推出 Inference Endpoints 服务,可将 Hub 上的模型一键部署到 AWS 等托管基础设施,省去容器打包、基础设施配置和 API 搭建等部署工作。
Diffusers 自 0.5.1 起支持 Flax,官方教程演示如何在 Google TPU 上用 FlaxStableDiffusionPipeline 运行 CompVis/stable-diffusion-v1-4 推理。
Hugging Face 团队发布长文,复盘为 BLOOM(176B 参数、352GB)搭建高效推理服务器的完整过程,最终实现约 5 倍延迟降低(350ms/token 降至 71ms/token)和 50 倍吞吐提升。
推荐理由:原文复盘了把 BLOOM 推理延迟从 350ms 降到 71ms 的完整优化路径,从 profiling 到自定义 kernel 都有可迁移的方法细节。
Hugging Face 官方详解 Accelerate 如何在普通硬件上加载并运行超大模型,示例可在免费 Colab 上运行 OPT-6.7B。
推荐理由:官方详解 Accelerate 借助 PyTorch meta device、分片加载与 hooks 实现超大模型推理的完整原理,方法可直接复用。
Hugging Face 演示了如何在 8x80GB A100 上高效运行 176B 参数的 BLOOM 模型(bf16 权重需 352GB)。
NVIDIA 的 Megatron-LM 是专为 GPU 高度优化的预训练框架,相比 🤗 Accelerate 和 Trainer 更快但上手门槛更高。它通过高效的 DataLoader 和融合 CUDA kernel(包括 Apex 的 Fused AdamW)减少内存搬移、加速训练。
这是一篇教程,讲解如何用 Hugging Face Transformers、Optimum Habana 和 Datasets 库,在 AWS DL1 实例(Habana Gaudi)上以掩码语言建模(MLM)任务从零预训练 BERT-base。
Hugging Face 讲解如何把此前已在本地和 Kubernetes 部署过的 ViT B/16 TensorFlow 模型部署到 Google Cloud 的 Vertex AI 平台,用更少的代码获得与 Kubernetes 相当的扩展性。
Hugging Face 展示如何用 Optimum Graphcore 库在 Graphcore IPU 上微调视觉 Transformer(ViT)模型,示例为在 ImageNet-21k 预训练的 ViT 上微调 ChestX-ray14 胸部 X 光数据集。
Hugging Face 与 BigScience 将 LLM.int8() 8-bit 量化集成进 transformers 和 accelerate,使 BLOOM-176B 等 176B 参数大模型的推理显存占用减半且性能不下降。
推荐理由:原文由集成团队讲解 LLM.int8() 的量化原理、零性能下降验证和 transformers 集成细节,读者可据此在有限显存上运行大模型。
Hugging Face 发布新库 Skops,让用户将 scikit-learn 模型托管到 Hugging Face Hub 并创建模型卡。
这是一篇教程,讲解如何将上一篇文章中用 TensorFlow Serving 本地部署的 Vision Transformer (ViT) 模型,通过 Docker 容器化和 Kubernetes 集群扩展为可服务大量用户的部署。
Hugging Face 推出 Private Hub(PH),为从研究到生产的机器学习全流程提供一套安全合规的统一工具。
Hugging Face 宣布 🤗 transformers 的 TensorFlow 文本生成支持 XLA 编译,部分场景提速超过 100 倍,多数情况下甚至快过 PyTorch 最高 9 倍。
推荐理由:官方详解 TensorFlow 文本生成用 XLA 加速的用法与坑,给出 padding 控制形状和一行代码启用的可复用方法。
Hugging Face 团队发布教程,讲解如何用 TensorFlow Serving 在本地部署 Transformers 中的 TensorFlow 视觉模型,示例为 google/vit-base-patch16-224 图像分类模型。
Hugging Face 详细复盘 176B 参数模型 BLOOM 的训练技术,项目使用 384 张 80GB A100 GPU、350B token 的 59 语言数据集,耗时约 3.5 个月(约 100 万计算小时)。
作者详解了如何用 Sentence Transformers 和 Gradio 构建播放列表生成器:使用 msmarco-MiniLM-L-6-v3 模型(最大序列长度 512 word pieces)将歌词按段落切分后生成嵌入向量,再通过 util.semantic_search 对文本提示做语义搜索。
Hugging Face 发布 Twitter 情感分析入门指南,介绍如何用机器学习自动判断推文的正面、负面或中性倾向,用于分析用户反馈和监测品牌提及。有代码基础的读者可用 Tweepy 获取推文并通过 Inference API 做分析,不会编程的用户则可用 Zapier 无代码完成收集、分析和结果写入 Google Sheets 的流程。
Hugging Face 发布教程,讲解如何通过 Accelerate 使用 DeepSpeed ZeRO 特性训练大模型,无需修改代码即可启用 ZeRO Stage-2。
Hugging Face 推出 Evaluation on the Hub,由 AutoTrain 驱动,无需写任何代码即可在 Hub 上用任意数据集和指标评估任意模型。团队已评估数百个模型,并通过 Pull Request 将验证结果写入模型卡元数据。提交界面和排行榜基于 Hugging Face Spaces 构建,支持为任务找最佳模型、在新数据集上跑基线等场景。
Hugging Face 介绍了三种把 Transformers 模型导出为 ONNX 的方法,并以文本分类模型 distilbert-base-uncased-finetuned-sst-2-english 为例演示。
Intel 正式加入 Hugging Face 的 Hardware Partner Program,双方将基于开源库 Optimum Intel 为 Transformer 的训练、微调和推理构建硬件加速。
OpenAI 介绍训练大型神经网络所需的并行技术与工程实践。大型神经网络是近期许多 AI 进展的核心,但训练它们需要编排 GPU 集群来完成单一同步计算,是难度很高的工程与研究挑战。
Graphcore 与 Hugging Face 扩展开源库 Hugging Face Optimum,为 Graphcore IPU 优化的 Transformer 模型现已覆盖 NLP、语音和计算机视觉,共 10 个模型,附 IPU 配置文件和即用的预训练与微调权重。
Sempre Health 借助 Hugging Face 的 Expert Acceleration Program 构建了自动分类和回复患者短信的 NLP 管线,上线后约 20% 的入站消息可被系统自动处理。此前的规则系统只能覆盖 80% 的入站短信,Hugging Face 团队在标注、模型选型和方法上提供了指导,降低了运营团队的低价值工作量。
Hugging Face 发布 Gradio 3.0,这是 Gradio 库的全面重设计。新版本基于 Svelte 重建前端,页面加载更快、载荷更小,改进了 Dataframe 等组件并新增 Gallery、TabbedInterface;同时推出底层 Blocks API,支持自定义布局、多步数据流和根据用户输入改变组件属性或可见性。
推荐理由:官方介绍了 Gradio 3.0 的前端重设计和新 Blocks API 能力,想用 Python 构建自定义 ML 演示界面的读者可以了解能做什么。
Hugging Face 采访 Salesforce 和 Amplitude 等公司的机器学习总监,探讨 ML 对 SaaS 的影响与挑战。受访的 Omar Rahman 在 Salesforce 网络安全团队利用 ML 做防御性安全,Cao (Danica) Xiao 领导 Amplitude 的数据科学与机器学习团队。
Hugging Face 发布 Optimum 1.2,为 Transformers pipelines 增加 ONNX Runtime 推理支持,用户只需将 AutoModelForXxx 替换为 ORTModelForXxx 即可使用相同 API。
Hugging Face 发文介绍如何在 Accelerate 库中使用 PyTorch FullyShardedDataParallel(FSDP),无需改动代码即可分片训练大模型。
Hugging Face 实战演示如何在 AWS EC2 DL1 实例(配备 8 个 Habana Gaudi 处理器)上微调 BERT:使用 Habana Deep Learning AMI 和 PyTorch 容器。
Hugging Face 介绍如何在 Hub 上追踪和筛选模型的 CO2 排放。安装 codecarbon 后,transformers 的 Trainer 会自动记录训练碳排放并生成 emissions.csv。
Hugging Face 播客采访了机器学习工程师 Lewis Tunstall,他从事 Transformers 应用与 MLOps 工作,并与 Leandro von Werra 合著了《NLP with Transformers》一书。他近期在 transformers 库中开发模型导出 ONNX 格式的功能,一行代码即可完成转换,帮助工程师获得更快延迟和更高吞吐量。
Habana Labs 与 Hugging Face 宣布合作,通过将 SynapseAI 软件套件集成到 Hugging Face Optimum 开源库,让用户只需几行代码即可在 Habana Gaudi 处理器上加速 Transformer 训练。
Hugging Face 官方博客解释 Transformers 库有意不采用软件开发的 DRY 原则,而是采用单模型文件策略,即模型前向传播的全部代码集中在一个文件中。
这是一篇端到端教程,演示如何结合 Hugging Face Transformers、Amazon SageMaker 与 AWS Inferentia 加速 BERT 文本分类推理。
Hugging Face 在 Transformers 的 model.generate() 中新增 constrained beam search 功能,支持通过 force_words_ids 强制输出包含指定词或短语。该功能支持析取约束(从词表中至少选一),并用 banks 分组和轮询选择在满足约束与生成流畅输出间取得平衡;用户也可继承 Constraint 抽象类自定义约束。