Hugging Face 发布 ⚔️ AI vs. AI ⚔️ 深度强化学习多智能体竞赛系统
Hugging Face 推出开源工具 AI vs. AI,托管在 Spaces 上,通过持续对战和 ELO 排名(初始分 1200,胜方 +10 / 负方 -10)对多智能体强化学习模型做相对评估。
Hugging Face 推出开源工具 AI vs. AI,托管在 Spaces 上,通过持续对战和 ELO 排名(初始分 1200,胜方 +10 / 负方 -10)对多智能体强化学习模型做相对评估。
Hugging Face 测试了 Intel Sapphire Rapids(r7iz.16xlarge)与 Ice Lake(c6i.16xlarge)服务器在 NLP 推理上的表现。
Hugging Face 宣布 diffusers 正式支持用 LoRA 对 Stable Diffusion 做全量微调和 Dreambooth 训练。
推荐理由:Hugging Face 官方介绍 diffusers 支持 LoRA 微调 Stable Diffusion,给出训练脚本、显存需求和推理加载流程,方法可直接复现。
Hugging Face 与 Microsoft ONNX Runtime 团队合作,通过 Optimum 库的 ORTTrainer API 为 Transformer 模型训练加速,配合 DeepSpeed ZeRO Stage 1 在单台 8 卡 Nvidia A100 节点上测得 39% 到 130% 的加速。
Hugging Face 官方博客发布教程,讲解如何用 Transformers 和 Datasets 构建图像相似度系统:用 nateraw/vit-base-beans checkpoint 提取图像嵌入向量,通过余弦相似度在 beans 数据集 100 个候选样本中检索与查询图最相似的 Top 5。
Hugging Face 发布教程,介绍如何用 Intel 第四代 Xeon(Sapphire Rapids)CPU 集群在 AWS 上加速 PyTorch 训练。
推荐理由:原文给出在 Intel Sapphire Rapids CPU 集群上做分布式训练的完整步骤和实测数据,读者可以照搬这套方法。
Habana Gaudi2 在训练和推理上的速度约为 Nvidia A100 80GB 的两倍。BERT 预训练中,Gaudi2 用时 2 小时 55 分钟,相比第一代 Gaudi 的 8 小时 53 分钟实现 x3.04 加速。
借助新发布的 Bumblebee 库——纯 Elixir 实现的 Hugging Face Transformers,GPT2 到 Stable Diffusion 等神经网络模型已可在 Elixir 中运行。
Hugging Face 联合 Apple 将 Stable Diffusion 权重转换为 Core ML 格式并上传 Hub,支持 v1.4、v1.5、v2 base 和 v2.1 base,可在 Apple Silicon 的 CPU、GPU 和 Neural Engine 上运行。
推荐理由:原文给出在 Apple Silicon 上用 Core ML 跑 Stable Diffusion 的转换与推理方法,包括 Python 和 Swift 两条路径及性能变体选择,可迁移到自己的工作流。
Hugging Face 发布教程,讲解如何用 🤗 Transformers 库的 Time Series Transformer 从零训练单变量概率时间序列预测模型,并使用 tourism_monthly 数据集(澳大利亚 366 个地区的月度旅游量)。
Hugging Face 梳理了在其 Hub 上部署模型的多种推理方案:免费试用的 Inference Widget 和 Inference API,以及面向生产环境的 Inference Endpoints 和 Spaces。
Hugging Face 博客发布实用教程,讲解如何用 Concrete-ML 库在 fully homomorphic encryption(FHE)设置下对加密数据构建情感分析模型,无需密码学背景。
Hugging Face 宣布新定价:逐步停用 Inference API 付费层,该 API 仍免费开放;企业级推理推荐使用新方案 Inference Endpoints,Spaces 也新增硬件升级。这些服务无需订阅,只需在账单设置中绑定信用卡,可绑定到组织;付费服务与订阅在每月月初扣费,账单设置中可管理 PRO 订阅、付款方式并查看过去三个月用量。
Hugging Face 基于大量实验讲解如何用 🧨 Diffusers 的 train_dreambooth.py 微调 Stable Diffusion,并给出推荐设置:低学习率配合逐步增加步数,人脸训练约需 800-1200 步(batch size 2、LR 1e-6),训练人脸时应使用 prior preservation 防止过拟合。
推荐理由:Hugging Face 用多组实验给出 Dreambooth 微调 Stable Diffusion 的学习率、步数、先验保留等关键超参建议,可直接照做。
Hugging Face 宣布将 Intel OpenVINO 加入 Optimum Intel,基于 OpenVINO 2022.2,可用 OVModels 在多种 Intel 处理器上运行托管在 hub 或本地的 Transformers 模型,并通过 NNCF 进行量化。
这是一篇 Hugging Face 教程,讲解如何以三种递进的抽象层级在多 GPU 上进行分布式数据并行(DDP)训练:原生 PyTorch 的 pytorch.distributed 模块、🤗 Accelerate 的轻量封装(代码几乎无需改动即可在单 GPU 和 TPU 上运行),以及 🤗 Transformers 的高层 Trainer API。
Hugging Face 推出 Inference Endpoints 服务,可将 Hub 上的模型一键部署到 AWS 等托管基础设施,省去容器打包、基础设施配置和 API 搭建等部署工作。
Diffusers 自 0.5.1 起支持 Flax,官方教程演示如何在 Google TPU 上用 FlaxStableDiffusionPipeline 运行 CompVis/stable-diffusion-v1-4 推理。
Hugging Face 团队发布长文,复盘为 BLOOM(176B 参数、352GB)搭建高效推理服务器的完整过程,最终实现约 5 倍延迟降低(350ms/token 降至 71ms/token)和 50 倍吞吐提升。
推荐理由:原文复盘了把 BLOOM 推理延迟从 350ms 降到 71ms 的完整优化路径,从 profiling 到自定义 kernel 都有可迁移的方法细节。
Hugging Face 官方详解 Accelerate 如何在普通硬件上加载并运行超大模型,示例可在免费 Colab 上运行 OPT-6.7B。
推荐理由:官方详解 Accelerate 借助 PyTorch meta device、分片加载与 hooks 实现超大模型推理的完整原理,方法可直接复用。
Hugging Face 演示了如何在 8x80GB A100 上高效运行 176B 参数的 BLOOM 模型(bf16 权重需 352GB)。
NVIDIA 的 Megatron-LM 是专为 GPU 高度优化的预训练框架,相比 🤗 Accelerate 和 Trainer 更快但上手门槛更高。它通过高效的 DataLoader 和融合 CUDA kernel(包括 Apex 的 Fused AdamW)减少内存搬移、加速训练。
这是一篇教程,讲解如何用 Hugging Face Transformers、Optimum Habana 和 Datasets 库,在 AWS DL1 实例(Habana Gaudi)上以掩码语言建模(MLM)任务从零预训练 BERT-base。
Hugging Face 讲解如何把此前已在本地和 Kubernetes 部署过的 ViT B/16 TensorFlow 模型部署到 Google Cloud 的 Vertex AI 平台,用更少的代码获得与 Kubernetes 相当的扩展性。
Hugging Face 展示如何用 Optimum Graphcore 库在 Graphcore IPU 上微调视觉 Transformer(ViT)模型,示例为在 ImageNet-21k 预训练的 ViT 上微调 ChestX-ray14 胸部 X 光数据集。
Hugging Face 与 BigScience 将 LLM.int8() 8-bit 量化集成进 transformers 和 accelerate,使 BLOOM-176B 等 176B 参数大模型的推理显存占用减半且性能不下降。
推荐理由:原文由集成团队讲解 LLM.int8() 的量化原理、零性能下降验证和 transformers 集成细节,读者可据此在有限显存上运行大模型。
Hugging Face 发布新库 Skops,让用户将 scikit-learn 模型托管到 Hugging Face Hub 并创建模型卡。
这是一篇教程,讲解如何将上一篇文章中用 TensorFlow Serving 本地部署的 Vision Transformer (ViT) 模型,通过 Docker 容器化和 Kubernetes 集群扩展为可服务大量用户的部署。
Hugging Face 推出 Private Hub(PH),为从研究到生产的机器学习全流程提供一套安全合规的统一工具。
Hugging Face 宣布 🤗 transformers 的 TensorFlow 文本生成支持 XLA 编译,部分场景提速超过 100 倍,多数情况下甚至快过 PyTorch 最高 9 倍。
推荐理由:官方详解 TensorFlow 文本生成用 XLA 加速的用法与坑,给出 padding 控制形状和一行代码启用的可复用方法。
Hugging Face 团队发布教程,讲解如何用 TensorFlow Serving 在本地部署 Transformers 中的 TensorFlow 视觉模型,示例为 google/vit-base-patch16-224 图像分类模型。
Hugging Face 详细复盘 176B 参数模型 BLOOM 的训练技术,项目使用 384 张 80GB A100 GPU、350B token 的 59 语言数据集,耗时约 3.5 个月(约 100 万计算小时)。
作者详解了如何用 Sentence Transformers 和 Gradio 构建播放列表生成器:使用 msmarco-MiniLM-L-6-v3 模型(最大序列长度 512 word pieces)将歌词按段落切分后生成嵌入向量,再通过 util.semantic_search 对文本提示做语义搜索。
Hugging Face 发布 Twitter 情感分析入门指南,介绍如何用机器学习自动判断推文的正面、负面或中性倾向,用于分析用户反馈和监测品牌提及。有代码基础的读者可用 Tweepy 获取推文并通过 Inference API 做分析,不会编程的用户则可用 Zapier 无代码完成收集、分析和结果写入 Google Sheets 的流程。
Hugging Face 发布教程,讲解如何通过 Accelerate 使用 DeepSpeed ZeRO 特性训练大模型,无需修改代码即可启用 ZeRO Stage-2。
Hugging Face 推出 Evaluation on the Hub,由 AutoTrain 驱动,无需写任何代码即可在 Hub 上用任意数据集和指标评估任意模型。团队已评估数百个模型,并通过 Pull Request 将验证结果写入模型卡元数据。提交界面和排行榜基于 Hugging Face Spaces 构建,支持为任务找最佳模型、在新数据集上跑基线等场景。
Hugging Face 介绍了三种把 Transformers 模型导出为 ONNX 的方法,并以文本分类模型 distilbert-base-uncased-finetuned-sst-2-english 为例演示。
Intel 正式加入 Hugging Face 的 Hardware Partner Program,双方将基于开源库 Optimum Intel 为 Transformer 的训练、微调和推理构建硬件加速。
OpenAI 介绍训练大型神经网络所需的并行技术与工程实践。大型神经网络是近期许多 AI 进展的核心,但训练它们需要编排 GPU 集群来完成单一同步计算,是难度很高的工程与研究挑战。
Graphcore 与 Hugging Face 扩展开源库 Hugging Face Optimum,为 Graphcore IPU 优化的 Transformer 模型现已覆盖 NLP、语音和计算机视觉,共 10 个模型,附 IPU 配置文件和即用的预训练与微调权重。