Accelerate 如何借助 PyTorch 运行超大模型
Hugging Face 官方详解 Accelerate 如何在普通硬件上加载并运行超大模型,示例可在免费 Colab 上运行 OPT-6.7B。
推荐理由:官方详解 Accelerate 借助 PyTorch meta device、分片加载与 hooks 实现超大模型推理的完整原理,方法可直接复用。
Hugging Face 官方详解 Accelerate 如何在普通硬件上加载并运行超大模型,示例可在免费 Colab 上运行 OPT-6.7B。
推荐理由:官方详解 Accelerate 借助 PyTorch meta device、分片加载与 hooks 实现超大模型推理的完整原理,方法可直接复用。
Hugging Face 演示了如何在 8x80GB A100 上高效运行 176B 参数的 BLOOM 模型(bf16 权重需 352GB)。
Hugging Face 发布教程,讲解如何用 transformers Trainer 和自定义 Data Collator 从零训练 Offline Decision Transformer,让智能体在 Gym HalfCheetah 环境中奔跑。
NVIDIA 的 Megatron-LM 是专为 GPU 高度优化的预训练框架,相比 🤗 Accelerate 和 Trainer 更快但上手门槛更高。它通过高效的 DataLoader 和融合 CUDA kernel(包括 Apex 的 Fused AdamW)减少内存搬移、加速训练。
这篇 Hugging Face 教程讲解如何用 Gradio 的 HTML block 和 3Dmol.js 在 Hugging Face Spaces 中构建蛋白质结构查看器,支持输入 4 位 PDB 编码或上传 PDB 文件,并从 RCSB Protein Databank 获取结构进行渲染。
Hugging Face 官方博客发布教程,展示如何用 🧨 Diffusers 库运行 Stable Diffusion v1-4 文生图模型,模型由 CompVis、Stability AI 和 LAION 基于 LAION-5B 子集的 512x512 图像训练。
推荐理由:官方教程从StableDiffusionPipeline基础用法讲到自定义推理管线,读者可以按步骤复现文生图并理解潜在扩散的三个组件。
这是一篇教程,讲解如何用 Hugging Face Transformers、Optimum Habana 和 Datasets 库,在 AWS DL1 实例(Habana Gaudi)上以掩码语言建模(MLM)任务从零预训练 BERT-base。
Hugging Face 讲解如何把此前已在本地和 Kubernetes 部署过的 ViT B/16 TensorFlow 模型部署到 Google Cloud 的 Vertex AI 平台,用更少的代码获得与 Kubernetes 相当的扩展性。
Hugging Face 展示如何用 Optimum Graphcore 库在 Graphcore IPU 上微调视觉 Transformer(ViT)模型,示例为在 ImageNet-21k 预训练的 ViT 上微调 ChestX-ray14 胸部 X 光数据集。
Hugging Face 与 BigScience 将 LLM.int8() 8-bit 量化集成进 transformers 和 accelerate,使 BLOOM-176B 等 176B 参数大模型的推理显存占用减半且性能不下降。
推荐理由:原文由集成团队讲解 LLM.int8() 的量化原理、零性能下降验证和 transformers 集成细节,读者可据此在有限显存上运行大模型。
Hugging Face 阐述其 transformers 库对 TensorFlow 的设计理念:所有 TF 模型都应是 Keras Model 对象,所有层都是 Keras Layer 对象,从而可直接使用 fit()、compile()、predict() 等方法。
这是一篇教程,讲解如何将上一篇文章中用 TensorFlow Serving 本地部署的 Vision Transformer (ViT) 模型,通过 Docker 容器化和 Kubernetes 集群扩展为可服务大量用户的部署。
Hugging Face 教程讲解如何从零构建或微调 Sentence Transformers 模型:先用 distilroberta-base 等 Transformer 输出 token 嵌入,再经池化层得到固定长度句子嵌入。
Hugging Face 深度强化学习课程第 8 单元讲解 Proximal Policy Optimization(PPO),核心是通过比率裁剪将策略更新限制在 [1−ϵ,1+ϵ] 区间以提升训练稳定性。
Nyströmformer 借助 Nyström 矩阵近似方法,将标准自注意力的 O(n²) 时间与内存复杂度降至 O(n)。由于无法直接对 softmax 矩阵采样,该方法从 queries 和 keys 中以 segment means 构建地标点来近似 softmax 矩阵,并配合 1D depthwise convolution 的 skip connection。
Hugging Face 宣布 🤗 transformers 的 TensorFlow 文本生成支持 XLA 编译,部分场景提速超过 100 倍,多数情况下甚至快过 PyTorch 最高 9 倍。
推荐理由:官方详解 TensorFlow 文本生成用 XLA 加速的用法与坑,给出 padding 控制形状和一行代码启用的可复用方法。
Hugging Face 团队发布教程,讲解如何用 TensorFlow Serving 在本地部署 Transformers 中的 TensorFlow 视觉模型,示例为 google/vit-base-patch16-224 图像分类模型。
Hugging Face 深度强化学习课程第 7 单元讲解 Advantage Actor Critic (A2C)。文章指出 Reinforce 因使用 Monte-Carlo 采样估计回报导致策略梯度方差高、训练慢,而 Actor-Critic 架构结合 Actor(策略)与 Critic(价值函数)可降低方差。
Hugging Face 博客讲解动态对抗性数据收集(DADC):让人类构造样本来欺骗 SOTA 模型,再用这些数据多轮迭代训练以提升模型鲁棒性。文章以 MNIST 手写数字识别为例,展示了在 🤗 Spaces 上搭建模型交互 demo、标记(flag)对抗样本并重复训练的完整流程,作者训练的模型 20 epochs 后在测试集达到 89% 准确率。
Hugging Face 详细复盘 176B 参数模型 BLOOM 的训练技术,项目使用 384 张 80GB A100 GPU、350B token 的 59 语言数据集,耗时约 3.5 个月(约 100 万计算小时)。
作者详解了如何用 Sentence Transformers 和 Gradio 构建播放列表生成器:使用 msmarco-MiniLM-L-6-v3 模型(最大序列长度 512 word pieces)将歌词按段落切分后生成嵌入向量,再通过 util.semantic_search 对文本提示做语义搜索。
Hugging Face 发布 Twitter 情感分析入门指南,介绍如何用机器学习自动判断推文的正面、负面或中性倾向,用于分析用户反馈和监测品牌提及。有代码基础的读者可用 Tweepy 获取推文并通过 Inference API 做分析,不会编程的用户则可用 Zapier 无代码完成收集、分析和结果写入 Google Sheets 的流程。
Hugging Face 深度强化学习课程第 5 单元讲解首个策略梯度方法 Reinforce(Monte Carlo Policy Gradient),并用 PyTorch 从零实现。
Hugging Face 发文介绍机器学习新手如何借助 Sentence Transformers 完成第一个自驱项目。该库可将句子和图像转为嵌入向量,通过 util.cos_sim 余弦相似度比较句子并实现语义搜索,可延伸至聚类、模型蒸馏和 CLIP 文生图,在 GitHub 上已有近 8,000 stars、超过 3,000 个项目依赖它。
Hugging Face 发布教程,讲解如何通过 Accelerate 使用 DeepSpeed ZeRO 特性训练大模型,无需修改代码即可启用 ZeRO Stage-2。
Hugging Face 发布 embeddings 入门教程,讲解如何用开源库 Sentence Transformers 的 "sentence-transformers/all-MiniLM-L6-v2" 模型生成文本嵌入向量,并通过 Inference API 构建 FAQ 语义搜索引擎。
Hugging Face 介绍了三种把 Transformers 模型导出为 ONNX 的方法,并以文本分类模型 distilbert-base-uncased-finetuned-sst-2-english 为例演示。
OpenAI 介绍训练大型神经网络所需的并行技术与工程实践。大型神经网络是近期许多 AI 进展的核心,但训练它们需要编排 GPU 集群来完成单一同步计算,是难度很高的工程与研究挑战。
Hugging Face 深度强化学习课程第 3 单元讲解 Deep Q-Learning:用神经网络替代 Q-table 来近似 Q 值,解决 Q-Learning 无法应对 Space Invaders 这类 256^100800 巨大状态空间的问题。
Hugging Face 发布教程,基于 Ho et al. 2020 的 DDPM 论文和 Phil Wang 的实现,用 PyTorch 逐步实现扩散模型。
推荐理由:逐行实现 Ho et al. 2020 的 DDPM,覆盖前向加噪、损失推导、U-Net 结构与采样训练全流程,便于动手理解扩散模型原理。
Hugging Face 深度强化学习课程 Unit 2 第二部分讲解 Q-Learning 算法,并指导从零实现第一个 RL 智能体。该 off-policy 的 value-based 方法基于 TD 方式更新 Q-table,使用 Epsilon Greedy 策略平衡探索与利用。
Hugging Face 深度强化学习课程 Unit 2 第一部分讲解基于价值的方法,涵盖 State-Value 函数、Action-Value 函数、Bellman 方程,以及 Monte Carlo 与 Temporal Difference Learning 的区别。
Hugging Face 推出免费的深度强化学习课程(Deep Reinforcement Learning Class),第一章讲解 RL 基础理论,包括 RL 流程、reward hypothesis、Markov 性质、策略与价值方法等核心概念。
Hugging Face 发文介绍如何在 Accelerate 库中使用 PyTorch FullyShardedDataParallel(FSDP),无需改动代码即可分片训练大模型。
这是一篇教程,讲解如何用 HuggingFace AutoTrain 和 Kili 搭建文本分类的主动学习流程。文章以 Google Play Store 上约 40130 条 Medium 应用评论为数据集,定义了订阅、内容、界面、用户体验 4 个分类,并对评论做情感分析。
Hugging Face 实战演示如何在 AWS EC2 DL1 实例(配备 8 个 Habana Gaudi 处理器)上微调 BERT:使用 Habana Deep Learning AMI 和 PyTorch 容器。
Hugging Face 官方博客以客户服务为场景,演示如何用其生态工具微调 microsoft/deberta-v3-base,将客户消息按 5 类情感分类以自动过滤最不满意的反馈。
Hugging Face 介绍如何在 Hub 上追踪和筛选模型的 CO2 排放。安装 codecarbon 后,transformers 的 Trainer 会自动记录训练碳排放并生成 emissions.csv。
Hugging Face 发布教程,演示如何用自建人行道分割数据集 segments/sidewalk-semantic 微调 SegFormer(B0,仅约 14MB),面向披萨配送机器人的场景理解。
这是一篇端到端教程,演示如何结合 Hugging Face Transformers、Amazon SageMaker 与 AWS Inferentia 加速 BERT 文本分类推理。