如何用对抗性数据动态训练你的模型(以 MNIST 为例)
Hugging Face 博客讲解动态对抗性数据收集(DADC):让人类构造样本来欺骗 SOTA 模型,再用这些数据多轮迭代训练以提升模型鲁棒性。文章以 MNIST 手写数字识别为例,展示了在 🤗 Spaces 上搭建模型交互 demo、标记(flag)对抗样本并重复训练的完整流程,作者训练的模型 20 epochs 后在测试集达到 89% 准确率。
Hugging Face 博客讲解动态对抗性数据收集(DADC):让人类构造样本来欺骗 SOTA 模型,再用这些数据多轮迭代训练以提升模型鲁棒性。文章以 MNIST 手写数字识别为例,展示了在 🤗 Spaces 上搭建模型交互 demo、标记(flag)对抗样本并重复训练的完整流程,作者训练的模型 20 epochs 后在测试集达到 89% 准确率。
Hugging Face 详细复盘 176B 参数模型 BLOOM 的训练技术,项目使用 384 张 80GB A100 GPU、350B token 的 59 语言数据集,耗时约 3.5 个月(约 100 万计算小时)。
作者详解了如何用 Sentence Transformers 和 Gradio 构建播放列表生成器:使用 msmarco-MiniLM-L-6-v3 模型(最大序列长度 512 word pieces)将歌词按段落切分后生成嵌入向量,再通过 util.semantic_search 对文本提示做语义搜索。
Hugging Face 发布 Twitter 情感分析入门指南,介绍如何用机器学习自动判断推文的正面、负面或中性倾向,用于分析用户反馈和监测品牌提及。有代码基础的读者可用 Tweepy 获取推文并通过 Inference API 做分析,不会编程的用户则可用 Zapier 无代码完成收集、分析和结果写入 Google Sheets 的流程。
Hugging Face 深度强化学习课程第 5 单元讲解首个策略梯度方法 Reinforce(Monte Carlo Policy Gradient),并用 PyTorch 从零实现。
Hugging Face 发文介绍机器学习新手如何借助 Sentence Transformers 完成第一个自驱项目。该库可将句子和图像转为嵌入向量,通过 util.cos_sim 余弦相似度比较句子并实现语义搜索,可延伸至聚类、模型蒸馏和 CLIP 文生图,在 GitHub 上已有近 8,000 stars、超过 3,000 个项目依赖它。
Hugging Face 发布教程,讲解如何通过 Accelerate 使用 DeepSpeed ZeRO 特性训练大模型,无需修改代码即可启用 ZeRO Stage-2。
Hugging Face 发布 embeddings 入门教程,讲解如何用开源库 Sentence Transformers 的 "sentence-transformers/all-MiniLM-L6-v2" 模型生成文本嵌入向量,并通过 Inference API 构建 FAQ 语义搜索引擎。
Hugging Face 介绍了三种把 Transformers 模型导出为 ONNX 的方法,并以文本分类模型 distilbert-base-uncased-finetuned-sst-2-english 为例演示。
OpenAI 介绍训练大型神经网络所需的并行技术与工程实践。大型神经网络是近期许多 AI 进展的核心,但训练它们需要编排 GPU 集群来完成单一同步计算,是难度很高的工程与研究挑战。
Hugging Face 深度强化学习课程第 3 单元讲解 Deep Q-Learning:用神经网络替代 Q-table 来近似 Q 值,解决 Q-Learning 无法应对 Space Invaders 这类 256^100800 巨大状态空间的问题。
Hugging Face 发布教程,基于 Ho et al. 2020 的 DDPM 论文和 Phil Wang 的实现,用 PyTorch 逐步实现扩散模型。
推荐理由:逐行实现 Ho et al. 2020 的 DDPM,覆盖前向加噪、损失推导、U-Net 结构与采样训练全流程,便于动手理解扩散模型原理。
Hugging Face 深度强化学习课程 Unit 2 第二部分讲解 Q-Learning 算法,并指导从零实现第一个 RL 智能体。该 off-policy 的 value-based 方法基于 TD 方式更新 Q-table,使用 Epsilon Greedy 策略平衡探索与利用。
Hugging Face 深度强化学习课程 Unit 2 第一部分讲解基于价值的方法,涵盖 State-Value 函数、Action-Value 函数、Bellman 方程,以及 Monte Carlo 与 Temporal Difference Learning 的区别。
Hugging Face 发布 Optimum 1.2,为 Transformers pipelines 增加 ONNX Runtime 推理支持,用户只需将 AutoModelForXxx 替换为 ORTModelForXxx 即可使用相同 API。
Hugging Face 推出免费的深度强化学习课程(Deep Reinforcement Learning Class),第一章讲解 RL 基础理论,包括 RL 流程、reward hypothesis、Markov 性质、策略与价值方法等核心概念。
Hugging Face 发文介绍如何在 Accelerate 库中使用 PyTorch FullyShardedDataParallel(FSDP),无需改动代码即可分片训练大模型。
这是一篇教程,讲解如何用 HuggingFace AutoTrain 和 Kili 搭建文本分类的主动学习流程。文章以 Google Play Store 上约 40130 条 Medium 应用评论为数据集,定义了订阅、内容、界面、用户体验 4 个分类,并对评论做情感分析。
Hugging Face 实战演示如何在 AWS EC2 DL1 实例(配备 8 个 Habana Gaudi 处理器)上微调 BERT:使用 Habana Deep Learning AMI 和 PyTorch 容器。
Hugging Face 官方博客以客户服务为场景,演示如何用其生态工具微调 microsoft/deberta-v3-base,将客户消息按 5 类情感分类以自动过滤最不满意的反馈。
Hugging Face 介绍如何在 Hub 上追踪和筛选模型的 CO2 排放。安装 codecarbon 后,transformers 的 Trainer 会自动记录训练碳排放并生成 emissions.csv。
Hugging Face 官方博客解释 Transformers 库有意不采用软件开发的 DRY 原则,而是采用单模型文件策略,即模型前向传播的全部代码集中在一个文件中。
Hugging Face 发布教程,演示如何用自建人行道分割数据集 segments/sidewalk-semantic 微调 SegFormer(B0,仅约 14MB),面向披萨配送机器人的场景理解。
这是一篇端到端教程,演示如何结合 Hugging Face Transformers、Amazon SageMaker 与 AWS Inferentia 加速 BERT 文本分类推理。
教程演示如何用 Hugging Face datasets 结合 sentence_transformers 和 faiss 构建图像搜索应用:用 ImageFolder 加载大英图书馆数字化图书中的装饰图像子集(10000 张)。
Hugging Face 在 Transformers 的 model.generate() 中新增 constrained beam search 功能,支持通过 force_words_ids 强制输出包含指定词或短语。该功能支持析取约束(从词表中至少选一),并用 banks 分组和轮询选择在满足约束与生成流畅输出间取得平衡;用户也可继承 Constraint 抽象类自定义约束。
Google AI Language 于 2018 年推出的 BERT(Bidirectional Encoder Representations from Transformers)是一种 NLP 机器学习模型,可解决情感分析、命名实体识别等 11 种以上常见语言任务。
这是一篇 Hugging Face 教程,讲解如何用 🤗 datasets 加载图像分类数据集(示例为包含健康与病态豆叶的 beans 数据集,共 3 个类别),再用 🤗 transformers 微调预训练的 Vision Transformer(ViT)模型。
这是一篇使用 Python 进行情感分析的入门指南,涵盖情感分析概念、如何用 transformers 的 pipeline 类调用 Hugging Face Hub 上超过 215 个预训练情感分析模型(仅需 5 行代码),以及如何用自有数据微调模型和分析推文。Hub 收录超过 27,000 个社区共享模型,覆盖约 28 种语言,均可免费使用并支持浏览器内测试。
Hugging Face 博客讲解如何利用 Wav2Vec2 的 CTC 架构特性,对任意长的音频文件乃至实时流做高质量语音识别。
推荐理由:原文解释如何利用 CTC 架构加重叠分块让 Wav2Vec2 处理任意长音频和实时推理,方法可直接用 pipeline 复现。
Hugging Face 官方介绍 huggingface_hub 库新增的搜索功能,用户可通过 ModelSearchArguments 和 ModelFilter 类在 Python 或 Jupyter 中以编程方式筛选 Hub 上的模型和数据集,无需离开 IDE。
🤗 Transformers 新增与 Kensho 的 pyctcdecode 库的集成,可将 n-gram 语言模型与微调后的 Wav2Vec2 语音识别检查点结合解码。
本教程讲解如何用 Hugging Face Transformers 与 Amazon SageMaker 部署 EleutherAI 的开源 60 亿参数模型 GPT-J 6B,在约 $500/月的 NVIDIA T4 GPU 实例上实现实时推理。
Hugging Face 介绍如何结合其 AutoNLP 框架与 Explosion 的标注工具 Prodigy 搭建主动学习流水线。
Hugging Face 发布教程,展示如何从零训练名为 CodeParrot 的 GPT-2 代码生成模型。
推荐理由:原文从数据清洗到训练和评测完整走一遍预训练流程,方法步骤可迁移到读者自己的代码模型训练。
Hugging Face 与 Graphcore 合作,通过开源库 Optimum 让 Transformer 模型在 Graphcore IPU 上更易加速推理,并推出首个 IPU 优化模型 BERT。
这篇教程演示如何用 Intel Xeon Scalable(Ice Lake 架构)CPU 集群加速 PyTorch 分布式微调,在 GLUE 基准的 MRPC 数据集(5,800 个句子对)上微调 BERT 文本分类模型。
这篇 Hugging Face 教程讲解如何用 CTC 微调 Wav2Vec2-XLS-R-300M 做低资源 ASR。XLS-R 于 2021 年 11 月发布,用约 50 万小时、128 种语言的音频做自监督预训练,提供 300M 至 2B 参数的 checkpoint。教程以仅约 4 小时验证数据的 Common Voice 土耳其语数据集为示例,并用词错误率(WER)评估微调后的模型。
Hugging Face 与 Intel 合作的第二篇博客聚焦软件层面的优化,展示 Intel 新一代 Ice Lake Xeon CPU 在多种 NLP 任务上比上一代 Cascade Lake 推理最高快 75%。
Hugging Face 宣布 Hugging Face Course 第二部分将于 11 月 15 日发布,涵盖 token 分类、因果与掩码语言建模、翻译、摘要和问答等 NLP 任务,并深入介绍 🤗 Datasets 和 🤗 Tokenizers。活动包括两天演讲和微调模型的团队项目,完成后可获结业证书,AWS 通过 Amazon SageMaker 提供免费算力。