Hugging Face 播客对话机器学习专家 Lewis Tunstall
Hugging Face 播客采访了机器学习工程师 Lewis Tunstall,他从事 Transformers 应用与 MLOps 工作,并与 Leandro von Werra 合著了《NLP with Transformers》一书。他近期在 transformers 库中开发模型导出 ONNX 格式的功能,一行代码即可完成转换,帮助工程师获得更快延迟和更高吞吐量。
Hugging Face 播客采访了机器学习工程师 Lewis Tunstall,他从事 Transformers 应用与 MLOps 工作,并与 Leandro von Werra 合著了《NLP with Transformers》一书。他近期在 transformers 库中开发模型导出 ONNX 格式的功能,一行代码即可完成转换,帮助工程师获得更快延迟和更高吞吐量。
Habana Labs 与 Hugging Face 宣布合作,通过将 SynapseAI 软件套件集成到 Hugging Face Optimum 开源库,让用户只需几行代码即可在 Habana Gaudi 处理器上加速 Transformer 训练。
Hugging Face 官方博客解释 Transformers 库有意不采用软件开发的 DRY 原则,而是采用单模型文件策略,即模型前向传播的全部代码集中在一个文件中。
Hugging Face 宣布将离线强化学习方法 Decision Transformer 集成进 🤗 transformers 库和 Hugging Face Hub。
Hugging Face 播客「Machine Learning Experts」采访了曾创立并联合领导 Google Ethical AI 团队的 Margaret Mitchell,她已发表超过 50 篇论文。
Hugging Face 推出为期 9 个月的 AI Research Residency 计划,帮助申请者成长为机器学习研究员。驻留者将与 Science Team 研究员合作选题、以开放方式开发新技术并力争发表成果。计划为全职远程,欢迎多元背景申请者,申请截止于 2022 年 4 月 3 日。
Hugging Face 发布教程,演示如何用自建人行道分割数据集 segments/sidewalk-semantic 微调 SegFormer(B0,仅约 14MB),面向披萨配送机器人的场景理解。
这是一篇端到端教程,演示如何结合 Hugging Face Transformers、Amazon SageMaker 与 AWS Inferentia 加速 BERT 文本分类推理。
教程演示如何用 Hugging Face datasets 结合 sentence_transformers 和 faiss 构建图像搜索应用:用 ImageFolder 加载大英图书馆数字化图书中的装饰图像子集(10000 张)。
Hugging Face 在 Transformers 的 model.generate() 中新增 constrained beam search 功能,支持通过 force_words_ids 强制输出包含指定词或短语。该功能支持析取约束(从词表中至少选一),并用 banks 分组和轮询选择在满足约束与生成流畅输出间取得平衡;用户也可继承 Constraint 抽象类自定义约束。
这是一篇 Hugging Face 教程,讲解如何用 🤗 datasets 加载图像分类数据集(示例为包含健康与病态豆叶的 beans 数据集,共 3 个类别),再用 🤗 transformers 微调预训练的 Vision Transformer(ViT)模型。
这是一篇使用 Python 进行情感分析的入门指南,涵盖情感分析概念、如何用 transformers 的 pipeline 类调用 Hugging Face Hub 上超过 215 个预训练情感分析模型(仅需 5 行代码),以及如何用自有数据微调模型和分析推文。Hub 收录超过 27,000 个社区共享模型,覆盖约 28 种语言,均可免费使用并支持浏览器内测试。
Hugging Face 博客讲解如何利用 Wav2Vec2 的 CTC 架构特性,对任意长的音频文件乃至实时流做高质量语音识别。
推荐理由:原文解释如何利用 CTC 架构加重叠分块让 Wav2Vec2 处理任意长音频和实时推理,方法可直接用 pipeline 复现。
Hugging Face 官方介绍 huggingface_hub 库新增的搜索功能,用户可通过 ModelSearchArguments 和 ModelFilter 类在 Python 或 Jupyter 中以编程方式筛选 Hub 上的模型和数据集,无需离开 IDE。
Hugging Face 宣布将深度强化学习库 Stable-Baselines3 集成到 Hugging Face Hub,用户可通过 `huggingface_hub` 和 `huggingface_sb3` 两个库,从 Hub 下载社区模型或用 `push_to_hub` 上传自己训练的模型,如 PPO 训练的 CartPole-v1 智能体。
Hugging Face 介绍其容器化推理方案 Infinity 在 3rd Gen Intel Xeon(Ice Lake)EC2 C6i 实例上的端到端性能表现。
🤗 Transformers 新增与 Kensho 的 pyctcdecode 库的集成,可将 n-gram 语言模型与微调后的 Wav2Vec2 语音识别检查点结合解码。
本教程讲解如何用 Hugging Face Transformers 与 Amazon SageMaker 部署 EleutherAI 的开源 60 亿参数模型 GPT-J 6B,在约 $500/月的 NVIDIA T4 GPU 实例上实现实时推理。
Hugging Face 介绍如何结合其 AutoNLP 框架与 Explosion 的标注工具 Prodigy 搭建主动学习流水线。
Hugging Face 宣布收购机器学习初创公司 Gradio,由 Gradio 创始人宣布。Gradio 于 2019 年由斯坦福博士生团队创立,旨在让工程师无需让非技术用户懂 Python 即可演示机器学习模型,至今已有超过 300,000 个 demo 用 Gradio 构建。
推荐理由:Gradio 创始人亲述收购缘起与产品定位,读者可以了解开源演示工具如何融入 Hugging Face 生态。
Hugging Face 将 Perceiver IO 加入 Transformers 库,这是首个能处理文本、图像、音频、视频、点云等多种模态及其组合的 Transformer 神经网络。该模型在 256 或 512 个 latent 变量上执行自注意力,使计算量与输入大小呈线性关系而非平方依赖。官方提供了预测光流和图像分类的 Spaces 示例及多个 notebook。
Hugging Face 发布教程,展示如何从零训练名为 CodeParrot 的 GPT-2 代码生成模型。
推荐理由:原文从数据清洗到训练和评测完整走一遍预训练流程,方法步骤可迁移到读者自己的代码模型训练。
Hugging Face 发布首个自定义深度强化学习环境 Snowball Fight(1vs1),基于 Unity ML-Agents 打造,玩家可在 Hugging Face Spaces 上与 RL 智能体互掷雪球。
Hugging Face 与 Graphcore 合作,通过开源库 Optimum 让 Transformer 模型在 Graphcore IPU 上更易加速推理,并推出首个 IPU 优化模型 BERT。
Hugging Face 推出开源的 Data Measurements Tool(DMT),提供交互界面和 Python 库,帮助数据集创建者和用户自动计算并比较 NLP 数据集的指标,支持在线使用。
这篇教程演示如何用 Intel Xeon Scalable(Ice Lake 架构)CPU 集群加速 PyTorch 分布式微调,在 GLUE 基准的 MRPC 数据集(5,800 个句子对)上微调 BERT 文本分类模型。
这篇 Hugging Face 教程讲解如何用 CTC 微调 Wav2Vec2-XLS-R-300M 做低资源 ASR。XLS-R 于 2021 年 11 月发布,用约 50 万小时、128 种语言的音频做自监督预训练,提供 300M 至 2B 参数的 checkpoint。教程以仅约 4 小时验证数据的 Common Voice 土耳其语数据集为示例,并用词错误率(WER)评估微调后的模型。
Hugging Face 与 Intel 合作的第二篇博客聚焦软件层面的优化,展示 Intel 新一代 Ice Lake Xeon CPU 在多种 NLP 任务上比上一代 Cascade Lake 推理最高快 75%。
Hugging Face 宣布 Hugging Face Course 第二部分将于 11 月 15 日发布,涵盖 token 分类、因果与掩码语言建模、翻译、摘要和问答等 NLP 任务,并深入介绍 🤗 Datasets 和 🤗 Tokenizers。活动包括两天演讲和微调模型的团队项目,完成后可获结业证书,AWS 通过 Amazon SageMaker 提供免费算力。
Hugging Face 社区周项目用 7 个 TPU v3-8、基于 JAX/Flax,以最多 10 亿句对训练出 20 个 Sentence Transformers 模型(含 Mini-LM、RoBERTa、DistilBERT、MPNet),在多个通用句子相似度评测上达到 SOTA,并发布 8 个专用数据集。
Hugging Face 博客认为,机器学习正在被应用到更多生产环境,软件行业的成熟实践——版本管理、自动化、测试与部署——同样适用于 ML,即所谓 MLOps。
Hugging Face Flax/JAX Community Week 期间,一个团队用 RSICD 数据集(约 10,000 张卫星图像)及 UCM、Sydney 数据集微调了 OpenAI 的 CLIP 模型,因为卫星图像与日常图像差异较大。
Hugging Face 发布教程,讲解如何用 Gradio 集成和 Spaces 托管 Hub 模型的演示应用。定义 Interface 并调用 .launch() 即可运行演示,底层通过 Inference API 支持 Transformers、spaCy、SpeechBrain 等框架以及 image-to-text、speech-to-text 等模型类型。
推荐理由:官方教程给出几行代码即可在 Spaces 托管 Hub 模型演示的方法,含自定义模型部署和串联多模型的示例。
Hugging Face 官方博客介绍如何在 Spaces 上用 Streamlit 托管模型与数据集,示范复刻 Write with Transformer 应用,用 text_area、sidebar、slider 等组件接收 GPT-2 等模型推理的超参数,并用 st.write 输出结果。
Hugging Face 发布夏季回顾,Hub 公开模型仓库从 10,000 增至超过 16,000 个,并推出可直接部署 Gradio 和 Streamlit 应用的 Spaces Beta。
Hugging Face 推出全新开源库 Optimum,旨在打造 Transformers 生产级性能优化的终极工具包,与 Intel 等硬件伙伴协作,屏蔽模型加速在硬件平台上的复杂性。
Hugging Face 在 2021 AI Hardware Summit 上宣布启动 Hardware Partner Program,Graphcore 为创始成员,开发者可在 Graphcore IPU 系统上以更低编码复杂度部署面向生产规模的 SOTA Transformer 模型。
Hugging Face 联合 Yandex Research 等机构提出 DeDLOC 分布式协作训练方法,可自适应参与者的网络与硬件条件。该方法由 40 名志愿者协同预训练了孟加拉语模型 sahajBERT(约 18M 参数,基于 ALBERT),在 NER 上 F1 达 95.45、NCC 准确率 91.97,结果与数百块 V100 训练的 XLM-R-large 相当。
推荐理由:原文给出 DeDLOC 协作训练方法细节和 40 名志愿者预训练 sahajBERT 的实测结果,含下游任务对比数据,方法可复用。
spaCy 现已集成到 Hugging Face Hub,一条命令即可上传 pipeline,自动生成模型卡和元数据。Hub 的 spaCy org 提供 60 多个来自 3.1 版本的官方模型,推理 API 开箱即支持 NER,社区模型已超 60 个之外还可通过 pip install 直接安装。
Hugging Face 推出用于 Amazon SageMaker 的 Inference DLCs 和 Inference Toolkit,部署已训练模型只需一行代码,也可直接部署 Model Hub 上 10,000+ 公开模型。