如何将 🤗 ViT 部署到 Vertex AI
Hugging Face 讲解如何把此前已在本地和 Kubernetes 部署过的 ViT B/16 TensorFlow 模型部署到 Google Cloud 的 Vertex AI 平台,用更少的代码获得与 Kubernetes 相当的扩展性。
Hugging Face 讲解如何把此前已在本地和 Kubernetes 部署过的 ViT B/16 TensorFlow 模型部署到 Google Cloud 的 Vertex AI 平台,用更少的代码获得与 Kubernetes 相当的扩展性。
Hugging Face 展示如何用 Optimum Graphcore 库在 Graphcore IPU 上微调视觉 Transformer(ViT)模型,示例为在 ImageNet-21k 预训练的 ViT 上微调 ChestX-ray14 胸部 X 光数据集。
Hugging Face 与 BigScience 将 LLM.int8() 8-bit 量化集成进 transformers 和 accelerate,使 BLOOM-176B 等 176B 参数大模型的推理显存占用减半且性能不下降。
推荐理由:原文由集成团队讲解 LLM.int8() 的量化原理、零性能下降验证和 transformers 集成细节,读者可据此在有限显存上运行大模型。
Hugging Face 发布新库 Skops,让用户将 scikit-learn 模型托管到 Hugging Face Hub 并创建模型卡。
这是一篇教程,讲解如何将上一篇文章中用 TensorFlow Serving 本地部署的 Vision Transformer (ViT) 模型,通过 Docker 容器化和 Kubernetes 集群扩展为可服务大量用户的部署。
Hugging Face 推出 Private Hub(PH),为从研究到生产的机器学习全流程提供一套安全合规的统一工具。
Hugging Face 宣布 🤗 transformers 的 TensorFlow 文本生成支持 XLA 编译,部分场景提速超过 100 倍,多数情况下甚至快过 PyTorch 最高 9 倍。
推荐理由:官方详解 TensorFlow 文本生成用 XLA 加速的用法与坑,给出 padding 控制形状和一行代码启用的可复用方法。
Hugging Face 团队发布教程,讲解如何用 TensorFlow Serving 在本地部署 Transformers 中的 TensorFlow 视觉模型,示例为 google/vit-base-patch16-224 图像分类模型。
Hugging Face 详细复盘 176B 参数模型 BLOOM 的训练技术,项目使用 384 张 80GB A100 GPU、350B token 的 59 语言数据集,耗时约 3.5 个月(约 100 万计算小时)。
作者详解了如何用 Sentence Transformers 和 Gradio 构建播放列表生成器:使用 msmarco-MiniLM-L-6-v3 模型(最大序列长度 512 word pieces)将歌词按段落切分后生成嵌入向量,再通过 util.semantic_search 对文本提示做语义搜索。
Hugging Face 发布 Twitter 情感分析入门指南,介绍如何用机器学习自动判断推文的正面、负面或中性倾向,用于分析用户反馈和监测品牌提及。有代码基础的读者可用 Tweepy 获取推文并通过 Inference API 做分析,不会编程的用户则可用 Zapier 无代码完成收集、分析和结果写入 Google Sheets 的流程。
Hugging Face 发布教程,讲解如何通过 Accelerate 使用 DeepSpeed ZeRO 特性训练大模型,无需修改代码即可启用 ZeRO Stage-2。
Hugging Face 推出 Evaluation on the Hub,由 AutoTrain 驱动,无需写任何代码即可在 Hub 上用任意数据集和指标评估任意模型。团队已评估数百个模型,并通过 Pull Request 将验证结果写入模型卡元数据。提交界面和排行榜基于 Hugging Face Spaces 构建,支持为任务找最佳模型、在新数据集上跑基线等场景。
Hugging Face 介绍了三种把 Transformers 模型导出为 ONNX 的方法,并以文本分类模型 distilbert-base-uncased-finetuned-sst-2-english 为例演示。
Intel 正式加入 Hugging Face 的 Hardware Partner Program,双方将基于开源库 Optimum Intel 为 Transformer 的训练、微调和推理构建硬件加速。
OpenAI 介绍训练大型神经网络所需的并行技术与工程实践。大型神经网络是近期许多 AI 进展的核心,但训练它们需要编排 GPU 集群来完成单一同步计算,是难度很高的工程与研究挑战。
Graphcore 与 Hugging Face 扩展开源库 Hugging Face Optimum,为 Graphcore IPU 优化的 Transformer 模型现已覆盖 NLP、语音和计算机视觉,共 10 个模型,附 IPU 配置文件和即用的预训练与微调权重。
Sempre Health 借助 Hugging Face 的 Expert Acceleration Program 构建了自动分类和回复患者短信的 NLP 管线,上线后约 20% 的入站消息可被系统自动处理。此前的规则系统只能覆盖 80% 的入站短信,Hugging Face 团队在标注、模型选型和方法上提供了指导,降低了运营团队的低价值工作量。
Hugging Face 发布 Gradio 3.0,这是 Gradio 库的全面重设计。新版本基于 Svelte 重建前端,页面加载更快、载荷更小,改进了 Dataframe 等组件并新增 Gallery、TabbedInterface;同时推出底层 Blocks API,支持自定义布局、多步数据流和根据用户输入改变组件属性或可见性。
推荐理由:官方介绍了 Gradio 3.0 的前端重设计和新 Blocks API 能力,想用 Python 构建自定义 ML 演示界面的读者可以了解能做什么。
Hugging Face 采访 Salesforce 和 Amplitude 等公司的机器学习总监,探讨 ML 对 SaaS 的影响与挑战。受访的 Omar Rahman 在 Salesforce 网络安全团队利用 ML 做防御性安全,Cao (Danica) Xiao 领导 Amplitude 的数据科学与机器学习团队。
Hugging Face 发布 Optimum 1.2,为 Transformers pipelines 增加 ONNX Runtime 推理支持,用户只需将 AutoModelForXxx 替换为 ORTModelForXxx 即可使用相同 API。
Hugging Face 发文介绍如何在 Accelerate 库中使用 PyTorch FullyShardedDataParallel(FSDP),无需改动代码即可分片训练大模型。
Hugging Face 实战演示如何在 AWS EC2 DL1 实例(配备 8 个 Habana Gaudi 处理器)上微调 BERT:使用 Habana Deep Learning AMI 和 PyTorch 容器。
Hugging Face 介绍如何在 Hub 上追踪和筛选模型的 CO2 排放。安装 codecarbon 后,transformers 的 Trainer 会自动记录训练碳排放并生成 emissions.csv。
Hugging Face 播客采访了机器学习工程师 Lewis Tunstall,他从事 Transformers 应用与 MLOps 工作,并与 Leandro von Werra 合著了《NLP with Transformers》一书。他近期在 transformers 库中开发模型导出 ONNX 格式的功能,一行代码即可完成转换,帮助工程师获得更快延迟和更高吞吐量。
Habana Labs 与 Hugging Face 宣布合作,通过将 SynapseAI 软件套件集成到 Hugging Face Optimum 开源库,让用户只需几行代码即可在 Habana Gaudi 处理器上加速 Transformer 训练。
Hugging Face 官方博客解释 Transformers 库有意不采用软件开发的 DRY 原则,而是采用单模型文件策略,即模型前向传播的全部代码集中在一个文件中。
这是一篇端到端教程,演示如何结合 Hugging Face Transformers、Amazon SageMaker 与 AWS Inferentia 加速 BERT 文本分类推理。
Hugging Face 在 Transformers 的 model.generate() 中新增 constrained beam search 功能,支持通过 force_words_ids 强制输出包含指定词或短语。该功能支持析取约束(从词表中至少选一),并用 banks 分组和轮询选择在满足约束与生成流畅输出间取得平衡;用户也可继承 Constraint 抽象类自定义约束。
Hugging Face 博客讲解如何利用 Wav2Vec2 的 CTC 架构特性,对任意长的音频文件乃至实时流做高质量语音识别。
推荐理由:原文解释如何利用 CTC 架构加重叠分块让 Wav2Vec2 处理任意长音频和实时推理,方法可直接用 pipeline 复现。
Hugging Face 介绍其容器化推理方案 Infinity 在 3rd Gen Intel Xeon(Ice Lake)EC2 C6i 实例上的端到端性能表现。
本教程讲解如何用 Hugging Face Transformers 与 Amazon SageMaker 部署 EleutherAI 的开源 60 亿参数模型 GPT-J 6B,在约 $500/月的 NVIDIA T4 GPU 实例上实现实时推理。
Hugging Face 与 Graphcore 合作,通过开源库 Optimum 让 Transformer 模型在 Graphcore IPU 上更易加速推理,并推出首个 IPU 优化模型 BERT。
这篇教程演示如何用 Intel Xeon Scalable(Ice Lake 架构)CPU 集群加速 PyTorch 分布式微调,在 GLUE 基准的 MRPC 数据集(5,800 个句子对)上微调 BERT 文本分类模型。
Hugging Face 与 Intel 合作的第二篇博客聚焦软件层面的优化,展示 Intel 新一代 Ice Lake Xeon CPU 在多种 NLP 任务上比上一代 Cascade Lake 推理最高快 75%。
Microsoft 与 NVIDIA 发布了基于 Transformer 的 Megatron-Turing NLG 530B,被称为“全球最大最强生成式语言模型”。
Hugging Face 博客认为,机器学习正在被应用到更多生产环境,软件行业的成熟实践——版本管理、自动化、测试与部署——同样适用于 ML,即所谓 MLOps。
Hugging Face 发布教程,讲解如何用 Gradio 集成和 Spaces 托管 Hub 模型的演示应用。定义 Interface 并调用 .launch() 即可运行演示,底层通过 Inference API 支持 Transformers、spaCy、SpeechBrain 等框架以及 image-to-text、speech-to-text 等模型类型。
推荐理由:官方教程给出几行代码即可在 Spaces 托管 Hub 模型演示的方法,含自定义模型部署和串联多模型的示例。
Hugging Face 官方博客介绍如何在 Spaces 上用 Streamlit 托管模型与数据集,示范复刻 Write with Transformer 应用,用 text_area、sidebar、slider 等组件接收 GPT-2 等模型推理的超参数,并用 st.write 输出结果。
Hugging Face 推出全新开源库 Optimum,旨在打造 Transformers 生产级性能优化的终极工具包,与 Intel 等硬件伙伴协作,屏蔽模型加速在硬件平台上的复杂性。