Hugging Face 与 Graphcore 合作推出 IPU 优化的 Transformers
Hugging Face 在 2021 AI Hardware Summit 上宣布启动 Hardware Partner Program,Graphcore 为创始成员,开发者可在 Graphcore IPU 系统上以更低编码复杂度部署面向生产规模的 SOTA Transformer 模型。
Hugging Face 在 2021 AI Hardware Summit 上宣布启动 Hardware Partner Program,Graphcore 为创始成员,开发者可在 Graphcore IPU 系统上以更低编码复杂度部署面向生产规模的 SOTA Transformer 模型。
OpenAI 发布开源的类 Python 编程语言 Triton 1.0,供编写神经网络 GPU 代码。没有 CUDA 经验的研究者也能写出高效 GPU 代码,多数情况下效率与专家产出相当。
推荐理由:原文说明无 CUDA 经验的研究者也能用它写出接近专家水平的 GPU 代码,可据此评估对研究工作流的影响。
Hugging Face 推出用于 Amazon SageMaker 的 Inference DLCs 和 Inference Toolkit,部署已训练模型只需一行代码,也可直接部署 Model Hub 上 10,000+ 公开模型。
Gradio 2.0 发布,仅需 1 行代码即可为 Hugging Face Model Hub 上超过 10000 个模型创建 GUI 演示,默认使用 Hugging Face 托管 Inference API,也可通过 pip install transformers 在本地运行模型。
Hugging Face 发布 CPU 上 BERT 推理优化系列的第一篇,聚焦硬件层面:搭建基线、核心数扩展与 batch size 扩展。
Hugging Face 发布开源库 Accelerate,用户只需在标准 PyTorch 训练脚本中添加约五行代码,即可在多 GPU、TPU、混合精度等任意分布式环境下运行,且保留对训练循环的完全控制。
推荐理由:原文给出在标准 PyTorch 脚本上加约五行代码即可迁移多 GPU、TPU 和混合精度的具体做法,可与手写 DistributedDataParallel 对比参考。
Hugging Face 与 Amazon SageMaker 合作推出优化的 Deep Learning Containers,通过 SageMaker Python SDK 中的 HuggingFace estimator 可一行代码启动训练。
Hugging Face 宣布与 Amazon 达成战略合作,AWS 成为 Hugging Face 的首选云服务商,双方为 Amazon SageMaker 推出新的 Hugging Face Deep Learning Containers(DLCs),简化 Transformer 模型训练。
社区成员 Maxence Dominici 撰文记录如何将 transformers 情感分析 pipeline 部署到 Google Cloud,用于自动判别 Discord 客户评论的正负面。
Anyscale 团队将 Ray 集成到 Hugging Face Transformers 的 RAG(Retrieval Augmented Generation)模型的文档检索机制中,相比原 torch.distributed 实现将每次检索调用提速 2x,并提升分布式微调的可扩展性。
Hugging Face 与 Facebook PyTorch、Google TPU 团队合作,为 PyTorch / XLA 在 Cloud TPU 上的训练提供一等支持,Trainer 接口保持不变。
Hugging Face 团队改进 Transformers v4.2.0 的 TensorFlow 模型,BERT 在 V100、序列长度 128 的基准中比 Google 官方实现最快快约 10%。
OpenAI 将 Kubernetes 集群扩展到 7,500 个节点,构建了可扩展的基础设施。该基础设施支持 GPT-3、CLIP、DALL·E 等大模型的训练,也服务于神经语言模型 Scaling Laws 等小规模快速迭代研究。
transformers v4.2.0 起在 Trainer 中实验性支持 DeepSpeed 和 FairScale 的 ZeRO 特性,分别通过 --deepspeed 和 --sharded_ddp 参数启用。
推荐理由:作者用 t5-large 和 t5-3b 的实测对比表展示 ZeRO 如何提升显存效率与训练速度,方法可直接在 transformers Trainer 中复用。
Hugging Face 团队通过两层优化,为其 Accelerated Inference API 用户将 Transformer 推理速度提升共 100 倍。
Stas Bekman 在 Hugging Face 撰文记录了将 Facebook FAIR 的 WMT19 翻译系统移植到 transformers 的完整过程。
Hugging Face 发布 PyTorch 扩展 pytorch_block_sparse,提供 BlockSparseLinear 作为 torch.nn.Linear 的即插即用替代,实现块稀疏线性层的高效训练。
Hugging Face 博客讲解自回归语言生成的主要解码策略,包括 Greedy search、Beam search、Sampling、Top-K 和 Top-p(nucleus)sampling,并用 GPT2 给出 transformers 库中可直接运行的代码示例。
Microsoft 向 OpenAI 投资 10 亿美元,支持其构建惠益广泛分布的 AGI。双方将在 Microsoft Azure 内共同开发可扩展至 AGI 的软硬件平台和新的 Azure AI 超算技术,Microsoft 将成为 OpenAI 的独家云提供商。
推荐理由:OpenAI 官方宣布与 Microsoft 的投资与合作细节,涵盖资金规模和 Azure 独家云协议,可用于理解双方后续算力布局的起点。
OpenAI 发布了针对块稀疏权重网络这一少有人探索的神经网络架构的高度优化 GPU 内核。根据所选稀疏度,这些内核可比 cuBLAS 或 cuSPARSE 快数个数量级。OpenAI 已用它们在文本情感分析和文本、图像生成建模上取得 SOTA 结果。
OpenAI 发文指出,深度学习是一门经验科学,团队基础设施的质量会对研究进展起到乘数效应。文章同时提到,如今的开源生态让任何人都有可能搭建优秀的深度学习基础设施。