Hugging Face 用 10 亿句对训练句子嵌入模型的完整复盘
Hugging Face 社区周项目用 7 个 TPU v3-8、基于 JAX/Flax,以最多 10 亿句对训练出 20 个 Sentence Transformers 模型(含 Mini-LM、RoBERTa、DistilBERT、MPNet),在多个通用句子相似度评测上达到 SOTA,并发布 8 个专用数据集。
Hugging Face 社区周项目用 7 个 TPU v3-8、基于 JAX/Flax,以最多 10 亿句对训练出 20 个 Sentence Transformers 模型(含 Mini-LM、RoBERTa、DistilBERT、MPNet),在多个通用句子相似度评测上达到 SOTA,并发布 8 个专用数据集。
Hugging Face Flax/JAX Community Week 期间,一个团队用 RSICD 数据集(约 10,000 张卫星图像)及 UCM、Sydney 数据集微调了 OpenAI 的 CLIP 模型,因为卫星图像与日常图像差异较大。
Hugging Face 发布教程,讲解如何用 Gradio 集成和 Spaces 托管 Hub 模型的演示应用。定义 Interface 并调用 .launch() 即可运行演示,底层通过 Inference API 支持 Transformers、spaCy、SpeechBrain 等框架以及 image-to-text、speech-to-text 等模型类型。
推荐理由:官方教程给出几行代码即可在 Spaces 托管 Hub 模型演示的方法,含自定义模型部署和串联多模型的示例。
Hugging Face 官方博客介绍如何在 Spaces 上用 Streamlit 托管模型与数据集,示范复刻 Write with Transformer 应用,用 text_area、sidebar、slider 等组件接收 GPT-2 等模型推理的超参数,并用 st.write 输出结果。
Hugging Face 讲解如何用 EleutherAI 的 GPT-Neo 和 🤗 Accelerated Inference API 实现 Few-Shot Learning 预测。
Gradio 2.0 发布,仅需 1 行代码即可为 Hugging Face Model Hub 上超过 10000 个模型创建 GUI 演示,默认使用 Hugging Face 托管 Inference API,也可通过 pip install transformers 在本地运行模型。
Hugging Face 发布 CPU 上 BERT 推理优化系列的第一篇,聚焦硬件层面:搭建基线、核心数扩展与 batch size 扩展。
Hugging Face 与 Amazon SageMaker 合作推出优化的 Deep Learning Containers,通过 SageMaker Python SDK 中的 HuggingFace estimator 可一行代码启动训练。
BigBird 用块稀疏注意力替代 BERT 的全注意力,可处理最长 4096 的序列,计算成本远低于 BERT,其 RoBERTa 类模型已在 🤗Transformers 中可用。其注意力由三部分近似:捕获邻近依赖的滑动注意力、被所有 token 关注的全局 token,以及随机选择的随机 token,以此在长序列上高效逼近全注意力。该模型在长文档摘要、长上下文问答等任务上取得 SOTA。
社区成员 Maxence Dominici 撰文记录如何将 transformers 情感分析 pipeline 部署到 Google Cloud,用于自动判别 Discord 客户评论的正负面。
这篇 Hugging Face 教程讲解如何在任何英语 ASR 数据集上微调 Wav2Vec2 预训练模型。Wav2Vec2 仅用 10 分钟标注数据即可在 LibriSpeech 干净测试集上取得低于 5% 的 WER;教程在仅 5h 训练数据的 Timit 数据集上微调 base 版 checkpoint,采用 CTC 算法、不依赖语言模型,并用 WER 指标评估。
Hugging Face 员工撰文分享构建和调试神经网络的心智流程,核心是先放下机器学习、深入了解数据,再从简单基线(如基于 word2vec 或 fastText 的逻辑回归)逐步过渡到复杂模型。
Anyscale 团队将 Ray 集成到 Hugging Face Transformers 的 RAG(Retrieval Augmented Generation)模型的文档检索机制中,相比原 torch.distributed 实现将每次检索调用提速 2x,并提升分布式微调的可扩展性。
Hugging Face 与 Facebook PyTorch、Google TPU 团队合作,为 PyTorch / XLA 在 Cloud TPU 上的训练提供一等支持,Trainer 接口保持不变。
Hugging Face 团队改进 Transformers v4.2.0 的 TensorFlow 模型,BERT 在 V100、序列长度 128 的基准中比 Google 官方实现最快快约 10%。
OpenAI 将 Kubernetes 集群扩展到 7,500 个节点,构建了可扩展的基础设施。该基础设施支持 GPT-3、CLIP、DALL·E 等大模型的训练,也服务于神经语言模型 Scaling Laws 等小规模快速迭代研究。
transformers v4.2.0 起在 Trainer 中实验性支持 DeepSpeed 和 FairScale 的 ZeRO 特性,分别通过 --deepspeed 和 --sharded_ddp 参数启用。
推荐理由:作者用 t5-large 和 t5-3b 的实测对比表展示 ZeRO 如何提升显存效率与训练速度,方法可直接在 transformers Trainer 中复用。
Hugging Face 团队通过两层优化,为其 Accelerated Inference API 用户将 Transformer 推理速度提升共 100 倍。
这篇 Hugging Face 教程讲解如何用 BERT、GPT2 等预训练检查点热启动(warm-start)encoder-decoder 模型,从而跳过高昂的预训练成本。
Stas Bekman 在 Hugging Face 撰文记录了将 Facebook FAIR 的 WMT19 翻译系统移植到 transformers 的完整过程。
Anyscale 团队的 Richard Liaw 撰文介绍 Hugging Face Transformers 3.1 与 Ray Tune 的超参数搜索集成。
Hugging Face 发布长文教程,详解基于 Transformer 的编码器-解码器架构如何建模序列到序列任务。文章从 RNN 编码器-解码器模型的历史讲起,分解编码器的双向自注意力与解码器的单向自注意力和交叉注意力机制,并以 MarianMT 模型代码演示 .generate() 自回归推理,涵盖 T5、Bart、Pegasus 等模型背景,但不涉及训练方法。
Hugging Face 深入解析 Kitaev、Kaiser 等人在 2020 年提出的 Reformer 模型:通过 Reformer Self-Attention。
Hugging Face 博客讲解自回归语言生成的主要解码策略,包括 Greedy search、Beam search、Sampling、Top-K 和 Top-p(nucleus)sampling,并用 GPT2 给出 transformers 库中可直接运行的代码示例。
Hugging Face 演示如何用 transformers 和 tokenizers 库从零训练一个 84M 参数(6 层、768 hidden size、12 attention heads)的 RoBERTa 类模型 EsperBERTo,语料为 3GB 的世界语 OSCAR 与 Leipzig 语料。
2 月 2 日,OpenAI 举办了首期 Spinning Up Workshop,这是其新教育计划的一部分。
首期 OpenAI Fellows 项目结业,每位学员在 6 个月的学徒期内从机器学习初学者成长为 OpenAI 核心贡献者,并展示了各自的最终项目成果。
OpenAI 发布 Spinning Up in Deep RL,一套面向所有人的深度强化学习教育资源,目标是帮助学习者成为熟练的深度强化学习从业者。该资源包含清晰的 RL 代码示例、教育练习、文档和教程。
OpenAI 探讨强化学习算法中的一种失效模式:奖励函数设定错误(reward misspecification)会让算法以出人意料、违反直觉的方式出错。文章指出,这类问题源于奖励函数与设计者真实意图的偏差,是强化学习在真实场景中部署时需要面对的挑战。
OpenAI 发文指出,深度学习是一门经验科学,团队基础设施的质量会对研究进展起到乘数效应。文章同时提到,如今的开源生态让任何人都有可能搭建优秀的深度学习基础设施。