Hugging Face 推出 Data Measurements Tool:交互式数据集测量工具
Hugging Face 推出开源的 Data Measurements Tool(DMT),提供交互界面和 Python 库,帮助数据集创建者和用户自动计算并比较 NLP 数据集的指标,支持在线使用。
Hugging Face 推出开源的 Data Measurements Tool(DMT),提供交互界面和 Python 库,帮助数据集创建者和用户自动计算并比较 NLP 数据集的指标,支持在线使用。
这篇教程演示如何用 Intel Xeon Scalable(Ice Lake 架构)CPU 集群加速 PyTorch 分布式微调,在 GLUE 基准的 MRPC 数据集(5,800 个句子对)上微调 BERT 文本分类模型。
Microsoft 与 NVIDIA 发布了基于 Transformer 的 Megatron-Turing NLG 530B,被称为“全球最大最强生成式语言模型”。
OpenAI 发布通过人类反馈扩展 AI 系统人类监督的研究,针对难以评估的任务训练书籍摘要模型。原文仅提供一句话摘要,未给出更多实验细节。
Hugging Face 联合 Yandex Research 等机构提出 DeDLOC 分布式协作训练方法,可自适应参与者的网络与硬件条件。该方法由 40 名志愿者协同预训练了孟加拉语模型 sahajBERT(约 18M 参数,基于 ALBERT),在 NER 上 F1 达 95.45、NCC 准确率 91.97,结果与数百块 V100 训练的 XLM-R-large 相当。
推荐理由:原文给出 DeDLOC 协作训练方法细节和 40 名志愿者预训练 sahajBERT 的实测结果,含下游任务对比数据,方法可复用。
Hugging Face 与 Amazon SageMaker 合作推出优化的 Deep Learning Containers,通过 SageMaker Python SDK 中的 HuggingFace estimator 可一行代码启动训练。
BigBird 用块稀疏注意力替代 BERT 的全注意力,可处理最长 4096 的序列,计算成本远低于 BERT,其 RoBERTa 类模型已在 🤗Transformers 中可用。其注意力由三部分近似:捕获邻近依赖的滑动注意力、被所有 token 关注的全局 token,以及随机选择的随机 token,以此在长序列上高效逼近全注意力。该模型在长文档摘要、长上下文问答等任务上取得 SOTA。
Hugging Face 2021年2月阅读小组聚焦长序列 Transformer 的注意力效率问题,重点解读四篇论文:Longformer(定制注意力模式)、Compressive Transformer(循环机制)、Linformer(低秩近似)和 Performer(核近似)。
Hugging Face 员工撰文分享构建和调试神经网络的心智流程,核心是先放下机器学习、深入了解数据,再从简单基线(如基于 word2vec 或 fastText 的逻辑回归)逐步过渡到复杂模型。
这篇 Hugging Face 教程讲解如何用 BERT、GPT2 等预训练检查点热启动(warm-start)encoder-decoder 模型,从而跳过高昂的预训练成本。
Anyscale 团队的 Richard Liaw 撰文介绍 Hugging Face Transformers 3.1 与 Ray Tune 的超参数搜索集成。
Hugging Face 发布长文教程,详解基于 Transformer 的编码器-解码器架构如何建模序列到序列任务。文章从 RNN 编码器-解码器模型的历史讲起,分解编码器的双向自注意力与解码器的单向自注意力和交叉注意力机制,并以 MarianMT 模型代码演示 .generate() 自回归推理,涵盖 T5、Bart、Pegasus 等模型背景,但不涉及训练方法。
Hugging Face 深入解析 Kitaev、Kaiser 等人在 2020 年提出的 Reformer 模型:通过 Reformer Self-Attention。
OpenAI 发布分析指出,自 2012 年以来在 ImageNet 分类上达到相同性能所需的训练算力每 16 个月减少一半。相比 2012 年,如今训练到 AlexNet 水平所需算力减少 44 倍,而 Moore's Law 同期只能带来 11 倍的成本改善。作者据此认为,在高投入的 AI 任务上,算法进步带来的收益已超过传统硬件效率提升。
推荐理由:原文量化了算法进步带来的算力节省速度,可与 Moore's Law 对比,帮助理解硬件与算法效率的真实差距。
Hugging Face 演示如何用 transformers 和 tokenizers 库从零训练一个 84M 参数(6 层、768 hidden size、12 attention heads)的 RoBERTa 类模型 EsperBERTo,语料为 3GB 的世界语 OSCAR 与 Leipzig 语料。
OpenAI 发表关于神经语言模型缩放定律的研究,原文正文抓取失败,仅标题可用。
OpenAI 发布关于 Dota 2 大规模深度强化学习的文章。材料抓取失败,仅标题可用,正文细节无法确认。
OpenAI 发现双重下降(double descent)现象广泛存在于 CNN、ResNets 和 Transformers 中:随着模型规模、数据量或训练时间增加,性能先提升、再下降、随后再次提升。通过仔细的正则化通常可以避免这一效应。该现象目前尚无完整解释,OpenAI 认为对其进一步研究是重要方向。
OpenAI 开放第三期 OpenAI Scholars 项目申请,面向 2020 届学员。该项目是 OpenAI 的学者培养计划,申请渠道现已开启。
OpenAI 在 2 月发布 124M、5 月分阶段发布 355M 之后,发布 774M 参数的 GPT-2 语言模型。同时发布一份开源法律协议,便于机构间建立模型共享合作,并发布技术报告,总结与 AI 研究社区协调发布规范的经验。
推荐理由:OpenAI 官方复盘分阶段释放 774M GPT-2 的决策过程,可了解滥用风险评估如何影响模型发布策略。
OpenAI 从 550 名申请者中选出 8 位 2019 年 OpenAI Scholars 学者。这批学者拥有文学、哲学、细胞生物学、统计学、经济学、量子物理和商业创新等多元背景。
2 月 2 日,OpenAI 举办了首期 Spinning Up Workshop,这是其新教育计划的一部分。
首期 OpenAI Fellows 项目结业,每位学员在 6 个月的学徒期内从机器学习初学者成长为 OpenAI 核心贡献者,并展示了各自的最终项目成果。
OpenAI 发现梯度噪声规模(gradient noise scale)这一统计指标可预测神经网络训练在多种任务上的可并行性。复杂任务梯度更嘈杂,未来更大的 batch size 可能变得有用,从而移除 AI 系统继续扩大的一个潜在限制;研究还表明神经网络训练可以被严格化和系统化。
OpenAI 发布 Spinning Up in Deep RL,一套面向所有人的深度强化学习教育资源,目标是帮助学习者成为熟练的深度强化学习从业者。该资源包含清晰的 RL 代码示例、教育练习、文档和教程。
OpenAI 宣布以可扩展、任务无关的系统在多项多样化语言任务上取得 SOTA 结果,并开放发布该系统。方法结合 Transformer 与无监督预训练两个已有思路,团队认为结果证明了监督学习搭配无监督预训练的有效性,希望推动在更大更多样数据集上的进一步研究。
推荐理由:原文给出无监督预训练加 Transformer 的方法组合和多任务 SOTA 结果,可帮读者理解预训练思路的实际成效。
OpenAI 发布完整版 Gym Retro,一个面向游戏强化学习研究的平台。公开游戏数量由此前约 70 款 Atari 游戏和 30 款 Sega 游戏扩展到覆盖多种模拟器的超过 1000 款游戏,并同步开源了用于向平台添加新游戏的工具。
OpenAI 发布分析,指出 2012 年以来最大 AI 训练所用算力呈指数增长,翻倍时间为 3.4 个月,远快于摩尔定律的 2 年翻倍;累计增长超过 300,000 倍,而 2 年翻倍仅带来约 7 倍增长。算力提升是 AI 进展的关键组成部分,若趋势延续,需为远超当前能力的系统做准备。
推荐理由:原文以自家分析给出最大 AI 训练算力的增长数据,读者可据此理解算力在 AI 进展中的作用与后续影响。
OpenAI 开发了名为 Reptile 的简单元学习算法,其做法是反复采样一个任务,对其执行随机梯度下降,并将初始参数向该任务学到的最终参数方向更新。Reptile 是 Shortest Descent 算法在元学习场景的应用,在数学上类似仅需 SGD 或 Adam 等优化器黑盒访问的一阶 MAML,计算效率与性能相近。
OpenAI 设计了一种让 AI 用对人类也有意义的示例互相教学的方法。该方法能自动挑选最具信息量的示例来教授某个概念,例如用最合适的图片解释“狗”的概念。实验显示,这一方法在教 AI 方面同样有效。
OpenAI 发现自博弈让模拟 AI 无需专门设计环境就学会擒抱、躲闪、假动作、踢球、接球和扑球等物理技能。自博弈能保证环境难度始终适合 AI 提升,结合 Dota 2 自博弈结果,OpenAI 认为自博弈将成为未来强大 AI 系统的核心组成部分。
OpenAI 表示其 Dota 2 结果表明,在足够算力下自博弈能让机器学习系统从远低于人类水平跃升至超人类。系统在一个月内从勉强匹敌高排名玩家进步到击败顶尖职业选手,且此后仍在提升;与监督深度学习受限于训练数据不同,自博弈系统的数据会随智能体变强而自动改善。
推荐理由:官方复盘解释了 Dota 2 自博弈为何能在一个月内从低于人类跃升到超越顶尖选手,比较了监督学习与自博弈的数据获取差异。
OpenAI 发布一套完全在仿真中训练、部署到实体机器人上的机器人系统。该系统只需观看任务演示一次即可学会新任务。
OpenAI 开发了一个无监督系统,仅在 Amazon 评论文本上训练预测下一个字符,却学到了优秀的情感表示。方法无需情感标注数据。
推荐理由:原文说明模型仅靠预测 Amazon 评论下一字符就学到优秀情感表示,展示了无监督表征的潜力。
OpenAI 发现进化策略(ES)这一已有数十年历史的优化技术在 Atari、MuJoCo 等现代 RL 基准上可媲美标准强化学习,同时克服了 RL 的诸多不便。
推荐理由:原文指出进化策略在 Atari 和 MuJoCo 基准上可与标准 RL 相当,并避开 RL 的诸多不便。
OpenAI 发文指出,深度学习是一门经验科学,团队基础设施的质量会对研究进展起到乘数效应。文章同时提到,如今的开源生态让任何人都有可能搭建优秀的深度学习基础设施。