如何将 fairseq WMT19 翻译系统移植到 transformers
Stas Bekman 在 Hugging Face 撰文记录了将 Facebook FAIR 的 WMT19 翻译系统移植到 transformers 的完整过程。
Stas Bekman 在 Hugging Face 撰文记录了将 Facebook FAIR 的 WMT19 翻译系统移植到 transformers 的完整过程。
Anyscale 团队的 Richard Liaw 撰文介绍 Hugging Face Transformers 3.1 与 Ray Tune 的超参数搜索集成。
Hugging Face 演示如何用 transformers 和 tokenizers 库从零训练一个 84M 参数(6 层、768 hidden size、12 attention heads)的 RoBERTa 类模型 EsperBERTo,语料为 3GB 的世界语 OSCAR 与 Leipzig 语料。
OpenAI 宣布将其深度学习框架标准化为 PyTorch。
OpenAI 发布完整版 Gym Retro,一个面向游戏强化学习研究的平台。公开游戏数量由此前约 70 款 Atari 游戏和 30 款 Sega 游戏扩展到覆盖多种模拟器的超过 1000 款游戏,并同步开源了用于向平台添加新游戏的工具。
OpenAI 发布 8 个仿真机器人环境和 Hindsight Experience Replay 的 Baselines 实现,均来自过去一年的研究工作。这些环境已用于训练可在实体机器人上运行的模型,同时附上一组机器人研究需求说明。
OpenAI 开源了 RL-Teacher,这是一个通过偶尔的人类反馈而非手工设计奖励函数来训练 AI 的接口实现。该底层技术是迈向安全 AI 系统的一步,也适用于奖励难以指定的强化学习问题。
OpenAI 发布一类新的强化学习算法 Proximal Policy Optimization(PPO),性能与当时最先进方法相当或更好,同时实现和调参更简单。凭借易用性和良好表现,PPO 已成为 OpenAI 的默认强化学习算法。
推荐理由:原文点出了 PPO 性能与实现简洁度的平衡,读者可以了解它为何成为 OpenAI 的默认强化学习算法。
OpenAI 开源了 Baselines 项目,旨在复现性能与已发表结果持平的强化学习算法。首批发布包含 DQN 及其三个变体,其余算法将在随后几个月内陆续放出。
OpenAI 发布 OpenAI Gym 公开测试版,这是一个用于开发和比较强化学习(RL)算法的工具包。它包含不断扩充的环境套件(从仿真机器人到 Atari 游戏),并提供用于比较和复现结果的网站。
推荐理由:官方发布强化学习工具包 Gym 公测版,含环境套件与结果比较复现平台,适合关注 RL 工作流的读者了解其定位。