OpenAI 发布基于 Transformer 与无监督预训练的语言理解系统
OpenAI 宣布以可扩展、任务无关的系统在多项多样化语言任务上取得 SOTA 结果,并开放发布该系统。方法结合 Transformer 与无监督预训练两个已有思路,团队认为结果证明了监督学习搭配无监督预训练的有效性,希望推动在更大更多样数据集上的进一步研究。
推荐理由:原文给出无监督预训练加 Transformer 的方法组合和多任务 SOTA 结果,可帮读者理解预训练思路的实际成效。
训练侧的门道:数据集构建、合成数据、预训练与后训练方法、算力与训练成本。
OpenAI 宣布以可扩展、任务无关的系统在多项多样化语言任务上取得 SOTA 结果,并开放发布该系统。方法结合 Transformer 与无监督预训练两个已有思路,团队认为结果证明了监督学习搭配无监督预训练的有效性,希望推动在更大更多样数据集上的进一步研究。
推荐理由:原文给出无监督预训练加 Transformer 的方法组合和多任务 SOTA 结果,可帮读者理解预训练思路的实际成效。
OpenAI 发布分析,指出 2012 年以来最大 AI 训练所用算力呈指数增长,翻倍时间为 3.4 个月,远快于摩尔定律的 2 年翻倍;累计增长超过 300,000 倍,而 2 年翻倍仅带来约 7 倍增长。算力提升是 AI 进展的关键组成部分,若趋势延续,需为远超当前能力的系统做准备。
推荐理由:原文以自家分析给出最大 AI 训练算力的增长数据,读者可据此理解算力在 AI 进展中的作用与后续影响。
OpenAI 表示其 Dota 2 结果表明,在足够算力下自博弈能让机器学习系统从远低于人类水平跃升至超人类。系统在一个月内从勉强匹敌高排名玩家进步到击败顶尖职业选手,且此后仍在提升;与监督深度学习受限于训练数据不同,自博弈系统的数据会随智能体变强而自动改善。
推荐理由:官方复盘解释了 Dota 2 自博弈为何能在一个月内从低于人类跃升到超越顶尖选手,比较了监督学习与自博弈的数据获取差异。
OpenAI 发布一套完全在仿真中训练、部署到实体机器人上的机器人系统。该系统只需观看任务演示一次即可学会新任务。
OpenAI 开发了一个无监督系统,仅在 Amazon 评论文本上训练预测下一个字符,却学到了优秀的情感表示。方法无需情感标注数据。
推荐理由:原文说明模型仅靠预测 Amazon 评论下一字符就学到优秀情感表示,展示了无监督表征的潜力。
OpenAI 发现进化策略(ES)这一已有数十年历史的优化技术在 Atari、MuJoCo 等现代 RL 基准上可媲美标准强化学习,同时克服了 RL 的诸多不便。
推荐理由:原文指出进化策略在 Atari 和 MuJoCo 基准上可与标准 RL 相当,并避开 RL 的诸多不便。