OpenAI 发布 Sparse Transformer,序列建模能力提升 30 倍
OpenAI 开发出 Sparse Transformer,一种在文本、图像和声音等序列预测任务上创造新纪录的深度神经网络。它通过对注意力机制的算法改进,可从比以往长 30 倍的序列中提取模式。
OpenAI 开发出 Sparse Transformer,一种在文本、图像和声音等序列预测任务上创造新纪录的深度神经网络。它通过对注意力机制的算法改进,可从比以往长 30 倍的序列中提取模式。
OpenAI 在能量模型(EBM)的稳定、可扩展训练上取得进展,样本质量与泛化能力优于现有模型。EBM 生成时通过持续细化答案投入更多算力,在低温下可生成与 GAN 相当的样本,同时具备似然类模型的 mode 覆盖保证。
OpenAI 与 Google 研究者合作创建了 Activation Atlases,一种可视化神经元之间交互所能表示内容的新技术。随着 AI 系统被部署到越来越敏感的场景,更好地理解其内部决策过程有助于发现弱点并调查故障。
OpenAI 发表论文指出,长期 AI 安全研究需要社会科学家参与,才能确保对齐算法在真实人类参与时发挥作用。让先进 AI 系统与人类价值观对齐,需解决人类理性、情感与偏见心理学中的诸多不确定性。OpenAI 希望推动机器学习与社会科学研究者合作,并计划全职招聘社会科学家。
OpenAI 发现梯度噪声规模(gradient noise scale)这一统计指标可预测神经网络训练在多种任务上的可并行性。复杂任务梯度更嘈杂,未来更大的 batch size 可能变得有用,从而移除 AI 系统继续扩大的一个潜在限制;研究还表明神经网络训练可以被严格化和系统化。
OpenAI 发布 CoinRun 训练环境,为智能体将经验迁移到新情境的能力提供量化指标,并已帮助厘清强化学习中一个长期存在的难题。CoinRun 的复杂度介于传统平台游戏(如 Sonic the Hedgehog)与更低难度环境之间,同时对最先进算法仍构成有价值的泛化挑战。
OpenAI 开发出一种能量模型,只需五个演示即可快速学会识别和生成 near、above、between、closest、furthest 等以二维点集表达的概念。该模型还展现出跨域迁移能力:在二维粒子环境中学到的概念可被用于求解三维物理仿真机器人上的任务。
OpenAI 提出 Random Network Distillation(RND),一种通过好奇心鼓励强化学习智能体探索环境的基于预测的奖励方法。该方法在 Montezuma's Revenge 上首次超过人类平均水平。
OpenAI 提出一项名为 iterated amplification 的 AI 安全技术,通过演示如何把任务分解为更简单的子任务,来指定超越人类规模的复杂行为和目标,而无需提供标注数据或奖励函数。目前该想法仍处早期阶段,实验仅在简单的玩具算法领域完成,但 OpenAI 认为其可能成为可扩展的 AI 安全方法。
OpenAI 发布可逆生成模型 Glow,使用可逆 1x1 卷积,扩展并简化了此前可逆生成模型的工作。模型可生成真实的高分辨率图像,支持高效采样,并能发现可用于操纵数据属性的特征;OpenAI 同时开源模型代码并上线在线可视化工具。
OpenAI 训练的智能体仅凭一条人类演示,在 Montezuma's Revenge 上取得 74,500 的高分,超过此前已发表结果。方法是从演示中精心挑选的起始状态开始游玩,并用 PPO 优化游戏得分,与 OpenAI Five 所用的强化学习算法相同。
OpenAI 发布一种实验性元学习方法 Evolved Policy Gradients(EPG),通过进化学习智能体的损失函数,使其能在全新任务上快速训练。经 EPG 训练的智能体在测试时可完成训练分布之外的基础任务,例如导航到房间中与训练时放置位置不同一侧的物体。
OpenAI 开发了名为 Reptile 的简单元学习算法,其做法是反复采样一个任务,对其执行随机梯度下降,并将初始参数向该任务学到的最终参数方向更新。Reptile 是 Shortest Descent 算法在元学习场景的应用,在数学上类似仅需 SGD 或 Adam 等优化器黑盒访问的一阶 MAML,计算效率与性能相近。
OpenAI 与 Future of Humanity Institute、Centre for the Study of Existential Risk、Center for a New American Security。
OpenAI 设计了一种让 AI 用对人类也有意义的示例互相教学的方法。该方法能自动挑选最具信息量的示例来教授某个概念,例如用最合适的图片解释“狗”的概念。实验显示,这一方法在教 AI 方面同样有效。
OpenAI 发布 Requests for Research 2.0,公开 7 个未解决的研究问题,均来自其研究工作中实际遇到的问题。
OpenAI 开发了一种分层强化学习算法,能学习对解决一系列任务有用的高层动作,从而快速完成需要数千 timesteps 的任务。将该算法应用于一组导航问题时,智能体自主发现朝不同方向行走和爬行的高层动作,进而快速掌握新的导航任务。
OpenAI 发现自博弈让模拟 AI 无需专门设计环境就学会擒抱、躲闪、假动作、踢球、接球和扑球等物理技能。自博弈能保证环境难度始终适合 AI 提升,结合 Dota 2 自博弈结果,OpenAI 认为自博弈将成为未来强大 AI 系统的核心组成部分。
OpenAI 展示在模拟机器人摔跤任务中,meta-learning 智能体能快速学会击败更强的非 meta-learning 智能体,并能在物理故障发生时进行适应调整。
OpenAI 发布 LOLA(Learning with Opponent-Learning Awareness)算法,该算法会考虑其他智能体也在学习这一事实。在迭代囚徒困境中,LOLA 能自主发现“以牙还牙”这类利己 yet 协作的策略,是迈向能建模“他者心智”的智能体的一小步。
OpenAI 发现,在强化学习算法的参数上加入自适应参数噪声,通常能提升探索效果和性能。该方法实现简单,且极少导致性能下降,适合在任何问题上尝试。
OpenAI 制造出在多尺度、多视角下仍能稳定欺骗神经网络分类器的对抗图像。这一结果回应了此前关于自动驾驶汽车因采集多尺度、多角度图像而难以被恶意欺骗的说法。
OpenAI 与 DeepMind 安全团队合作开发了一种算法,无需人类编写目标函数,通过让人类判断两个候选行为哪个更好来推断人类意图。背景是复杂目标用简单代理函数表达偏差可能引发危险行为,该方法旨在减少这一安全风险。
推荐理由:OpenAI 与 DeepMind 安全团队合作的算法通过人类两两偏好比较来推断目标,省去手写目标函数,是安全对齐方向的早期基础工作。
OpenAI 认为多智能体竞争环境是通往 AGI 的垫脚石。这类环境具备两大优势:环境难度天然随对手水平形成课程,若对手是自我克隆则完全匹配自身水平;同时不存在稳定均衡,智能体始终面临变聪明的压力。这与传统环境体验迥异,仍需更多研究。
OpenAI 发现进化策略(ES)这一已有数十年历史的优化技术在 Atari、MuJoCo 等现代 RL 基准上可媲美标准强化学习,同时克服了 RL 的诸多不便。
推荐理由:原文指出进化策略在 Atari 和 MuJoCo 基准上可与标准 RL 相当,并避开 RL 的诸多不便。
OpenAI 发布新研究,让 AI 智能体发展出自己的语言进行通信。这项研究展示了智能体在训练过程中自主形成交流方式的能力。
OpenAI 发布论文《Emergence of grounded compositional language in multi-agent populations》,研究多智能体群体中有根基的组合式语言如何涌现。正文抓取失败,仅标题可用,具体方法与结果以原文为准。
OpenAI 与 Berkeley、Stanford 研究者共同署名,参与 Google Brain 研究人员主导的论文《Concrete Problems in AI Safety》。论文探讨了确保现代机器学习系统按预期运行的多个研究问题。