OpenAI Five 在 The International 2018 惜败职业选手
OpenAI Five 在温哥华 The International 2018 上与顶级 Dota 2 选手对战两局均告负,两局中 OpenAI Five 在前 20-35 分钟内保持较大获胜机会。
OpenAI Five 在温哥华 The International 2018 上与顶级 Dota 2 选手对战两局均告负,两局中 OpenAI Five 在前 20-35 分钟内保持较大获胜机会。
OpenAI 训练了一个类人机器人手,能以前所未有的灵巧度操纵物理物体。
OpenAI 训练的智能体仅凭一条人类演示,在 Montezuma's Revenge 上取得 74,500 的高分,超过此前已发表结果。方法是从演示中精心挑选的起始状态开始游玩,并用 PPO 优化游戏得分,与 OpenAI Five 所用的强化学习算法相同。
OpenAI 发布一种实验性元学习方法 Evolved Policy Gradients(EPG),通过进化学习智能体的损失函数,使其能在全新任务上快速训练。经 EPG 训练的智能体在测试时可完成训练分布之外的基础任务,例如导航到房间中与训练时放置位置不同一侧的物体。
OpenAI 开发了名为 Reptile 的简单元学习算法,其做法是反复采样一个任务,对其执行随机梯度下降,并将初始参数向该任务学到的最终参数方向更新。Reptile 是 Shortest Descent 算法在元学习场景的应用,在数学上类似仅需 SGD 或 Adam 等优化器黑盒访问的一阶 MAML,计算效率与性能相近。
OpenAI 与 Future of Humanity Institute、Centre for the Study of Existential Risk、Center for a New American Security。
OpenAI 设计了一种让 AI 用对人类也有意义的示例互相教学的方法。该方法能自动挑选最具信息量的示例来教授某个概念,例如用最合适的图片解释“狗”的概念。实验显示,这一方法在教 AI 方面同样有效。
OpenAI 构建了一套实体消歧系统,由神经网络判断词语是否属于约 100 个自动发现的“类型”(非互斥类别),从而自动确定词语所指的对象。
OpenAI 发布 Requests for Research 2.0,公开 7 个未解决的研究问题,均来自其研究工作中实际遇到的问题。
OpenAI 开发了一种分层强化学习算法,能学习对解决一系列任务有用的高层动作,从而快速完成需要数千 timesteps 的任务。将该算法应用于一组导航问题时,智能体自主发现朝不同方向行走和爬行的高层动作,进而快速掌握新的导航任务。
OpenAI 最新的机器人技术让完全在仿真中训练的机器人控制器能部署到实体机器人上,并在解决简单任务时对环境中未计划的变化做出反应。借助这些技术,OpenAI 构建了闭环系统,而非此前的开环系统。
OpenAI 发现自博弈让模拟 AI 无需专门设计环境就学会擒抱、躲闪、假动作、踢球、接球和扑球等物理技能。自博弈能保证环境难度始终适合 AI 提升,结合 Dota 2 自博弈结果,OpenAI 认为自博弈将成为未来强大 AI 系统的核心组成部分。
OpenAI 展示在模拟机器人摔跤任务中,meta-learning 智能体能快速学会击败更强的非 meta-learning 智能体,并能在物理故障发生时进行适应调整。
OpenAI 发布 LOLA(Learning with Opponent-Learning Awareness)算法,该算法会考虑其他智能体也在学习这一事实。在迭代囚徒困境中,LOLA 能自主发现“以牙还牙”这类利己 yet 协作的策略,是迈向能建模“他者心智”的智能体的一小步。
OpenAI 宣布其 Dota 2 bot 在标准赛事规则的 1v1 对局中击败世界顶尖职业选手。该 bot 从零开始通过自对弈学习,不使用模仿学习或树搜索。作者称这是向在涉及真实人类的混乱复杂环境中完成明确目标的 AI 系统迈出的一步。
推荐理由:原文点明该 bot 完全靠自对弈从零学习、不用模仿学习和树搜索,可帮助读者理解其在复杂环境 AI 中的定位。
OpenAI 发现,在强化学习算法的参数上加入自适应参数噪声,通常能提升探索效果和性能。该方法实现简单,且极少导致性能下降,适合在任何问题上尝试。
OpenAI 制造出在多尺度、多视角下仍能稳定欺骗神经网络分类器的对抗图像。这一结果回应了此前关于自动驾驶汽车因采集多尺度、多角度图像而难以被恶意欺骗的说法。
OpenAI 与 DeepMind 安全团队合作开发了一种算法,无需人类编写目标函数,通过让人类判断两个候选行为哪个更好来推断人类意图。背景是复杂目标用简单代理函数表达偏差可能引发危险行为,该方法旨在减少这一安全风险。
推荐理由:OpenAI 与 DeepMind 安全团队合作的算法通过人类两两偏好比较来推断目标,省去手写目标函数,是安全对齐方向的早期基础工作。
OpenAI 认为多智能体竞争环境是通往 AGI 的垫脚石。这类环境具备两大优势:环境难度天然随对手水平形成课程,若对手是自我克隆则完全匹配自身水平;同时不存在稳定均衡,智能体始终面临变聪明的压力。这与传统环境体验迥异,仍需更多研究。
OpenAI 开发了一个无监督系统,仅在 Amazon 评论文本上训练预测下一个字符,却学到了优秀的情感表示。方法无需情感标注数据。
推荐理由:原文说明模型仅靠预测 Amazon 评论下一字符就学到优秀情感表示,展示了无监督表征的潜力。
OpenAI 发现进化策略(ES)这一已有数十年历史的优化技术在 Atari、MuJoCo 等现代 RL 基准上可媲美标准强化学习,同时克服了 RL 的诸多不便。
推荐理由:原文指出进化策略在 Atari 和 MuJoCo 基准上可与标准 RL 相当,并避开 RL 的诸多不便。
OpenAI 发布新研究,让 AI 智能体发展出自己的语言进行通信。这项研究展示了智能体在训练过程中自主形成交流方式的能力。
OpenAI 发布论文《Emergence of grounded compositional language in multi-agent populations》,研究多智能体群体中有根基的组合式语言如何涌现。正文抓取失败,仅标题可用,具体方法与结果以原文为准。
OpenAI 与 Berkeley、Stanford 研究者共同署名,参与 Google Brain 研究人员主导的论文《Concrete Problems in AI Safety》。论文探讨了确保现代机器学习系统按预期运行的多个研究问题。