OpenAI 观察到多智能体捉迷藏中自发涌现工具使用
OpenAI 报告,智能体在其新构建的模拟捉迷藏环境中训练时逐步发现了更复杂的工具使用。智能体建立了六种不同的策略与反制策略,其中一些是团队此前不知道环境所支持的;这种自监督的涌现复杂性表明多智能体协同适应或能产生极为复杂和智能的行为。
推荐理由:原文报告了多智能体博弈中自发涌现工具使用的观察,对理解智能体协同演化行为的读者有背景价值。
OpenAI 报告,智能体在其新构建的模拟捉迷藏环境中训练时逐步发现了更复杂的工具使用。智能体建立了六种不同的策略与反制策略,其中一些是团队此前不知道环境所支持的;这种自监督的涌现复杂性表明多智能体协同适应或能产生极为复杂和智能的行为。
推荐理由:原文报告了多智能体博弈中自发涌现工具使用的观察,对理解智能体协同演化行为的读者有背景价值。
OpenAI 开发了一种评估神经网络分类器能否可靠抵御训练时未见的对抗攻击的方法,并提出新指标 UAR(Unforeseen Attack Robustness)。该指标用于衡量单个模型面对未预期攻击的鲁棒性,并强调需要在更多样化的未知攻击上测量模型性能。
OpenAI 开发出 Sparse Transformer,一种在文本、图像和声音等序列预测任务上创造新纪录的深度神经网络。它通过对注意力机制的算法改进,可从比以往长 30 倍的序列中提取模式。
OpenAI 在能量模型(EBM)的稳定、可扩展训练上取得进展,样本质量与泛化能力优于现有模型。EBM 生成时通过持续细化答案投入更多算力,在低温下可生成与 GAN 相当的样本,同时具备似然类模型的 mode 覆盖保证。
OpenAI 与 Google 研究者合作创建了 Activation Atlases,一种可视化神经元之间交互所能表示内容的新技术。随着 AI 系统被部署到越来越敏感的场景,更好地理解其内部决策过程有助于发现弱点并调查故障。
OpenAI 发表论文指出,长期 AI 安全研究需要社会科学家参与,才能确保对齐算法在真实人类参与时发挥作用。让先进 AI 系统与人类价值观对齐,需解决人类理性、情感与偏见心理学中的诸多不确定性。OpenAI 希望推动机器学习与社会科学研究者合作,并计划全职招聘社会科学家。
OpenAI 发现梯度噪声规模(gradient noise scale)这一统计指标可预测神经网络训练在多种任务上的可并行性。复杂任务梯度更嘈杂,未来更大的 batch size 可能变得有用,从而移除 AI 系统继续扩大的一个潜在限制;研究还表明神经网络训练可以被严格化和系统化。
OpenAI 发布 CoinRun 训练环境,为智能体将经验迁移到新情境的能力提供量化指标,并已帮助厘清强化学习中一个长期存在的难题。CoinRun 的复杂度介于传统平台游戏(如 Sonic the Hedgehog)与更低难度环境之间,同时对最先进算法仍构成有价值的泛化挑战。
OpenAI 开发出一种能量模型,只需五个演示即可快速学会识别和生成 near、above、between、closest、furthest 等以二维点集表达的概念。该模型还展现出跨域迁移能力:在二维粒子环境中学到的概念可被用于求解三维物理仿真机器人上的任务。
OpenAI 提出 Random Network Distillation(RND),一种通过好奇心鼓励强化学习智能体探索环境的基于预测的奖励方法。该方法在 Montezuma's Revenge 上首次超过人类平均水平。
OpenAI Five 在温哥华 The International 2018 上与顶级 Dota 2 选手对战两局均告负,两局中 OpenAI Five 在前 20-35 分钟内保持较大获胜机会。
OpenAI 训练了一个类人机器人手,能以前所未有的灵巧度操纵物理物体。
OpenAI 训练的智能体仅凭一条人类演示,在 Montezuma's Revenge 上取得 74,500 的高分,超过此前已发表结果。方法是从演示中精心挑选的起始状态开始游玩,并用 PPO 优化游戏得分,与 OpenAI Five 所用的强化学习算法相同。
OpenAI 发布一种实验性元学习方法 Evolved Policy Gradients(EPG),通过进化学习智能体的损失函数,使其能在全新任务上快速训练。经 EPG 训练的智能体在测试时可完成训练分布之外的基础任务,例如导航到房间中与训练时放置位置不同一侧的物体。
OpenAI 开发了名为 Reptile 的简单元学习算法,其做法是反复采样一个任务,对其执行随机梯度下降,并将初始参数向该任务学到的最终参数方向更新。Reptile 是 Shortest Descent 算法在元学习场景的应用,在数学上类似仅需 SGD 或 Adam 等优化器黑盒访问的一阶 MAML,计算效率与性能相近。
OpenAI 与 Future of Humanity Institute、Centre for the Study of Existential Risk、Center for a New American Security。
OpenAI 设计了一种让 AI 用对人类也有意义的示例互相教学的方法。该方法能自动挑选最具信息量的示例来教授某个概念,例如用最合适的图片解释“狗”的概念。实验显示,这一方法在教 AI 方面同样有效。
OpenAI 构建了一套实体消歧系统,由神经网络判断词语是否属于约 100 个自动发现的“类型”(非互斥类别),从而自动确定词语所指的对象。
OpenAI 发布 Requests for Research 2.0,公开 7 个未解决的研究问题,均来自其研究工作中实际遇到的问题。
OpenAI 开发了一种分层强化学习算法,能学习对解决一系列任务有用的高层动作,从而快速完成需要数千 timesteps 的任务。将该算法应用于一组导航问题时,智能体自主发现朝不同方向行走和爬行的高层动作,进而快速掌握新的导航任务。
OpenAI 最新的机器人技术让完全在仿真中训练的机器人控制器能部署到实体机器人上,并在解决简单任务时对环境中未计划的变化做出反应。借助这些技术,OpenAI 构建了闭环系统,而非此前的开环系统。
OpenAI 发现自博弈让模拟 AI 无需专门设计环境就学会擒抱、躲闪、假动作、踢球、接球和扑球等物理技能。自博弈能保证环境难度始终适合 AI 提升,结合 Dota 2 自博弈结果,OpenAI 认为自博弈将成为未来强大 AI 系统的核心组成部分。
OpenAI 展示在模拟机器人摔跤任务中,meta-learning 智能体能快速学会击败更强的非 meta-learning 智能体,并能在物理故障发生时进行适应调整。
OpenAI 发布 LOLA(Learning with Opponent-Learning Awareness)算法,该算法会考虑其他智能体也在学习这一事实。在迭代囚徒困境中,LOLA 能自主发现“以牙还牙”这类利己 yet 协作的策略,是迈向能建模“他者心智”的智能体的一小步。
OpenAI 宣布其 Dota 2 bot 在标准赛事规则的 1v1 对局中击败世界顶尖职业选手。该 bot 从零开始通过自对弈学习,不使用模仿学习或树搜索。作者称这是向在涉及真实人类的混乱复杂环境中完成明确目标的 AI 系统迈出的一步。
推荐理由:原文点明该 bot 完全靠自对弈从零学习、不用模仿学习和树搜索,可帮助读者理解其在复杂环境 AI 中的定位。
OpenAI 发现,在强化学习算法的参数上加入自适应参数噪声,通常能提升探索效果和性能。该方法实现简单,且极少导致性能下降,适合在任何问题上尝试。
OpenAI 制造出在多尺度、多视角下仍能稳定欺骗神经网络分类器的对抗图像。这一结果回应了此前关于自动驾驶汽车因采集多尺度、多角度图像而难以被恶意欺骗的说法。
OpenAI 与 DeepMind 安全团队合作开发了一种算法,无需人类编写目标函数,通过让人类判断两个候选行为哪个更好来推断人类意图。背景是复杂目标用简单代理函数表达偏差可能引发危险行为,该方法旨在减少这一安全风险。
推荐理由:OpenAI 与 DeepMind 安全团队合作的算法通过人类两两偏好比较来推断目标,省去手写目标函数,是安全对齐方向的早期基础工作。
OpenAI 认为多智能体竞争环境是通往 AGI 的垫脚石。这类环境具备两大优势:环境难度天然随对手水平形成课程,若对手是自我克隆则完全匹配自身水平;同时不存在稳定均衡,智能体始终面临变聪明的压力。这与传统环境体验迥异,仍需更多研究。
OpenAI 开发了一个无监督系统,仅在 Amazon 评论文本上训练预测下一个字符,却学到了优秀的情感表示。方法无需情感标注数据。
推荐理由:原文说明模型仅靠预测 Amazon 评论下一字符就学到优秀情感表示,展示了无监督表征的潜力。
OpenAI 发现进化策略(ES)这一已有数十年历史的优化技术在 Atari、MuJoCo 等现代 RL 基准上可媲美标准强化学习,同时克服了 RL 的诸多不便。
推荐理由:原文指出进化策略在 Atari 和 MuJoCo 基准上可与标准 RL 相当,并避开 RL 的诸多不便。
OpenAI 发布新研究,让 AI 智能体发展出自己的语言进行通信。这项研究展示了智能体在训练过程中自主形成交流方式的能力。
OpenAI 发布论文《Emergence of grounded compositional language in multi-agent populations》,研究多智能体群体中有根基的组合式语言如何涌现。正文抓取失败,仅标题可用,具体方法与结果以原文为准。
OpenAI 与 Berkeley、Stanford 研究者共同署名,参与 Google Brain 研究人员主导的论文《Concrete Problems in AI Safety》。论文探讨了确保现代机器学习系统按预期运行的多个研究问题。