OpenAI 开放 Fellows 冬季 2019 与实习生夏季 2019 申请
OpenAI 现已开放 2019 年 Fellows 项目和 2019 年实习生项目的申请,申请者可通过官方渠道提交材料。
OpenAI 现已开放 2019 年 Fellows 项目和 2019 年实习生项目的申请,申请者可通过官方渠道提交材料。
OpenAI 首期 OpenAI Scholars 项目的学员已全部完成该计划,并展示了各自的最终项目成果。
OpenAI Five 在温哥华 The International 2018 上与顶级 Dota 2 选手对战两局均告负,两局中 OpenAI Five 在前 20-35 分钟内保持较大获胜机会。
OpenAI Five 在三局两胜制比赛中击败由 Blitz、Cap、Fogged、Merlini 和 MoonMeander 组成的99.95百分位 Dota 选手队伍,其中四人有过职业 Dota 经历。比赛在有现场观众的直播中进行,直播同时在线人数达 100,000。
推荐理由:官方公布了 OpenAI Five 战胜高分段 Dota 选手的比分和对手阵容,读者可以了解这场人机对决的实际结果与规模。
OpenAI 训练了一个类人机器人手,能以前所未有的灵巧度操纵物理物体。
OpenAI 首届 Scholars 项目已经启动,一批经验丰富的软件开发者正在该项目中成长为机器学习从业者。读者现在可以跟随了解这批学者的学习进展。
OpenAI 宣布 OpenAI Five Benchmark 比赛已经结束。
OpenAI 发布可逆生成模型 Glow,使用可逆 1x1 卷积,扩展并简化了此前可逆生成模型的工作。模型可生成真实的高分辨率图像,支持高效采样,并能发现可用于操纵数据属性的特征;OpenAI 同时开源模型代码并上线在线可视化工具。
OpenAI 训练的智能体仅凭一条人类演示,在 Montezuma's Revenge 上取得 74,500 的高分,超过此前已发表结果。方法是从演示中精心挑选的起始状态开始游玩,并用 PPO 优化游戏得分,与 OpenAI Five 所用的强化学习算法相同。
OpenAI 宣布其由五个神经网络组成的系统 OpenAI Five,已开始在 Dota 2 中击败业余人类队伍。
OpenAI 首届 Retro Contest 已结束,该比赛旨在探索能从以往经验中进行泛化的算法开发。这是该赛事的第一次举办。
OpenAI 宣布以可扩展、任务无关的系统在多项多样化语言任务上取得 SOTA 结果,并开放发布该系统。方法结合 Transformer 与无监督预训练两个已有思路,团队认为结果证明了监督学习搭配无监督预训练的有效性,希望推动在更大更多样数据集上的进一步研究。
推荐理由:原文给出无监督预训练加 Transformer 的方法组合和多任务 SOTA 结果,可帮读者理解预训练思路的实际成效。
OpenAI 现已开放新一期 OpenAI Fellows 项目申请。该项目提供为期 6 个月、带薪的 OpenAI AI 研究学徒机会。
OpenAI 发布完整版 Gym Retro,一个面向游戏强化学习研究的平台。公开游戏数量由此前约 70 款 Atari 游戏和 30 款 Sega 游戏扩展到覆盖多种模拟器的超过 1000 款游戏,并同步开源了用于向平台添加新游戏的工具。
OpenAI 发布分析,指出 2012 年以来最大 AI 训练所用算力呈指数增长,翻倍时间为 3.4 个月,远快于摩尔定律的 2 年翻倍;累计增长超过 300,000 倍,而 2 年翻倍仅带来约 7 倍增长。算力提升是 AI 进展的关键组成部分,若趋势延续,需为远超当前能力的系统做准备。
推荐理由:原文以自家分析给出最大 AI 训练算力的增长数据,读者可据此理解算力在 AI 进展中的作用与后续影响。
OpenAI 提出一项 AI 安全技术,训练多个智能体就某个主题相互辩论,由人类判断哪一方获胜,以此辅助对齐。
OpenAI 发布一种实验性元学习方法 Evolved Policy Gradients(EPG),通过进化学习智能体的损失函数,使其能在全新任务上快速训练。经 EPG 训练的智能体在测试时可完成训练分布之外的基础任务,例如导航到房间中与训练时放置位置不同一侧的物体。
OpenAI 推出迁移学习竞赛 Retro Contest,衡量强化学习算法从以往经验中进行泛化的能力。
OpenAI 于 3 月 3 日举办了首届黑客松,吸引 100 名 AI 社区成员参加。活动为 OpenAI 与人工智能社区成员的首次此类合作交流。
OpenAI 开发了名为 Reptile 的简单元学习算法,其做法是反复采样一个任务,对其执行随机梯度下降,并将初始参数向该任务学到的最终参数方向更新。Reptile 是 Shortest Descent 算法在元学习场景的应用,在数学上类似仅需 SGD 或 Adam 等优化器黑盒访问的一阶 MAML,计算效率与性能相近。
OpenAI 推出 OpenAI Scholars 项目,向来自弱势群体的 6–10 名学员提供资助和导师指导,支持其全职学习深度学习 3 个月,并开源一个项目。
OpenAI 发布 8 个仿真机器人环境和 Hindsight Experience Replay 的 Baselines 实现,均来自过去一年的研究工作。这些环境已用于训练可在实体机器人上运行的模型,同时附上一组机器人研究需求说明。
OpenAI 将于 3 月 3 日(周六)在其旧金山 Mission District 办公室举办黑客松活动,并配有演讲环节。
OpenAI 与 Future of Humanity Institute、Centre for the Study of Existential Risk、Center for a New American Security。
OpenAI 宣布欢迎新的捐赠者加入。文中只表示了对新捐赠支持者的欢迎,未提供捐赠金额、捐赠方名单等具体细节。
OpenAI 设计了一种让 AI 用对人类也有意义的示例互相教学的方法。该方法能自动挑选最具信息量的示例来教授某个概念,例如用最合适的图片解释“狗”的概念。实验显示,这一方法在教 AI 方面同样有效。
OpenAI 构建了一套实体消歧系统,由神经网络判断词语是否属于约 100 个自动发现的“类型”(非互斥类别),从而自动确定词语所指的对象。
OpenAI 发布 Requests for Research 2.0,公开 7 个未解决的研究问题,均来自其研究工作中实际遇到的问题。
OpenAI 发布了针对块稀疏权重网络这一少有人探索的神经网络架构的高度优化 GPU 内核。根据所选稀疏度,这些内核可比 cuBLAS 或 cuSPARSE 快数个数量级。OpenAI 已用它们在文本情感分析和文本、图像生成建模上取得 SOTA 结果。
OpenAI 开发了一种分层强化学习算法,能学习对解决一系列任务有用的高层动作,从而快速完成需要数千 timesteps 的任务。将该算法应用于一组导航问题时,智能体自主发现朝不同方向行走和爬行的高层动作,进而快速掌握新的导航任务。
OpenAI 最新的机器人技术让完全在仿真中训练的机器人控制器能部署到实体机器人上,并在解决简单任务时对环境中未计划的变化做出反应。借助这些技术,OpenAI 构建了闭环系统,而非此前的开环系统。
OpenAI 发现自博弈让模拟 AI 无需专门设计环境就学会擒抱、躲闪、假动作、踢球、接球和扑球等物理技能。自博弈能保证环境难度始终适合 AI 提升,结合 Dota 2 自博弈结果,OpenAI 认为自博弈将成为未来强大 AI 系统的核心组成部分。
OpenAI 展示在模拟机器人摔跤任务中,meta-learning 智能体能快速学会击败更强的非 meta-learning 智能体,并能在物理故障发生时进行适应调整。
OpenAI 发布 LOLA(Learning with Opponent-Learning Awareness)算法,该算法会考虑其他智能体也在学习这一事实。在迭代囚徒困境中,LOLA 能自主发现“以牙还牙”这类利己 yet 协作的策略,是迈向能建模“他者心智”的智能体的一小步。
OpenAI 发布了 OpenAI Baselines 的两个新实现:ACKTR 和 A2C。A2C 是 A3C 的同步、确定性变体,性能与 A3C 相当;ACKTR 比 TRPO 和 A2C 更节省样本,且每次更新所需计算量只略高于 A2C。
OpenAI 表示其 Dota 2 结果表明,在足够算力下自博弈能让机器学习系统从远低于人类水平跃升至超人类。系统在一个月内从勉强匹敌高排名玩家进步到击败顶尖职业选手,且此后仍在提升;与监督深度学习受限于训练数据不同,自博弈系统的数据会随智能体变强而自动改善。
推荐理由:官方复盘解释了 Dota 2 自博弈为何能在一个月内从低于人类跃升到超越顶尖选手,比较了监督学习与自博弈的数据获取差异。
OpenAI 宣布其 Dota 2 bot 在标准赛事规则的 1v1 对局中击败世界顶尖职业选手。该 bot 从零开始通过自对弈学习,不使用模仿学习或树搜索。作者称这是向在涉及真实人类的混乱复杂环境中完成明确目标的 AI 系统迈出的一步。
推荐理由:原文点明该 bot 完全靠自对弈从零学习、不用模仿学习和树搜索,可帮助读者理解其在复杂环境 AI 中的定位。
OpenAI 开源了 RL-Teacher,这是一个通过偶尔的人类反馈而非手工设计奖励函数来训练 AI 的接口实现。该底层技术是迈向安全 AI 系统的一步,也适用于奖励难以指定的强化学习问题。
OpenAI 发现,在强化学习算法的参数上加入自适应参数噪声,通常能提升探索效果和性能。该方法实现简单,且极少导致性能下降,适合在任何问题上尝试。
OpenAI 发布一类新的强化学习算法 Proximal Policy Optimization(PPO),性能与当时最先进方法相当或更好,同时实现和调参更简单。凭借易用性和良好表现,PPO 已成为 OpenAI 的默认强化学习算法。
推荐理由:原文点出了 PPO 性能与实现简洁度的平衡,读者可以了解它为何成为 OpenAI 的默认强化学习算法。