跳到正文

#OpenAI

今日 9 条
10月9日周二
9月10日周一
8月23日周四
8月6日周一
  1. OpenAI News66

    OpenAI Five Benchmark 击败99.95百分位Dota选手队伍

    OpenAI Five 在三局两胜制比赛中击败由 Blitz、Cap、Fogged、Merlini 和 MoonMeander 组成的99.95百分位 Dota 选手队伍,其中四人有过职业 Dota 经历。比赛在有现场观众的直播中进行,直播同时在线人数达 100,000。

    推荐理由:官方公布了 OpenAI Five 战胜高分段 Dota 选手的比分和对手阵容,读者可以了解这场人机对决的实际结果与规模。

7月30日周一
7月25日周三
7月18日周三
7月9日周一
7月4日周三
6月25日周一
6月22日周五
6月11日周一
  1. OpenAI News78

    OpenAI 发布基于 Transformer 与无监督预训练的语言理解系统

    OpenAI 宣布以可扩展、任务无关的系统在多项多样化语言任务上取得 SOTA 结果,并开放发布该系统。方法结合 Transformer 与无监督预训练两个已有思路,团队认为结果证明了监督学习搭配无监督预训练的有效性,希望推动在更大更多样数据集上的进一步研究。

    推荐理由:原文给出无监督预训练加 Transformer 的方法组合和多任务 SOTA 结果,可帮读者理解预训练思路的实际成效。

5月30日周三
5月25日周五
5月16日周三
  1. OpenAI News71

    OpenAI 分析:2012 年以来最大 AI 训练算力以 3.4 个月翻倍

    OpenAI 发布分析,指出 2012 年以来最大 AI 训练所用算力呈指数增长,翻倍时间为 3.4 个月,远快于摩尔定律的 2 年翻倍;累计增长超过 300,000 倍,而 2 年翻倍仅带来约 7 倍增长。算力提升是 AI 进展的关键组成部分,若趋势延续,需为远超当前能力的系统做准备。

    推荐理由:原文以自家分析给出最大 AI 训练算力的增长数据,读者可据此理解算力在 AI 进展中的作用与后续影响。

5月3日周四
4月18日周三
4月5日周四
3月15日周四
3月7日周三
  1. OpenAI News42

    OpenAI 发布可扩展元学习算法 Reptile

    OpenAI 开发了名为 Reptile 的简单元学习算法,其做法是反复采样一个任务,对其执行随机梯度下降,并将初始参数向该任务学到的最终参数方向更新。Reptile 是 Shortest Descent 算法在元学习场景的应用,在数学上类似仅需 SGD 或 Adam 等优化器黑盒访问的一阶 MAML,计算效率与性能相近。

3月6日周二
2月26日周一
2月22日周四
2月20日周二
2月15日周四
2月7日周三
1月31日周三
12月6日周三
  1. OpenAI News48

    OpenAI 发布块稀疏 GPU 内核

    OpenAI 发布了针对块稀疏权重网络这一少有人探索的神经网络架构的高度优化 GPU 内核。根据所选稀疏度,这些内核可比 cuBLAS 或 cuSPARSE 快数个数量级。OpenAI 已用它们在文本情感分析和文本、图像生成建模上取得 SOTA 结果。

10月26日周四
10月19日周四
10月11日周三
9月14日周四
8月18日周五
8月16日周三
  1. OpenAI News62

    OpenAI 谈 Dota 2 结果:自博弈如何让系统从远低于人类跃升至超人类

    OpenAI 表示其 Dota 2 结果表明,在足够算力下自博弈能让机器学习系统从远低于人类水平跃升至超人类。系统在一个月内从勉强匹敌高排名玩家进步到击败顶尖职业选手,且此后仍在提升;与监督深度学习受限于训练数据不同,自博弈系统的数据会随智能体变强而自动改善。

    推荐理由:官方复盘解释了 Dota 2 自博弈为何能在一个月内从低于人类跃升到超越顶尖选手,比较了监督学习与自博弈的数据获取差异。

8月11日周五
  1. OpenAI News65

    OpenAI 自对弈 Dota 2 bot 在 1v1 标准赛事规则下击败世界顶尖职业选手

    OpenAI 宣布其 Dota 2 bot 在标准赛事规则的 1v1 对局中击败世界顶尖职业选手。该 bot 从零开始通过自对弈学习,不使用模仿学习或树搜索。作者称这是向在涉及真实人类的混乱复杂环境中完成明确目标的 AI 系统迈出的一步。

    推荐理由:原文点明该 bot 完全靠自对弈从零学习、不用模仿学习和树搜索,可帮助读者理解其在复杂环境 AI 中的定位。

8月3日周四
7月27日周四
7月20日周四
  1. OpenAI News64

    OpenAI 发布强化学习算法 Proximal Policy Optimization(PPO)

    OpenAI 发布一类新的强化学习算法 Proximal Policy Optimization(PPO),性能与当时最先进方法相当或更好,同时实现和调参更简单。凭借易用性和良好表现,PPO 已成为 OpenAI 的默认强化学习算法。

    推荐理由:原文点出了 PPO 性能与实现简洁度的平衡,读者可以了解它为何成为 OpenAI 的默认强化学习算法。