OpenAI 成立 capped-profit 公司 OpenAI LP
OpenAI 宣布成立新的 capped-profit 公司 OpenAI LP,用于快速增加在算力和人才方面的投入,同时保留制衡机制以实现其使命。
推荐理由:官方宣布成立 capped-profit 公司,读者可以借此理解 OpenAI 后续加大算力和人才投入的商业结构基础。
OpenAI 的全部动态:GPT 系列模型、ChatGPT 与 Sora 产品、公司战略与人事的持续追踪。
OpenAI 宣布成立新的 capped-profit 公司 OpenAI LP,用于快速增加在算力和人才方面的投入,同时保留制衡机制以实现其使命。
推荐理由:官方宣布成立 capped-profit 公司,读者可以借此理解 OpenAI 后续加大算力和人才投入的商业结构基础。
OpenAI 训练了一个大规模无监督语言模型,能生成连贯段落文本,在多项语言建模基准上达到当时最优表现。该模型无需任务特定训练即可完成基础阅读理解、机器翻译、问答和摘要任务。
推荐理由:OpenAI 自述该无监督语言模型在多项基准上达到 SOTA 并零样本完成多任务,可作为了解无任务特定训练能力的背景材料。
OpenAI Five 在三局两胜制比赛中击败由 Blitz、Cap、Fogged、Merlini 和 MoonMeander 组成的99.95百分位 Dota 选手队伍,其中四人有过职业 Dota 经历。比赛在有现场观众的直播中进行,直播同时在线人数达 100,000。
推荐理由:官方公布了 OpenAI Five 战胜高分段 Dota 选手的比分和对手阵容,读者可以了解这场人机对决的实际结果与规模。
OpenAI 宣布 OpenAI Five Benchmark 比赛已经结束。
OpenAI 宣布以可扩展、任务无关的系统在多项多样化语言任务上取得 SOTA 结果,并开放发布该系统。方法结合 Transformer 与无监督预训练两个已有思路,团队认为结果证明了监督学习搭配无监督预训练的有效性,希望推动在更大更多样数据集上的进一步研究。
推荐理由:原文给出无监督预训练加 Transformer 的方法组合和多任务 SOTA 结果,可帮读者理解预训练思路的实际成效。
OpenAI 发布分析,指出 2012 年以来最大 AI 训练所用算力呈指数增长,翻倍时间为 3.4 个月,远快于摩尔定律的 2 年翻倍;累计增长超过 300,000 倍,而 2 年翻倍仅带来约 7 倍增长。算力提升是 AI 进展的关键组成部分,若趋势延续,需为远超当前能力的系统做准备。
推荐理由:原文以自家分析给出最大 AI 训练算力的增长数据,读者可据此理解算力在 AI 进展中的作用与后续影响。
OpenAI 表示其 Dota 2 结果表明,在足够算力下自博弈能让机器学习系统从远低于人类水平跃升至超人类。系统在一个月内从勉强匹敌高排名玩家进步到击败顶尖职业选手,且此后仍在提升;与监督深度学习受限于训练数据不同,自博弈系统的数据会随智能体变强而自动改善。
推荐理由:官方复盘解释了 Dota 2 自博弈为何能在一个月内从低于人类跃升到超越顶尖选手,比较了监督学习与自博弈的数据获取差异。
OpenAI 宣布其 Dota 2 bot 在标准赛事规则的 1v1 对局中击败世界顶尖职业选手。该 bot 从零开始通过自对弈学习,不使用模仿学习或树搜索。作者称这是向在涉及真实人类的混乱复杂环境中完成明确目标的 AI 系统迈出的一步。
推荐理由:原文点明该 bot 完全靠自对弈从零学习、不用模仿学习和树搜索,可帮助读者理解其在复杂环境 AI 中的定位。
OpenAI 发布一类新的强化学习算法 Proximal Policy Optimization(PPO),性能与当时最先进方法相当或更好,同时实现和调参更简单。凭借易用性和良好表现,PPO 已成为 OpenAI 的默认强化学习算法。
推荐理由:原文点出了 PPO 性能与实现简洁度的平衡,读者可以了解它为何成为 OpenAI 的默认强化学习算法。
OpenAI 与 DeepMind 安全团队合作开发了一种算法,无需人类编写目标函数,通过让人类判断两个候选行为哪个更好来推断人类意图。背景是复杂目标用简单代理函数表达偏差可能引发危险行为,该方法旨在减少这一安全风险。
推荐理由:OpenAI 与 DeepMind 安全团队合作的算法通过人类两两偏好比较来推断目标,省去手写目标函数,是安全对齐方向的早期基础工作。
OpenAI 发布一套完全在仿真中训练、部署到实体机器人上的机器人系统。该系统只需观看任务演示一次即可学会新任务。
OpenAI 开发了一个无监督系统,仅在 Amazon 评论文本上训练预测下一个字符,却学到了优秀的情感表示。方法无需情感标注数据。
推荐理由:原文说明模型仅靠预测 Amazon 评论下一字符就学到优秀情感表示,展示了无监督表征的潜力。
OpenAI 发现进化策略(ES)这一已有数十年历史的优化技术在 Atari、MuJoCo 等现代 RL 基准上可媲美标准强化学习,同时克服了 RL 的诸多不便。
推荐理由:原文指出进化策略在 Atari 和 MuJoCo 基准上可与标准 RL 相当,并避开 RL 的诸多不便。
OpenAI 发布 OpenAI Gym 公开测试版,这是一个用于开发和比较强化学习(RL)算法的工具包。它包含不断扩充的环境套件(从仿真机器人到 Atari 游戏),并提供用于比较和复现结果的网站。
推荐理由:官方发布强化学习工具包 Gym 公测版,含环境套件与结果比较复现平台,适合关注 RL 工作流的读者了解其定位。
OpenAI 宣布成立,是一家非营利人工智能研究公司。其目标是以前瞻造福全人类的方式推进数字智能,不受产生财务回报的需求约束,从而更专注于对人类的正面影响。
推荐理由:原文是 OpenAI 成立的官方说明,明确了非营利定位和不以财务回报为约束的研究目标。