跳到正文

OpenAI / ChatGPT

OpenAI 的全部动态:GPT 系列模型、ChatGPT 与 Sora 产品、公司战略与人事的持续追踪。

最新精选

第 181–195 条 · 共 195 条
3月11日周一
  1. OpenAI News82

    OpenAI 成立 capped-profit 公司 OpenAI LP

    OpenAI 宣布成立新的 capped-profit 公司 OpenAI LP,用于快速增加在算力和人才方面的投入,同时保留制衡机制以实现其使命。

    推荐理由:官方宣布成立 capped-profit 公司,读者可以借此理解 OpenAI 后续加大算力和人才投入的商业结构基础。

2月14日周四
  1. OpenAI News81

    OpenAI 训练大规模无监督语言模型,无需任务特定训练即可完成多任务

    OpenAI 训练了一个大规模无监督语言模型,能生成连贯段落文本,在多项语言建模基准上达到当时最优表现。该模型无需任务特定训练即可完成基础阅读理解、机器翻译、问答和摘要任务。

    推荐理由:OpenAI 自述该无监督语言模型在多项基准上达到 SOTA 并零样本完成多任务,可作为了解无任务特定训练能力的背景材料。

8月6日周一
  1. OpenAI News66

    OpenAI Five Benchmark 击败99.95百分位Dota选手队伍

    OpenAI Five 在三局两胜制比赛中击败由 Blitz、Cap、Fogged、Merlini 和 MoonMeander 组成的99.95百分位 Dota 选手队伍,其中四人有过职业 Dota 经历。比赛在有现场观众的直播中进行,直播同时在线人数达 100,000。

    推荐理由:官方公布了 OpenAI Five 战胜高分段 Dota 选手的比分和对手阵容,读者可以了解这场人机对决的实际结果与规模。

7月18日周三
6月11日周一
  1. OpenAI News78

    OpenAI 发布基于 Transformer 与无监督预训练的语言理解系统

    OpenAI 宣布以可扩展、任务无关的系统在多项多样化语言任务上取得 SOTA 结果,并开放发布该系统。方法结合 Transformer 与无监督预训练两个已有思路,团队认为结果证明了监督学习搭配无监督预训练的有效性,希望推动在更大更多样数据集上的进一步研究。

    推荐理由:原文给出无监督预训练加 Transformer 的方法组合和多任务 SOTA 结果,可帮读者理解预训练思路的实际成效。

5月16日周三
  1. OpenAI News71

    OpenAI 分析:2012 年以来最大 AI 训练算力以 3.4 个月翻倍

    OpenAI 发布分析,指出 2012 年以来最大 AI 训练所用算力呈指数增长,翻倍时间为 3.4 个月,远快于摩尔定律的 2 年翻倍;累计增长超过 300,000 倍,而 2 年翻倍仅带来约 7 倍增长。算力提升是 AI 进展的关键组成部分,若趋势延续,需为远超当前能力的系统做准备。

    推荐理由:原文以自家分析给出最大 AI 训练算力的增长数据,读者可据此理解算力在 AI 进展中的作用与后续影响。

8月16日周三
  1. OpenAI News62

    OpenAI 谈 Dota 2 结果:自博弈如何让系统从远低于人类跃升至超人类

    OpenAI 表示其 Dota 2 结果表明,在足够算力下自博弈能让机器学习系统从远低于人类水平跃升至超人类。系统在一个月内从勉强匹敌高排名玩家进步到击败顶尖职业选手,且此后仍在提升;与监督深度学习受限于训练数据不同,自博弈系统的数据会随智能体变强而自动改善。

    推荐理由:官方复盘解释了 Dota 2 自博弈为何能在一个月内从低于人类跃升到超越顶尖选手,比较了监督学习与自博弈的数据获取差异。

8月11日周五
  1. OpenAI News65

    OpenAI 自对弈 Dota 2 bot 在 1v1 标准赛事规则下击败世界顶尖职业选手

    OpenAI 宣布其 Dota 2 bot 在标准赛事规则的 1v1 对局中击败世界顶尖职业选手。该 bot 从零开始通过自对弈学习,不使用模仿学习或树搜索。作者称这是向在涉及真实人类的混乱复杂环境中完成明确目标的 AI 系统迈出的一步。

    推荐理由:原文点明该 bot 完全靠自对弈从零学习、不用模仿学习和树搜索,可帮助读者理解其在复杂环境 AI 中的定位。

7月20日周四
  1. OpenAI News64

    OpenAI 发布强化学习算法 Proximal Policy Optimization(PPO)

    OpenAI 发布一类新的强化学习算法 Proximal Policy Optimization(PPO),性能与当时最先进方法相当或更好,同时实现和调参更简单。凭借易用性和良好表现,PPO 已成为 OpenAI 的默认强化学习算法。

    推荐理由:原文点出了 PPO 性能与实现简洁度的平衡,读者可以了解它为何成为 OpenAI 的默认强化学习算法。

6月13日周二
  1. OpenAI News83

    OpenAI 与 DeepMind 合作提出从人类偏好中学习目标的方法

    OpenAI 与 DeepMind 安全团队合作开发了一种算法,无需人类编写目标函数,通过让人类判断两个候选行为哪个更好来推断人类意图。背景是复杂目标用简单代理函数表达偏差可能引发危险行为,该方法旨在减少这一安全风险。

    推荐理由:OpenAI 与 DeepMind 安全团队合作的算法通过人类两两偏好比较来推断目标,省去手写目标函数,是安全对齐方向的早期基础工作。

5月16日周二
4月6日周四
3月24日周五
4月27日周三
  1. OpenAI News64

    OpenAI 发布 OpenAI Gym 公开测试版

    OpenAI 发布 OpenAI Gym 公开测试版,这是一个用于开发和比较强化学习(RL)算法的工具包。它包含不断扩充的环境套件(从仿真机器人到 Atari 游戏),并提供用于比较和复现结果的网站。

    推荐理由:官方发布强化学习工具包 Gym 公测版,含环境套件与结果比较复现平台,适合关注 RL 工作流的读者了解其定位。

12月11日周五
  1. OpenAI News83

    OpenAI 宣布成立,定位非营利人工智能研究公司

    OpenAI 宣布成立,是一家非营利人工智能研究公司。其目标是以前瞻造福全人类的方式推进数字智能,不受产生财务回报的需求约束,从而更专注于对人类的正面影响。

    推荐理由:原文是 OpenAI 成立的官方说明,明确了非营利定位和不以财务回报为约束的研究目标。