OpenAI 发布可编辑与插入文本的新版 GPT-3 和 Codex
OpenAI 发布新版 GPT-3 和 Codex,新增编辑和插入能力,不再只支持对现有文本做补全。
推荐理由:OpenAI 官方宣布 GPT-3 和 Codex 不再只能补全文本,新增编辑与插入能力,读者可据此了解 API 能力边界的变化。
OpenAI 的全部动态:GPT 系列模型、ChatGPT 与 Sora 产品、公司战略与人事的持续追踪。
OpenAI 发布新版 GPT-3 和 Codex,新增编辑和插入能力,不再只支持对现有文本做补全。
推荐理由:OpenAI 官方宣布 GPT-3 和 Codex 不再只能补全文本,新增编辑与插入能力,读者可据此了解 API 能力边界的变化。
OpenAI 训练出比 GPT-3 更能遵循用户意图、同时更真实且毒性更低的 InstructGPT 模型,采用其对齐研究开发、有人类参与闭环的训练技术。这些模型现已部署为 OpenAI API 的默认语言模型。
推荐理由:OpenAI 官方说明 InstructGPT 的对齐训练思路及其成为 API 默认模型的变化,可帮读者理解当时模型行为取向的调整。
OpenAI 微调 GPT-3 得到 WebGPT,借助文本式网页浏览器更准确地回答开放式问题。该方法旨在提升语言模型回答的事实准确性。
推荐理由:官方说明用文本浏览器微调 GPT-3 回答开放性问题的思路,读者可借此了解检索增强回答的早期做法。
OpenAI 宣布其自然语言转代码系统 Codex 的改进版本,即日起通过 API 以 private beta 形式发布。
推荐理由:原文给出 Codex 新版本的自然语言转代码能力及 API 私测入口,读者可据此判断早期接入方式。
OpenAI 发布开源的类 Python 编程语言 Triton 1.0,供编写神经网络 GPU 代码。没有 CUDA 经验的研究者也能写出高效 GPU 代码,多数情况下效率与专家产出相当。
推荐理由:原文说明无 CUDA 经验的研究者也能用它写出接近专家水平的 GPU 代码,可据此评估对研究工作流的影响。
OpenAI 发现在 CLIP 中存在对同一概念产生响应的神经元,无论该概念以字面、符号或概念形式呈现。这一现象可能解释了 CLIP 在对概念的出人意料的视觉表现形式进行分类时的准确性,也是理解 CLIP 及类似模型所学习的关联与偏差的重要一步。
推荐理由:原文指出了 CLIP 中多模态神经元的存在及其对理解模型学习关联与偏差的意义。
OpenAI 发布神经网络 CLIP,可从自然语言监督中高效学习视觉概念。只需提供待识别视觉类别名称,即可应用于任何视觉分类基准,类似 GPT-2 和 GPT-3 的零样本能力。
推荐理由:OpenAI 官方介绍 CLIP 如何用自然语言监督学习视觉概念,零样本思路可与 GPT 系列对照理解。
OpenAI 训练了名为 DALL·E 的神经网络,可从文本描述生成图像,覆盖自然语言可表达的广泛概念。
推荐理由:原文说明 DALL·E 能根据自然语言文本描述生成图像,是文本生成图像方向的早期代表工作。
OpenAI 宣布将 GPT-3 授权给 Microsoft,供其用于自己的产品和服务。
推荐理由:官方一手宣布 GPT-3 授权给 Microsoft,读者可以据此了解当时大模型商业化的重要合作模式。
OpenAI 宣布发布一个 API,用于访问其开发的新 AI 模型。
推荐理由:这是 OpenAI 通过 API 开放自家新模型访问的官方发布,读者可以据此了解其模型的可用入口方式。
OpenAI 发布分析指出,自 2012 年以来在 ImageNet 分类上达到相同性能所需的训练算力每 16 个月减少一半。相比 2012 年,如今训练到 AlexNet 水平所需算力减少 44 倍,而 Moore's Law 同期只能带来 11 倍的成本改善。作者据此认为,在高投入的 AI 任务上,算法进步带来的收益已超过传统硬件效率提升。
推荐理由:原文量化了算法进步带来的算力节省速度,可与 Moore's Law 对比,帮助理解硬件与算法效率的真实差距。
OpenAI 推出 Jukebox,一个能以原始音频形式生成多种流派和艺术家风格音乐、包括初阶演唱的神经网络。官方同时发布了模型权重和代码,并提供探索生成样本的工具。
推荐理由:原文说明了模型能以原始音频生成多风格歌曲并开源权重与代码,读者可自行探索生成样本。
OpenAI 发表关于神经语言模型缩放定律的研究,原文正文抓取失败,仅标题可用。
OpenAI 发布 GPT-2 分阶段计划的最终模型,即最大版本 1.5B 参数,同时放出代码和模型权重以帮助检测 GPT-2 的输出。OpenAI 表示虽自 8 月以来已有更大模型出现,仍按原计划完成完整的分阶段发布流程,为社区提供负责任发布的测试案例。
推荐理由:原文交代了 GPT-2 1.5B 作为分阶段发布最终版的开放决策与考量,读者可以了解负责任发布实践的完整案例。
OpenAI 训练了一对神经网络,用仿人机器手还原魔方,训练完全在仿真中进行,采用与 OpenAI Five 相同的强化学习代码和新技术 Automatic Domain Randomization(ADR)。系统能应对训练中未见过的情况,例如被长颈鹿玩偶戳动,表明强化学习可解决需要极高灵巧度的现实物理问题。
推荐理由:原文说明神经网络完全在仿真中训练即可操控机械手还原魔方,并给出 ADR 这一可迁移到其他物理任务的方法。
OpenAI 用人类反馈微调了 774M 参数的 GPT-2 语言模型,在多种任务上成功匹配外部人工标注者的偏好。摘要任务用了 6 万条人工标注,简单的续写风格任务只需 5 千条;标注者的偏好并非总与团队一致,例如摘要标注者偏好整句照抄原文,模型随之学会了照抄。OpenAI 表示此举旨在让安全技术更接近“机器与人对话”这一通用任务。
推荐理由:原文给出了用人类偏好微调 GPT-2 的任务效果、标注成本与偏好偏差实例,可了解早期 RLHF 实践细节。
OpenAI 报告,智能体在其新构建的模拟捉迷藏环境中训练时逐步发现了更复杂的工具使用。智能体建立了六种不同的策略与反制策略,其中一些是团队此前不知道环境所支持的;这种自监督的涌现复杂性表明多智能体协同适应或能产生极为复杂和智能的行为。
推荐理由:原文报告了多智能体博弈中自发涌现工具使用的观察,对理解智能体协同演化行为的读者有背景价值。
OpenAI 在 2 月发布 124M、5 月分阶段发布 355M 之后,发布 774M 参数的 GPT-2 语言模型。同时发布一份开源法律协议,便于机构间建立模型共享合作,并发布技术报告,总结与 AI 研究社区协调发布规范的经验。
推荐理由:OpenAI 官方复盘分阶段释放 774M GPT-2 的决策过程,可了解滥用风险评估如何影响模型发布策略。
Microsoft 向 OpenAI 投资 10 亿美元,支持其构建惠益广泛分布的 AGI。双方将在 Microsoft Azure 内共同开发可扩展至 AGI 的软硬件平台和新的 Azure AI 超算技术,Microsoft 将成为 OpenAI 的独家云提供商。
推荐理由:OpenAI 官方宣布与 Microsoft 的投资与合作细节,涵盖资金规模和 Azure 独家云协议,可用于理解双方后续算力布局的起点。
OpenAI Five 在周末决赛中连胜两局击败 Dota 2 世界冠军战队 OG,成为首个战胜电竞世界冠军的 AI。OpenAI Five 和 DeepMind 的 AlphaStar 此前都曾私下战胜过职业选手但输掉过公开职业比赛,这也是 AI 首次在直播中战胜电竞职业选手。
推荐理由:作者本人披露了此前直播对局的失利背景,可帮读者理解这次公开战胜世界冠军与以往私下对局的差别。