OpenAI 发布 API 开放新模型访问
OpenAI 宣布发布一个 API,用于访问其开发的新 AI 模型。
推荐理由:这是 OpenAI 通过 API 开放自家新模型访问的官方发布,读者可以据此了解其模型的可用入口方式。
OpenAI 宣布发布一个 API,用于访问其开发的新 AI 模型。
推荐理由:这是 OpenAI 通过 API 开放自家新模型访问的官方发布,读者可以据此了解其模型的可用入口方式。
OpenAI 推出 Microscope,对可解释性研究中常用的 8 个视觉“模型有机体”的每个重要层和神经元进行了可视化。该工具让分析神经网络内部形成的特征更加容易,OpenAI 希望能借此帮助研究社区理解这些复杂系统。
OpenAI 发布 Safety Gym,这是一套环境和工具,用于衡量强化学习智能体在训练过程中遵守安全约束的进展。该套件面向强化学习安全研究,为相关进展提供统一的度量基准。
OpenAI 发布 Neural MMO,一个面向强化学习智能体的大规模多智能体游戏环境。该平台支持大量数量可变的智能体在持久、开放式的任务中运行。研究表明,纳入更多智能体和物种能带来更好的探索、分化生态位形成以及更高的整体能力。
OpenAI 首届 Retro Contest 已结束,该比赛旨在探索能从以往经验中进行泛化的算法开发。这是该赛事的第一次举办。
OpenAI 发布完整版 Gym Retro,一个面向游戏强化学习研究的平台。公开游戏数量由此前约 70 款 Atari 游戏和 30 款 Sega 游戏扩展到覆盖多种模拟器的超过 1000 款游戏,并同步开源了用于向平台添加新游戏的工具。
OpenAI 推出迁移学习竞赛 Retro Contest,衡量强化学习算法从以往经验中进行泛化的能力。
OpenAI 发布 8 个仿真机器人环境和 Hindsight Experience Replay 的 Baselines 实现,均来自过去一年的研究工作。这些环境已用于训练可在实体机器人上运行的模型,同时附上一组机器人研究需求说明。
OpenAI 开源了 RL-Teacher,这是一个通过偶尔的人类反馈而非手工设计奖励函数来训练 AI 的接口实现。该底层技术是迈向安全 AI 系统的一步,也适用于奖励难以指定的强化学习问题。
OpenAI 发布一类新的强化学习算法 Proximal Policy Optimization(PPO),性能与当时最先进方法相当或更好,同时实现和调参更简单。凭借易用性和良好表现,PPO 已成为 OpenAI 的默认强化学习算法。
推荐理由:原文点出了 PPO 性能与实现简洁度的平衡,读者可以了解它为何成为 OpenAI 的默认强化学习算法。
OpenAI 开源一个用于机器人仿真的高性能 Python 库,基于 MuJoCo 引擎构建。该库来自 OpenAI 过去一年在机器人研究中的积累。
OpenAI 打造了全球首个完全在仿真环境中训练、并部署到实体机器人上的垃圾检测 AI。该系统实现了从模拟训练到物理世界的落地应用。
OpenAI 发布 Universe,一个用于测量和训练 AI 通用智能的软件平台。它覆盖全球的各类游戏、网站和其他应用程序,作为 AI 智能体的训练与评估环境。
OpenAI 发布 OpenAI Gym 公开测试版,这是一个用于开发和比较强化学习(RL)算法的工具包。它包含不断扩充的环境套件(从仿真机器人到 Atari 游戏),并提供用于比较和复现结果的网站。
推荐理由:官方发布强化学习工具包 Gym 公测版,含环境套件与结果比较复现平台,适合关注 RL 工作流的读者了解其定位。