OpenAI News·· 2018-07-04AI 评分53
OpenAI 用单条人类演示让智能体在 Montezuma's Revenge 上拿到 74,500 分
Learning Montezuma’s Revenge from a single demonstration
AI 导读
OpenAI 训练的智能体仅凭一条人类演示,在 Montezuma's Revenge 上取得 74,500 的高分,超过此前已发表结果。方法是从演示中精心挑选的起始状态开始游玩,并用 PPO 优化游戏得分,与 OpenAI Five 所用的强化学习算法相同。
来源:OpenAI News · openai.com