跳到正文
原文
OpenAI News·· 2018-10-31AI 评分57

OpenAI 提出 RND:基于预测奖励的强化学习探索方法

Reinforcement learning with prediction-based rewards

AI 导读

OpenAI 提出 Random Network Distillation(RND),一种通过好奇心鼓励强化学习智能体探索环境的基于预测的奖励方法。该方法在 Montezuma's Revenge 上首次超过人类平均水平。

来源:OpenAI News · openai.com