跳到正文
原文
OpenAI News·· 2018-04-18AI 评分34

OpenAI 发布 Evolved Policy Gradients:通过进化损失函数实现智能体快速适应新任务

Evolved Policy Gradients

AI 导读

OpenAI 发布一种实验性元学习方法 Evolved Policy Gradients(EPG),通过进化学习智能体的损失函数,使其能在全新任务上快速训练。经 EPG 训练的智能体在测试时可完成训练分布之外的基础任务,例如导航到房间中与训练时放置位置不同一侧的物体。

来源:OpenAI News · openai.com