跳到正文
原文
OpenAI News·· 2020-09-04AI 评分43

OpenAI 用人类反馈的强化学习训练更擅长摘要的语言模型

Learning to summarize with human feedback

AI 导读

OpenAI 应用人类反馈的强化学习(RLHF)训练出在摘要任务上表现更好的语言模型。

来源:OpenAI News · openai.com