OpenAI News·· 2020-09-04AI 评分43
OpenAI 用人类反馈的强化学习训练更擅长摘要的语言模型
Learning to summarize with human feedback
AI 导读
OpenAI 应用人类反馈的强化学习(RLHF)训练出在摘要任务上表现更好的语言模型。
来源:OpenAI News · openai.com
Learning to summarize with human feedback
OpenAI 应用人类反馈的强化学习(RLHF)训练出在摘要任务上表现更好的语言模型。
来源:OpenAI News · openai.com