OpenAI News·· 2023-05-31精选AI 评分67
OpenAI 用过程监督提升模型数学推理能力
Improving mathematical reasoning with process supervision
AI 导读
OpenAI 训练模型在数学问题求解上取得新的 SOTA,方法是对每一步正确推理给予奖励(process supervision),而非只奖励最终正确答案(outcome supervision)。除性能优于结果监督外,过程监督还有对齐上的好处,直接训练模型产出人类认可的思维链。
推荐理由
原文说明了过程监督相对结果监督的性能与对齐优势,帮助读者理解链式推理训练的一个方向。
来源:OpenAI News · openai.com