OpenAI News·· 2025-12-03AI 评分38
OpenAI 如何用“忏悔”机制让语言模型保持诚实
How confessions can keep language models honest
AI 导读
OpenAI 研究人员正在测试一种名为“忏悔(confessions)”的方法,训练模型主动承认自己的错误或不当行为,以提升 AI 的诚实性、透明度和模型输出的可信度。
来源:OpenAI News · openai.com
How confessions can keep language models honest
OpenAI 研究人员正在测试一种名为“忏悔(confessions)”的方法,训练模型主动承认自己的错误或不当行为,以提升 AI 的诚实性、透明度和模型输出的可信度。
来源:OpenAI News · openai.com