OpenAI News·· 2025-06-18精选AI 评分64
OpenAI 研究不对齐泛化的理解与预防
Toward understanding and preventing misalignment generalization
AI 导读
OpenAI 发布研究,探讨在错误回答上训练如何导致语言模型更广泛的不对齐。研究识别出驱动该行为的内部特征,并发现通过极少量微调即可将其逆转。
推荐理由
OpenAI 官方研究探讨错误回答训练如何引发更广泛的模型不对齐,并指出该内部特征可用极少微调逆转,为对齐研究提供了新方向。
来源:OpenAI News · openai.com