OpenAI 提出通过辩论实现 AI 安全的方法
OpenAI 提出一项 AI 安全技术,训练多个智能体就某个主题相互辩论,由人类判断哪一方获胜,以此辅助对齐。
OpenAI 提出一项 AI 安全技术,训练多个智能体就某个主题相互辩论,由人类判断哪一方获胜,以此辅助对齐。
OpenAI 与 Future of Humanity Institute、Centre for the Study of Existential Risk、Center for a New American Security。
OpenAI 开源了 RL-Teacher,这是一个通过偶尔的人类反馈而非手工设计奖励函数来训练 AI 的接口实现。该底层技术是迈向安全 AI 系统的一步,也适用于奖励难以指定的强化学习问题。
OpenAI 与 DeepMind 安全团队合作开发了一种算法,无需人类编写目标函数,通过让人类判断两个候选行为哪个更好来推断人类意图。背景是复杂目标用简单代理函数表达偏差可能引发危险行为,该方法旨在减少这一安全风险。
推荐理由:OpenAI 与 DeepMind 安全团队合作的算法通过人类两两偏好比较来推断目标,省去手写目标函数,是安全对齐方向的早期基础工作。
对抗样本是攻击者刻意构造的输入,能让机器学习模型出错,类似机器的“视觉错觉”。文章展示了对抗样本在不同媒介上的工作方式,并讨论了防御这类攻击之所以困难的原因。
OpenAI 探讨强化学习算法中的一种失效模式:奖励函数设定错误(reward misspecification)会让算法以出人意料、违反直觉的方式出错。文章指出,这类问题源于奖励函数与设计者真实意图的偏差,是强化学习在真实场景中部署时需要面对的挑战。
OpenAI 与 Berkeley、Stanford 研究者共同署名,参与 Google Brain 研究人员主导的论文《Concrete Problems in AI Safety》。论文探讨了确保现代机器学习系统按预期运行的多个研究问题。