OpenAI 发布 Safety Gym:衡量强化学习智能体安全约束的工具套件
OpenAI 发布 Safety Gym,这是一套环境和工具,用于衡量强化学习智能体在训练过程中遵守安全约束的进展。该套件面向强化学习安全研究,为相关进展提供统一的度量基准。
OpenAI 发布 Safety Gym,这是一套环境和工具,用于衡量强化学习智能体在训练过程中遵守安全约束的进展。该套件面向强化学习安全研究,为相关进展提供统一的度量基准。
OpenAI 用人类反馈微调了 774M 参数的 GPT-2 语言模型,在多种任务上成功匹配外部人工标注者的偏好。摘要任务用了 6 万条人工标注,简单的续写风格任务只需 5 千条;标注者的偏好并非总与团队一致,例如摘要标注者偏好整句照抄原文,模型随之学会了照抄。OpenAI 表示此举旨在让安全技术更接近“机器与人对话”这一通用任务。
推荐理由:原文给出了用人类偏好微调 GPT-2 的任务效果、标注成本与偏好偏差实例,可了解早期 RLHF 实践细节。
OpenAI 开发了一种评估神经网络分类器能否可靠抵御训练时未见的对抗攻击的方法,并提出新指标 UAR(Unforeseen Attack Robustness)。该指标用于衡量单个模型面对未预期攻击的鲁棒性,并强调需要在更多样化的未知攻击上测量模型性能。
OpenAI 发布政策研究论文,提出四种可立即采用的策略以促进 AI 行业在安全规范上的长期合作:沟通风险与收益、技术协作、提高透明度和激励标准。分析指出,行业安全合作对确保 AI 系统安全有益至关重要,但竞争压力可能导致集体行动问题,使 AI 公司在安全上投入不足。
OpenAI 发表论文指出,长期 AI 安全研究需要社会科学家参与,才能确保对齐算法在真实人类参与时发挥作用。让先进 AI 系统与人类价值观对齐,需解决人类理性、情感与偏见心理学中的诸多不确定性。OpenAI 希望推动机器学习与社会科学研究者合作,并计划全职招聘社会科学家。
OpenAI 提出一项名为 iterated amplification 的 AI 安全技术,通过演示如何把任务分解为更简单的子任务,来指定超越人类规模的复杂行为和目标,而无需提供标注数据或奖励函数。目前该想法仍处早期阶段,实验仅在简单的玩具算法领域完成,但 OpenAI 认为其可能成为可扩展的 AI 安全方法。
OpenAI 提出一项 AI 安全技术,训练多个智能体就某个主题相互辩论,由人类判断哪一方获胜,以此辅助对齐。
OpenAI 与 Future of Humanity Institute、Centre for the Study of Existential Risk、Center for a New American Security。
OpenAI 开源了 RL-Teacher,这是一个通过偶尔的人类反馈而非手工设计奖励函数来训练 AI 的接口实现。该底层技术是迈向安全 AI 系统的一步,也适用于奖励难以指定的强化学习问题。
OpenAI 与 DeepMind 安全团队合作开发了一种算法,无需人类编写目标函数,通过让人类判断两个候选行为哪个更好来推断人类意图。背景是复杂目标用简单代理函数表达偏差可能引发危险行为,该方法旨在减少这一安全风险。
推荐理由:OpenAI 与 DeepMind 安全团队合作的算法通过人类两两偏好比较来推断目标,省去手写目标函数,是安全对齐方向的早期基础工作。
对抗样本是攻击者刻意构造的输入,能让机器学习模型出错,类似机器的“视觉错觉”。文章展示了对抗样本在不同媒介上的工作方式,并讨论了防御这类攻击之所以困难的原因。
OpenAI 探讨强化学习算法中的一种失效模式:奖励函数设定错误(reward misspecification)会让算法以出人意料、违反直觉的方式出错。文章指出,这类问题源于奖励函数与设计者真实意图的偏差,是强化学习在真实场景中部署时需要面对的挑战。
OpenAI 与 Berkeley、Stanford 研究者共同署名,参与 Google Brain 研究人员主导的论文《Concrete Problems in AI Safety》。论文探讨了确保现代机器学习系统按预期运行的多个研究问题。