跳到正文

#安全/对齐

今日 3 条
5月3日周四
2月20日周二
8月3日周四
6月13日周二
  1. OpenAI News83

    OpenAI 与 DeepMind 合作提出从人类偏好中学习目标的方法

    OpenAI 与 DeepMind 安全团队合作开发了一种算法,无需人类编写目标函数,通过让人类判断两个候选行为哪个更好来推断人类意图。背景是复杂目标用简单代理函数表达偏差可能引发危险行为,该方法旨在减少这一安全风险。

    推荐理由:OpenAI 与 DeepMind 安全团队合作的算法通过人类两两偏好比较来推断目标,省去手写目标函数,是安全对齐方向的早期基础工作。

2月24日周五
12月21日周三
6月21日周二