跳到正文

#论文/研究

今日 1 条
9月17日周二
  1. OpenAI News73

    OpenAI 观察到多智能体捉迷藏中自发涌现工具使用

    OpenAI 报告,智能体在其新构建的模拟捉迷藏环境中训练时逐步发现了更复杂的工具使用。智能体建立了六种不同的策略与反制策略,其中一些是团队此前不知道环境所支持的;这种自监督的涌现复杂性表明多智能体协同适应或能产生极为复杂和智能的行为。

    推荐理由:原文报告了多智能体博弈中自发涌现工具使用的观察,对理解智能体协同演化行为的读者有背景价值。

8月22日周四
4月23日周二
3月21日周四
3月6日周三
2月19日周二
  1. OpenAI News43

    OpenAI:AI 安全研究需要社会科学家参与

    OpenAI 发表论文指出,长期 AI 安全研究需要社会科学家参与,才能确保对齐算法在真实人类参与时发挥作用。让先进 AI 系统与人类价值观对齐,需解决人类理性、情感与偏见心理学中的诸多不确定性。OpenAI 希望推动机器学习与社会科学研究者合作,并计划全职招聘社会科学家。

12月14日周五
12月6日周四
11月7日周三
10月31日周三
8月23日周四
7月30日周一
7月4日周三
4月18日周三
3月7日周三
  1. OpenAI News42

    OpenAI 发布可扩展元学习算法 Reptile

    OpenAI 开发了名为 Reptile 的简单元学习算法,其做法是反复采样一个任务,对其执行随机梯度下降,并将初始参数向该任务学到的最终参数方向更新。Reptile 是 Shortest Descent 算法在元学习场景的应用,在数学上类似仅需 SGD 或 Adam 等优化器黑盒访问的一阶 MAML,计算效率与性能相近。

2月20日周二
2月15日周四
2月7日周三
1月31日周三
10月26日周四
10月19日周四
10月11日周三
9月14日周四
8月11日周五
  1. OpenAI News65

    OpenAI 自对弈 Dota 2 bot 在 1v1 标准赛事规则下击败世界顶尖职业选手

    OpenAI 宣布其 Dota 2 bot 在标准赛事规则的 1v1 对局中击败世界顶尖职业选手。该 bot 从零开始通过自对弈学习,不使用模仿学习或树搜索。作者称这是向在涉及真实人类的混乱复杂环境中完成明确目标的 AI 系统迈出的一步。

    推荐理由:原文点明该 bot 完全靠自对弈从零学习、不用模仿学习和树搜索,可帮助读者理解其在复杂环境 AI 中的定位。

7月27日周四
7月17日周一
6月13日周二
  1. OpenAI News83

    OpenAI 与 DeepMind 合作提出从人类偏好中学习目标的方法

    OpenAI 与 DeepMind 安全团队合作开发了一种算法,无需人类编写目标函数,通过让人类判断两个候选行为哪个更好来推断人类意图。背景是复杂目标用简单代理函数表达偏差可能引发危险行为,该方法旨在减少这一安全风险。

    推荐理由:OpenAI 与 DeepMind 安全团队合作的算法通过人类两两偏好比较来推断目标,省去手写目标函数,是安全对齐方向的早期基础工作。

6月8日周四
4月6日周四
3月24日周五
3月16日周四
3月15日周三
6月21日周二