跳到正文
原文
Berkeley AI Research·· 2025-11-01AI 评分47

不基于 TD learning 的强化学习:分治法训练价值函数

RL without TD learning

AI 导读

这篇 Berkeley AI Research 博客介绍一种基于分治而非 TD learning 的 off-policy RL 价值学习范式。

来源:Berkeley AI Research · bair.berkeley.edu