跳到正文
原文
Hugging Face Blog·· 2022-07-22AI 评分26

Hugging Face 深度强化学习课程第 7 单元:Advantage Actor Critic (A2C)

Advantage Actor Critic (A2C)

AI 导读

Hugging Face 深度强化学习课程第 7 单元讲解 Advantage Actor Critic (A2C)。文章指出 Reinforce 因使用 Monte-Carlo 采样估计回报导致策略梯度方差高、训练慢,而 Actor-Critic 架构结合 Actor(策略)与 Critic(价值函数)可降低方差。

来源:Hugging Face Blog · huggingface.co