Hugging Face Blog·· 2022-07-22AI 评分26
Hugging Face 深度强化学习课程第 7 单元:Advantage Actor Critic (A2C)
Advantage Actor Critic (A2C)
AI 导读
Hugging Face 深度强化学习课程第 7 单元讲解 Advantage Actor Critic (A2C)。文章指出 Reinforce 因使用 Monte-Carlo 采样估计回报导致策略梯度方差高、训练慢,而 Actor-Critic 架构结合 Actor(策略)与 Critic(价值函数)可降低方差。
来源:Hugging Face Blog · huggingface.co