跳到正文
原文
Hugging Face Blog·· 2022-06-30AI 评分46

用 PyTorch 实现 Policy Gradient(Hugging Face 深度强化学习课程 Unit 5)

Policy Gradient with PyTorch

AI 导读

Hugging Face 深度强化学习课程第 5 单元讲解首个策略梯度方法 Reinforce(Monte Carlo Policy Gradient),并用 PyTorch 从零实现。

来源:Hugging Face Blog · huggingface.co