跳到正文
原文
Hugging Face Blog·· 2022-08-05AI 评分54

Hugging Face 深度强化学习课程第 8 单元讲解 PPO 原理与实现

Proximal Policy Optimization (PPO)

AI 导读

Hugging Face 深度强化学习课程第 8 单元讲解 Proximal Policy Optimization(PPO),核心是通过比率裁剪将策略更新限制在 [1−ϵ,1+ϵ] 区间以提升训练稳定性。

来源:Hugging Face Blog · huggingface.co