跳到正文
原文
Hugging Face Blog·· 2022-05-20AI 评分48

Q-Learning 入门教程(下篇):Hugging Face 深度强化学习课程 Unit 2 第二部分

An Introduction to Q-Learning Part 2/2

AI 导读

Hugging Face 深度强化学习课程 Unit 2 第二部分讲解 Q-Learning 算法,并指导从零实现第一个 RL 智能体。该 off-policy 的 value-based 方法基于 TD 方式更新 Q-table,使用 Epsilon Greedy 策略平衡探索与利用。

来源:Hugging Face Blog · huggingface.co