跳到正文
原文
Hugging Face Blog·· 2025-01-31精选AI 评分64

Philipp Schmid 教程:用 GRPO 在 Countdown 游戏上复现 DeepSeek-R1 的 aha moment

Mini-R1: Reproduce Deepseek R1 „aha moment“ a RL tutorial

AI 导读

Hugging Face 博客发布教程,用 GRPO 强化学习在 Countdown 数字游戏上训练 Qwen2.5-3B-Instruct,复现 DeepSeek-R1 论文中的小型 aha moment。

推荐理由

原文提供完整的 GRPO 训练代码、配置和分步训练观察,读者可以照此在开源模型上复现小型推理涌现实验。

来源:Hugging Face Blog · huggingface.co