跳到正文
原文
Hugging Face Blog·· 2025-01-28AI 评分57

Hugging Face 启动 Open-R1 项目,系统复现 DeepSeek-R1 训练流程

Open-R1: a fully open reproduction of DeepSeek-R1

AI 导读

Hugging Face 发布博客宣布启动 Open-R1 项目,目标是在开放环境下重建 DeepSeek-R1 的数据与训练流程。博客解释了 DeepSeek-R1 基于DeepSeek-V3 的两阶段训练方法,包括 R1-Zero 用 GRPO 纯强化学习训练和 R1 的冷启动微调加多轮 RL 提炼,并指出 DeepSeek 未公开训练数据、训练代码和超参数细节。

来源:Hugging Face Blog · huggingface.co