跳到正文
原文
Hugging Face Blog·· 2023-08-08精选AI 评分67

Hugging Face 教程:用 DPO 微调 Llama v2

Fine-tune Llama 2 with DPO

AI 导读

Hugging Face 官方博客介绍 TRL 库新支持的 DPO 方法,无需奖励模型和 RL 步骤即可直接在偏好数据上优化语言模型。

推荐理由

原文提供了从 SFT 到 DPO 微调 Llama v2 的完整代码与训练脚本,读者可复用到自己的数据集上。

来源:Hugging Face Blog · huggingface.co