Hugging Face Blog·· 2023-08-08精选AI 评分67
Hugging Face 教程:用 DPO 微调 Llama v2
Fine-tune Llama 2 with DPO
AI 导读
Hugging Face 官方博客介绍 TRL 库新支持的 DPO 方法,无需奖励模型和 RL 步骤即可直接在偏好数据上优化语言模型。
推荐理由
原文提供了从 SFT 到 DPO 微调 Llama v2 的完整代码与训练脚本,读者可复用到自己的数据集上。
来源:Hugging Face Blog · huggingface.co