跳到正文
原文
Hugging Face Blog·· 2024-07-10精选AI 评分61

Hugging Face 教你用 TRL 的 DPO 微调视觉语言模型并减少幻觉

Preference Optimization for Vision Language Models

AI 导读

TRL 库现已支持对视觉语言模型做 DPO 偏好优化训练,官方博客以 Idefics2-8b 为例给出完整教程。

推荐理由

原文给出从数据格式化、显存估算到 LoRA 量化的完整 DPO 训练流程,读者可直接迁移到自己的 VLM 微调场景。

来源:Hugging Face Blog · huggingface.co