Hugging Face Blog·· 2024-07-10精选AI 评分61
Hugging Face 教你用 TRL 的 DPO 微调视觉语言模型并减少幻觉
Preference Optimization for Vision Language Models
AI 导读
TRL 库现已支持对视觉语言模型做 DPO 偏好优化训练,官方博客以 Idefics2-8b 为例给出完整教程。
推荐理由
原文给出从数据格式化、显存估算到 LoRA 量化的完整 DPO 训练流程,读者可直接迁移到自己的 VLM 微调场景。
来源:Hugging Face Blog · huggingface.co