Hugging Face Blog·· 2025-08-07AI 评分52
TRL 新增 VLM 对齐支持:MPO、GRPO、GSPO 等方法与原生 SFT
Vision Language Model Alignment in TRL ⚡️
AI 导读
Hugging Face TRL 宣布为视觉语言模型(VLM)对齐新增 Mixed Preference Optimization(MPO)、多模态 GRPO、GSPO 支持,并扩展 RLOO 和 Online DPO。
来源:Hugging Face Blog · huggingface.co