跳到正文
原文
Hugging Face Blog·· 2025-08-07AI 评分52

TRL 新增 VLM 对齐支持:MPO、GRPO、GSPO 等方法与原生 SFT

Vision Language Model Alignment in TRL ⚡️

AI 导读

Hugging Face TRL 宣布为视觉语言模型(VLM)对齐新增 Mixed Preference Optimization(MPO)、多模态 GRPO、GSPO 支持,并扩展 RLOO 和 Online DPO。

来源:Hugging Face Blog · huggingface.co