Hugging Face Blog·· 2024-01-18AI 评分52
Hugging Face 实测 DPO、IPO、KTO 三种无强化学习偏好对齐方法
Preference Tuning LLMs with Direct Preference Optimization Methods
AI 导读
Hugging Face 团队在 OpenHermes-2.5-Mistral-7B 和 Zephyr-7b-beta-sft 两个模型上,用 MT-Bench 实测了 DPO、IPO、KTO 三种无需强化学习的偏好对齐方法。
来源:Hugging Face Blog · huggingface.co