跳到正文
原文
Hugging Face Blog·· 2024-01-18AI 评分52

Hugging Face 实测 DPO、IPO、KTO 三种无强化学习偏好对齐方法

Preference Tuning LLMs with Direct Preference Optimization Methods

AI 导读

Hugging Face 团队在 OpenHermes-2.5-Mistral-7B 和 Zephyr-7b-beta-sft 两个模型上,用 MT-Bench 实测了 DPO、IPO、KTO 三种无需强化学习的偏好对齐方法。

来源:Hugging Face Blog · huggingface.co