跳到正文
原文
Hugging Face Blog·· 2026-06-03AI 评分42

超越聊天机器人的 DPO:用模型自身的失败样本降低 OCR 文本退化

Direct Preference Optimization Beyond Chatbots

AI 导读

Hugging Face 在 DharmaOCR 训练中把 DPO 用于聊天对齐之外的场景:用模型自身失败产生的退化循环构建拒绝对,作为第二训练阶段降低结构化 OCR 的文本退化率。

来源:Hugging Face Blog · huggingface.co