跳到正文
原文
Hugging Face Blog·· 2023-03-09精选AI 评分70

Hugging Face 发布 trl 与 peft 集成,在 24GB 消费级 GPU 上用 RLHF 微调 20B 模型

Fine-tuning 20B LLMs with RLHF on a 24GB consumer GPU

AI 导读

Hugging Face 官方发布 trl 与 peft 的集成,让用户能以更低成本用强化学习微调大语言模型。通过 8-bit 加载(LLM.int8)、低秩适配器以及用 disable_adapters 复用同一模型获取参考与主动 logits,作者在 24GB NVIDIA 4090 上验证了微调 20B gpt-neox 生成正面影评的完整流程,并指出训练速度和多卡扩展是下一步方向。

推荐理由

原文给出 trl 与 peft 集成的完整微调流程和显存拆解,读者可以照此在单张 24GB GPU 上复现大模型 RLHF 训练。

来源:Hugging Face Blog · huggingface.co