跳到正文
原文
Hugging Face Blog·· 2025-04-26AI 评分47

Hugging Face 开源 PipelineRL:通过 inflight 权重更新实现高吞吐量 LLM 强化学习训练

PipelineRL

AI 导读

Hugging Face 开源 PipelineRL,这是一种实验性 LLM 强化学习实现,核心创新是在训练过程中进行 inflight 权重更新,在不停止推理的情况下同步最新模型权重,兼顾高推理吞吐与 on-policy 数据。

来源:Hugging Face Blog · huggingface.co