跳到正文
原文
Hugging Face Blog·· 2026-05-07AI 评分48

vLLM V0 到 V1 迁移:RL 训练中先修正正确性问题

vLLM V0 to V1: Correctness Before Corrections in RL

AI 导读

PipelineRL 在从 vLLM V0(0.8.5)迁移到 V1(0.18.1)时发现 train-inference 不匹配,影响 GSPO 训练的 clip rate、KL、entropy 和 reward。

来源:Hugging Face Blog · huggingface.co