Hugging Face Blog·· 2026-05-07AI 评分48
vLLM V0 到 V1 迁移:RL 训练中先修正正确性问题
vLLM V0 to V1: Correctness Before Corrections in RL
AI 导读
PipelineRL 在从 vLLM V0(0.8.5)迁移到 V1(0.18.1)时发现 train-inference 不匹配,影响 GSPO 训练的 clip rate、KL、entropy 和 reward。
来源:Hugging Face Blog · huggingface.co