跳到正文
原文
Hugging Face Blog·· 2025-06-12AI 评分46

长提示词如何阻塞其他请求——优化 LLM 性能

How Long Prompts Block Other Requests - Optimizing LLM Performance

AI 导读

TNG 在 24 块 H100 GPU 集群上自托管多个 LLM,日均消耗超 1 亿 token、生成超 1000 万 token。文章分析 vLLM 默认 chunked-prefill 策略下长提示词会阻塞队列:prefill 各请求只能顺序执行,导致后续请求首 token 等待时间变长。

来源:Hugging Face Blog · huggingface.co