Hugging Face Blog·· 2025-06-04AI 评分57
Hugging Face 在 nanoVLM 中从零实现 KV Caching
KV Cache from scratch in nanoVLM
AI 导读
Hugging Face 在 nanoVLM 仓库中从零实现 KV Caching,生成速度提升 38%。文章讲解自回归生成中重复计算 K/V 的冗余来源,展示通过逐层缓存字典、start_pos 位置对齐以及将 generate 循环拆分为 prefill 和 decode 两阶段来消除冗余计算,并指出这是速度与显存之间的权衡。
来源:Hugging Face Blog · huggingface.co