跳到正文
原文
Hugging Face Blog·· 2025-06-04AI 评分57

Hugging Face 在 nanoVLM 中从零实现 KV Caching

KV Cache from scratch in nanoVLM

AI 导读

Hugging Face 在 nanoVLM 仓库中从零实现 KV Caching,生成速度提升 38%。文章讲解自回归生成中重复计算 K/V 的冗余来源,展示通过逐层缓存字典、start_pos 位置对齐以及将 generate 循环拆分为 prefill 和 decode 两阶段来消除冗余计算,并指出这是速度与显存之间的权衡。

来源:Hugging Face Blog · huggingface.co