PagedAttention 的块表机制:按块管理 KV Cache 如何减少显存碎片并提升在线服务吞吐
面向 vLLM 在线服务场景,解释 PagedAttention 为何把 KV Cache 切成固定大小的逻辑块、用块表映射到非连续物理块,并按需分配。文章对比连续缓存与块式缓存的显存占用和调度灵活性,分析块大小对碎片率与吞吐的影响,并给出可观测信号、失败模式与适用边界。
共 1 篇文章
面向 vLLM 在线服务场景,解释 PagedAttention 为何把 KV Cache 切成固定大小的逻辑块、用块表映射到非连续物理块,并按需分配。文章对比连续缓存与块式缓存的显存占用和调度灵活性,分析块大小对碎片率与吞吐的影响,并给出可观测信号、失败模式与适用边界。