AI 推理系列(十六):PagedAttention——为什么 vLLM 能把 GPU 显存“像操作系统一样”管理?
围绕在线大模型服务中动态增长的 KV Cache,解释 PagedAttention 如何通过逻辑块、物理块和块表实现按需分配,并分析内部碎片、Copy-on-Write、Prefix Caching、Continuous Batching 及长上下文场景中的工程边界。
共 1 篇文章
围绕在线大模型服务中动态增长的 KV Cache,解释 PagedAttention 如何通过逻辑块、物理块和块表实现按需分配,并分析内部碎片、Copy-on-Write、Prefix Caching、Continuous Batching 及长上下文场景中的工程边界。