KV Cache 管理策略对比:vLLM 的 PagedAttention 与 SGLang 的 RadixAttention
在线大模型服务中,KV Cache 的显存分配与复用直接决定吞吐与延迟。本文对比 vLLM 的 PagedAttention 与 SGLang 的 RadixAttention,解释块式分页、前缀树复用、驱逐策略与调度差异,并给出不同工作负载下的选型建议。
共 1 篇文章
在线大模型服务中,KV Cache 的显存分配与复用直接决定吞吐与延迟。本文对比 vLLM 的 PagedAttention 与 SGLang 的 RadixAttention,解释块式分页、前缀树复用、驱逐策略与调度差异,并给出不同工作负载下的选型建议。