AI 推理系列(八):Prefix Caching 如何减少 Agent 重复 Prefill:从 KV 复用到 RadixAttention
围绕 Agent、RAG 与多轮对话中反复出现的长 System Prompt、工具定义和历史前缀,解释 Prefix Caching 如何复用已计算的 KV Cache,分析 vLLM Block Hash、SGLang RadixAttention、缓存淘汰、多级存储及命中率对 TTFT 与吞吐的影响。
共 1 篇文章
围绕 Agent、RAG 与多轮对话中反复出现的长 System Prompt、工具定义和历史前缀,解释 Prefix Caching 如何复用已计算的 KV Cache,分析 vLLM Block Hash、SGLang RadixAttention、缓存淘汰、多级存储及命中率对 TTFT 与吞吐的影响。