KV Cache 量化为何在长上下文下推高困惑度:INT8 的误差累积与缓解路径
长文本生成服务中,KV Cache 量化能显著降低显存占用,但 INT8 等低精度方案在长上下文下常导致困惑度上升。本文从键值缓存的数据分布出发,解释误差如何随序列长度累积,对比逐 token、逐通道与 SmoothQuant 等方案的精度-显存权衡,并给出 GQA/MHA 下的适用边界与可观测指标。
共 1 篇文章
长文本生成服务中,KV Cache 量化能显著降低显存占用,但 INT8 等低精度方案在长上下文下常导致困惑度上升。本文从键值缓存的数据分布出发,解释误差如何随序列长度累积,对比逐 token、逐通道与 SmoothQuant 等方案的精度-显存权衡,并给出 GQA/MHA 下的适用边界与可观测指标。