注意力沉没 Token 的数值离群:低比特 KV Cache 量化为何在首 Token 上误差最大
长上下文在线推理中,逐 Token 均匀量化 KV Cache 往往在首 Token 附近误差最大。文章从 Attention Sink 与极端激活离群出发,解释 Key 向量为何在首 Token 出现数值尖峰,比较离群通道保留、分组量化与混合精度三种处理方式,并给出可观测指标与失效边界。
共 2 篇文章
长上下文在线推理中,逐 Token 均匀量化 KV Cache 往往在首 Token 附近误差最大。文章从 Attention Sink 与极端激活离群出发,解释 Key 向量为何在首 Token 出现数值尖峰,比较离群通道保留、分组量化与混合精度三种处理方式,并给出可观测指标与失效边界。
围绕长期 Agent 与流式推理中 KV Cache 持续增长的问题,解释 Attention Sink 为何使纯滑动窗口在删除初始 Token 后出现质量退化,以及 StreamingLLM 如何保留少量 Sink Token 与最近窗口,在固定缓存预算下持续处理数据流,并分析它与真正长上下文和长期记忆的边界。