TAG

#Attention Sink

共 1 篇文章

AI 推理系列(十二):Attention Sink——为什么删除最早几个 Token,会让大模型突然“失忆”?

围绕长期 Agent 与流式推理中 KV Cache 持续增长的问题,解释 Attention Sink 为何使纯滑动窗口在删除初始 Token 后出现质量退化,以及 StreamingLLM 如何保留少量 Sink Token 与最近窗口,在固定缓存预算下持续处理数据流,并分析它与真正长上下文和长期记忆的边界。