Activation Beacon:用压缩激活值实现无限上下文流式推理
面对超长文档问答场景,本文解析 Activation Beacon 如何通过压缩历史 token 的激活值而非 KV Cache 实现无限上下文流式推理,对比 StreamingLLM 的注意力沉没方案,分析压缩率、信息保留与推理速度的权衡,并给出工程实现要点与失效边界。
共 2 篇文章
面对超长文档问答场景,本文解析 Activation Beacon 如何通过压缩历史 token 的激活值而非 KV Cache 实现无限上下文流式推理,对比 StreamingLLM 的注意力沉没方案,分析压缩率、信息保留与推理速度的权衡,并给出工程实现要点与失效边界。
围绕长期 Agent 与流式推理中 KV Cache 持续增长的问题,解释 Attention Sink 为何使纯滑动窗口在删除初始 Token 后出现质量退化,以及 StreamingLLM 如何保留少量 Sink Token 与最近窗口,在固定缓存预算下持续处理数据流,并分析它与真正长上下文和长期记忆的边界。