Activation Beacon:用压缩激活值实现无限上下文流式推理
面对超长文档问答场景,本文解析 Activation Beacon 如何通过压缩历史 token 的激活值而非 KV Cache 实现无限上下文流式推理,对比 StreamingLLM 的注意力沉没方案,分析压缩率、信息保留与推理速度的权衡,并给出工程实现要点与失效边界。
共 1 篇文章
面对超长文档问答场景,本文解析 Activation Beacon 如何通过压缩历史 token 的激活值而非 KV Cache 实现无限上下文流式推理,对比 StreamingLLM 的注意力沉没方案,分析压缩率、信息保留与推理速度的权衡,并给出工程实现要点与失效边界。