TAG

#长上下文

共 10 篇文章

KV Cache 量化为何在长上下文下推高困惑度:INT8 的误差累积与缓解路径

长文本生成服务中,KV Cache 量化能显著降低显存占用,但 INT8 等低精度方案在长上下文下常导致困惑度上升。本文从键值缓存的数据分布出发,解释误差如何随序列长度累积,对比逐 token、逐通道与 SmoothQuant 等方案的精度-显存权衡,并给出 GQA/MHA 下的适用边界与可观测指标。

上下文位置偏置:为什么大模型对长文档中间信息“视而不见”?

本文以长文档问答为场景,解释大模型对上下文不同位置信息利用率差异的现象,即“Lost in the Middle”问题。分析注意力分布与训练数据截断等成因,对比截断、重排、检索增强等缓解策略,并讨论在RAG流水线中的工程取舍,帮助读者理解并应对长上下文利用的挑战。