TAG

#PD分离

共 1 篇文章

Prefill-Decode 分离:为何将长提示词计算与生成计算拆分到不同实例能提升在线服务吞吐

在线大模型服务中,预填充与解码阶段在资源需求上差异显著,混合部署常导致GPU利用率失衡与延迟不稳定。本文以企业知识库问答为场景,解析PD分离架构如何将两阶段分配到不同实例,消除相互干扰,并讨论KV Cache传输、调度策略、适用边界及与未分离方案的权衡。