AI 推理系列(九):Chunked Prefill 如何避免长 Prompt 阻塞在线大模型服务
解释长 Prompt Prefill 如何阻塞在线 Decode,以及 Chunked Prefill 如何通过分块和混合调度改善流式延迟,并分析 Chunk Size、Token Budget、TTFT、TPOT、Goodput 与 Prefill-Decode 分离之间的工程取舍。
共 1 篇文章
解释长 Prompt Prefill 如何阻塞在线 Decode,以及 Chunked Prefill 如何通过分块和混合调度改善流式延迟,并分析 Chunk Size、Token Budget、TTFT、TPOT、Goodput 与 Prefill-Decode 分离之间的工程取舍。