连续批处理如何提升大模型吞吐:迭代级调度与延迟权衡
在线聊天服务中,静态批处理因输出长度差异导致GPU利用率低下。本文以聊天场景贯穿,解释连续批处理如何通过迭代级调度动态加入和完成请求,分析其对TTFT和TPOT的影响,并讨论最大批大小、队列策略等参数如何权衡吞吐与延迟,以及适用边界。
共 2 篇文章
在线聊天服务中,静态批处理因输出长度差异导致GPU利用率低下。本文以聊天场景贯穿,解释连续批处理如何通过迭代级调度动态加入和完成请求,分析其对TTFT和TPOT的影响,并讨论最大批大小、队列策略等参数如何权衡吞吐与延迟,以及适用边界。
深入剖析 OpenJDK 虚拟线程的调度机制,包括载体线程挂载与卸载、ForkJoinPool 工作窃取,以及同步代码协程化的工程方法,并讨论大规模虚拟线程下的公平性与适用边界。