第 4 章 · 连续批处理:不让 GPU 空转 章节摘要:显存管好之后,浪费转移到了时间维度:请求什么时候进批、什么时候退出、批满了牺牲谁。本章沿"批的粒度"这条追因线走:静态批为什么让短请求陪跑(4.1),迭代级调度怎么把批的进出从"轮"细化到"步",以及高峰期抢占、交换与重计算这套兜底组合拳(4.2)。读完本章,吞吐曲线上那些"反直觉"的形状都能得到解释。 会员。《第 4 章 连续批处理:不让 GPU 空转》收录于灏天文库文集《vLLM》,原作者/来源:灏天文库,整理自「灏天文库」,提供技术教程、实践指南与问题解决方案,支持在线阅读、全文检索与知识沉淀,助力开发者系统化学习。本站整理收录,版权归原作者/开源协议所有。