第二章 vLLM 核心模块深度解析 如果把第一章比作"认识武器和靶场",那么第二章就是"拆开武器看内部齿轮"。高并发部署能不能顶住流量,本质上不取决于你开了多少张卡,而取决于 vLLM 内部那几个核心模块是否真的被你理解并调对了。很多团队部署 DeepSeek V4 时遇到的"加了卡却没变快""并发一高就 OOM""长请求把短请求拖死",其根因几乎全在这三个模块上。 本章要做三件事:第一,把 vLLM 从收到一个 HTTP 请求到吐出第一个 token 的完整链路讲清楚,让你知道延迟都耗在哪里;第二,把 PagedAttention 这套 KV Cache 分页管理机制讲透,因为它是高并发下显存利用率和并发上限的真正基石;