3.4 显存预算实战:从公式到调参 3.2 节我把显存预算的方法论讲了一遍,3.3 节给了启动参数的取值经验。但真到生产现场,你会发现自己反复在算同一笔账:换了一批硬件(A100 换成 H100)、换了一个量化版本(BF16 换成 FP8)、业务平均序列长度变了(从 2k 涨到 4k),都得重新算一遍「这张卡到底能扛多少并发」。如果每次都临时推导,既慢又容易算错。 这一节我把显存预算从「方法论」落地成「可重复使用的算账流程」:先把公式彻底拆开(每个因子为什么在那里、什么场景会变),再用三个真实硬件场景把公式跑一遍,最后讲那些公式算不准的「暗坑」——激活峰值、MoE 专家路由、PagedAttention 碎片。