第一章 从零认识 DeepSeek V4 与 vLLM 本章导读:很多团队一上来就照着"vLLM 启动命令"复制粘贴,结果卡在显存、卡在多卡、卡在"为什么同样的命令别人能跑我不能跑"。根因往往是没先搞清楚"我要部署的模型到底长什么样、对硬件有什么硬性要求"。本章不急着跑命令,先把 DeepSeek V4 的模型结构、它的部署约束、以及为什么 vLLM 能接住这些约束讲透——这是后面所有高并发调优的地基。读完本章,你应该能用一句话说清"V4 为什么难部署、vLLM 为什么是合理选择"。 一、本章地图:你会带走什么 这一章是整本教程的"地基层",我刻意把它放在"动手"之前,因为高并发部署的坑,90% 出在"没理解模型结构就盲目调参"。
本章导读:很多团队一上来就照着"vLLM 启动命令"复制粘贴,结果卡在显存、卡在多卡、卡在"为什么同样的命令别人能跑我不能跑"。根因往往是没先搞清楚"我要部署的模型到底长什么样、对硬件有什么硬性要求"。本章不急着跑命令,先把 DeepSeek V4 的模型结构、它的部署约束、以及为什么 vLLM 能接住这些约束讲透——这是后面所有高并发调优的地基。读完本章,你应该能用一句话说清"V4 为什么难部署、vLLM 为什么是合理选择"。
这一章是整本教程的"地基层",我刻意把它放在"动手"之前,因为高并发部署的坑,90% 出在"没理解模型结构就盲目调参"。本章你将领走三样东西:
如果你时间极紧,至少把第三节"部署约束"和第四节"vLLM 心智模型"读完,那是承上启下的关键。
理解一个模型怎么部署,最好的切入点是它的"身体结构"。DeepSeek V4 最关键的身份是MoE(混合专家)模型,并且采用了混合注意力设计。这里不展开公式,只讲对部署有直接影响的两点。
第一,MoE 意味着"总参数"和"每次推理激活的参数"是两回事。模型内部有多个"专家"子网络,每个 token 只被路由到其中少数几个专家。所以你看到模型标称 284B 或更大规模的总参数,并不等于每次前向都要算 284B 的 FLOPs——真正被激活的往往只是其中一小部分(例如十几 B 到几十 B 量级,具体随版本与配置变化,建议以官方公布为准)。这一点直接决定了"我需要多少算力"的答案。
第二,混合注意力意味着不同层、不同位置的 token 采用了不同的注意力机制组合,目的是在长上下文下控制 KV Cache 的膨胀。对部署者来说,这翻译为一句话:上下文越长,KV Cache 占的显存越不可轻视,必须当作一等公民来管理,而不能等到 OOM 了才后悔没规划。
把第二节的结构翻译成部署语言,就是四条硬约束。它们不是建议,是物理限制,后面所有章节都在和它们打交道。
记住这四条的实用价值在于:下次你看到"为什么我 8 卡 A100 还 OOM",先别急着加卡,先问"是权重放不下(约束1)还是 KV Cache 爆了(约束3)"——两者解法完全不同。前者靠量化/张量并行,后者靠 PagedAttention/限制并发,搞反了就是白忙。
带着上面的四条约束去看 vLLM,会发现它的两个核心设计恰好一一对应:
所以一句话心智模型:vLLM 用"显存分页"解决了 V4 长上下文下的 KV Cache 爆炸,用"连续批"解决了 MoE 小激活下的 GPU 利用率问题。至于张量/专家并行(约束4),vLLM 同样支持,在第四章实战展开。下一节(1.1)我们回到模型侧,把 V4 的特性和它对部署的具体含义逐条拆给你看。
整本教程是一条"基础 → 核心 → 实战"的递进链,本章是链头:
如果第一章你只是"看懂了",那还不够;请务必带着"我的硬件满足哪条约束、差在哪条"的问题进入第二章。带着问题读,后面才会越读越顺。
本章没有教你一条命令,但给了你一件比命令更值钱的东西:判断框架。DeepSeek V4 是 MoE + 混合注意力的模型,总参数决定显存下限、激活参数决定算力需求、长上下文让 KV Cache 变成独立预算、多卡并行是前提——这四条约束是后面一切的尺子。而 vLLM 的 PagedAttention 与 Continuous Batching 恰好把其中两条最痛的(KV 碎片、GPU 空转)精准接住。下一章,我们进入 vLLM 内部,看看这些机制到底是怎么实现的。