第 3 章 · 共享 GPU、拓扑感知与高级调度策略 GPU 是 AI 集群里最贵的资产,独占模式下利用率往往只有 20%-40%。本章的目标是把这片浪费的「沉默算力」挖出来——通过共享切分、拓扑亲和、批处理调度、弹性抢占四把刀,把 GPU 利用率推向 80% 以上,让每一张卡都满载工作。 章节摘要 第 2 章建立了 K8s 管理 GPU 的地基,但那张地基是「独占模式」——一张 GPU 一次只服务一个 Pod。本章在这套地基上叠加四类高级调度策略,把 GPU 利用率打满。 第一把刀是 GPU 共享技术:MIG(硬件分区)、MPS(软件共享)、时分多路复用,三者按隔离性、吞吐、故障爆炸半径各有取舍。
GPU 是 AI 集群里最贵的资产,独占模式下利用率往往只有 20%-40%。本章的目标是把这片浪费的「沉默算力」挖出来——通过共享切分、拓扑亲和、批处理调度、弹性抢占四把刀,把 GPU 利用率推向 80% 以上,让每一张卡都满载工作。
第 2 章建立了 K8s 管理 GPU 的地基,但那张地基是「独占模式」——一张 GPU 一次只服务一个 Pod。本章在这套地基上叠加四类高级调度策略,把 GPU 利用率打满。
第一把刀是 GPU 共享技术:MIG(硬件分区)、MPS(软件共享)、时分多路复用,三者按隔离性、吞吐、故障爆炸半径各有取舍。第二把刀是 拓扑感知调度:识别 NVLink、PCIe、InfiniBand 拓扑,让分布式训练的 AllReduce 通信走最快路径。第三把刀是 批处理调度器对比:Volcano、Kueue、YuniKorn 三大主流方案的选型,重点讲 Gang Scheduling 与配额管理。第四把刀是 抢占、重调度与弹性训练:用优先级与抢占腾资源、用 Descheduler 重平衡、用弹性 AllReduce 与断点续训应对中断。
读完本章,你将掌握把 GPU 集群从「独占低效」推向「共享满载」的全部工程手段。
读完本章,你应当能够:
| 编号 | 子章节 | 核心问题 | 关联后续 |
|---|---|---|---|
| 01 | GPU 共享技术:MIG、MPS 与时空多路复用 | 一张 GPU 怎么给多个 Pod 用?三种共享怎么选? | 第 6 章推理共享 |
| 02 | 拓扑感知调度:NVLink、PCIe 与 RDMA 亲和 | 分布式训练为什么慢?拓扑怎么影响通信? | 第 5 章分布式训练 |
| 03 | 批处理调度器对比:Volcano、Kueue 与 YuniKorn | Gang 调度怎么做?三大调度器怎么选? | 第 8 章混部 |
| 04 | 抢占、重调度与弹性训练 | 中断了怎么办?怎么用 Spot?怎么断点续训? | 第 8 章弹性 |
四个子章节构成「共享 → 优化 → 编排 → 容错」的递进:先把单卡利用率打满(01),再让多卡通信跑得快(02),然后用调度器统一管理作业队列(03),最后让训练能容忍各种中断(04)。读完这四节,你将拥有一套完整的「GPU 高效利用」工程方法论。
GPU 共享、MIG、MPS、Multi-Instance GPU、时空多路复用、拓扑感知调度、NVLink、RDMA、InfiniBand、Gang Scheduling、Volcano、Kueue、YuniKorn、弹性训练、断点续训、Spot 实例、抢占式调度、Descheduler。