第 3 章 · 共享 GPU、拓扑感知与高级调度策略


文档摘要

第 3 章 · 共享 GPU、拓扑感知与高级调度策略 GPU 是 AI 集群里最贵的资产,独占模式下利用率往往只有 20%-40%。本章的目标是把这片浪费的「沉默算力」挖出来——通过共享切分、拓扑亲和、批处理调度、弹性抢占四把刀,把 GPU 利用率推向 80% 以上,让每一张卡都满载工作。 章节摘要 第 2 章建立了 K8s 管理 GPU 的地基,但那张地基是「独占模式」——一张 GPU 一次只服务一个 Pod。本章在这套地基上叠加四类高级调度策略,把 GPU 利用率打满。 第一把刀是 GPU 共享技术:MIG(硬件分区)、MPS(软件共享)、时分多路复用,三者按隔离性、吞吐、故障爆炸半径各有取舍。

第 3 章 · 共享 GPU、拓扑感知与高级调度策略

GPU 是 AI 集群里最贵的资产,独占模式下利用率往往只有 20%-40%。本章的目标是把这片浪费的「沉默算力」挖出来——通过共享切分、拓扑亲和、批处理调度、弹性抢占四把刀,把 GPU 利用率推向 80% 以上,让每一张卡都满载工作。

章节摘要

第 2 章建立了 K8s 管理 GPU 的地基,但那张地基是「独占模式」——一张 GPU 一次只服务一个 Pod。本章在这套地基上叠加四类高级调度策略,把 GPU 利用率打满。

第一把刀是 GPU 共享技术:MIG(硬件分区)、MPS(软件共享)、时分多路复用,三者按隔离性、吞吐、故障爆炸半径各有取舍。第二把刀是 拓扑感知调度:识别 NVLink、PCIe、InfiniBand 拓扑,让分布式训练的 AllReduce 通信走最快路径。第三把刀是 批处理调度器对比:Volcano、Kueue、YuniKorn 三大主流方案的选型,重点讲 Gang Scheduling 与配额管理。第四把刀是 抢占、重调度与弹性训练:用优先级与抢占腾资源、用 Descheduler 重平衡、用弹性 AllReduce 与断点续训应对中断。

读完本章,你将掌握把 GPU 集群从「独占低效」推向「共享满载」的全部工程手段。

学习目标

读完本章,你应当能够:

  1. 辨析 MIGMPS时分多路复用 三种 GPU 共享技术在隔离性、吞吐、故障爆炸半径上的权衡,并给出适用场景。
  2. 理解 NVLink/PCIe/RDMA 拓扑 对 AllReduce 通信的影响,能解释拓扑感知调度如何为分布式训练打分。
  3. 选型主流批处理调度器(Volcano / Kueue / YuniKorn),讲清 Gang Scheduling 与队列配额的差异。
  4. 设计一套支持 抢占、重调度、断点续训 的弹性训练策略,让训练能容忍 Spot 实例中断与节点故障。

子章节安排与导引

编号 子章节 核心问题 关联后续
01 GPU 共享技术:MIG、MPS 与时空多路复用 一张 GPU 怎么给多个 Pod 用?三种共享怎么选? 第 6 章推理共享
02 拓扑感知调度:NVLink、PCIe 与 RDMA 亲和 分布式训练为什么慢?拓扑怎么影响通信? 第 5 章分布式训练
03 批处理调度器对比:Volcano、Kueue 与 YuniKorn Gang 调度怎么做?三大调度器怎么选? 第 8 章混部
04 抢占、重调度与弹性训练 中断了怎么办?怎么用 Spot?怎么断点续训? 第 8 章弹性

四个子章节构成「共享 → 优化 → 编排 → 容错」的递进:先把单卡利用率打满(01),再让多卡通信跑得快(02),然后用调度器统一管理作业队列(03),最后让训练能容忍各种中断(04)。读完这四节,你将拥有一套完整的「GPU 高效利用」工程方法论。

配图说明

  • SVG「MIG/MPS/时分复用 GPU 切分示意」:在第 01 节给出,直观对比三种共享技术的切片方式。
  • Mermaid「拓扑感知调度打分流程」:在第 02 节给出,展示调度器如何读拓扑、计算分值、选最优节点。
  • 表格「三大批处理调度器对比」:在第 03 节给出,按 Gang、队列、配额、社区活跃度等维度对比。
  • Mermaid「弹性训练中断恢复流程」:在第 04 节给出,展示检查点保存、抢占、重新加入的完整回路。

SEO 关键词

GPU 共享、MIG、MPS、Multi-Instance GPU、时空多路复用、拓扑感知调度、NVLink、RDMA、InfiniBand、Gang Scheduling、Volcano、Kueue、YuniKorn、弹性训练、断点续训、Spot 实例、抢占式调度、Descheduler。

章节关联

  • 前置:第 2 章建立了 GPU 资源建模(Device Plugin、CDI、Extended Resource)与异构资源管理(节点池、标签、污点)的地基。本章的所有高级调度策略都建立在这套地基之上。
  • 后续:本章的拓扑感知为第 5 章「分布式训练」的 AllReduce 通信优化铺路;弹性训练的检查点机制会在第 5 章训练流水线中复用;批处理调度器与混部策略是第 8 章「大流量稳定性与混部」的基础。

发布者: 作者: 灏天文库 转发
评论区 (0)
U