第 5 章 · 分布式训练与 Kubeflow Pipelines 当模型从 1B 长到 100B、从单卡训得动到千卡才训得动,分布式训练就从「优化选项」变成了「必需品」。本章讲清三大并行范式、K8s 训练 Operator 与 Kubeflow Pipelines,把大模型训练变成可版本、可重跑、可编排的工程产物。 章节摘要 第 4 章建立了 MLOps 的全景与组件认知,本章聚焦其中最关键、最复杂的环节——训练。大模型训练从单机走向分布式后,工程复杂度呈数量级上升:要选并行策略(数据并行、张量并行、流水线并行)、要理解通信原语(AllReduce/AllGather)、要做显存优化(ZeRO/DeepSpeed)、要在 K8s 上编排多 Pod 协作、要把它变成可重跑的流水线。
当模型从 1B 长到 100B、从单卡训得动到千卡才训得动,分布式训练就从「优化选项」变成了「必需品」。本章讲清三大并行范式、K8s 训练 Operator 与 Kubeflow Pipelines,把大模型训练变成可版本、可重跑、可编排的工程产物。
第 4 章建立了 MLOps 的全景与组件认知,本章聚焦其中最关键、最复杂的环节——训练。大模型训练从单机走向分布式后,工程复杂度呈数量级上升:要选并行策略(数据并行、张量并行、流水线并行)、要理解通信原语(AllReduce/AllGather)、要做显存优化(ZeRO/DeepSpeed)、要在 K8s 上编排多 Pod 协作、要把它变成可重跑的流水线。
本章首先讲清分布式训练的三大并行范式与通信原语,深入 ZeRO-1/2/3 三阶段显存切分原理。然后讲 K8s 上的训练 Operator 与 Ray Train 的选型——前者是 K8s 原生 CRD 范式,后者是基于 Actor 模型的灵活框架。接着讲 Kubeflow Pipelines 的 DAG 编排:如何把数据→训练→评估→注册组织成可版本、可缓存、可重跑的流水线。最后讲训练的 CI/CD 集成(GitOps for ML、数据版本化、模型晋升门禁),把训练变成持续交付的工程产物。
读完本章,你将掌握把大模型训练从「单机实验」带到「分布式工程化生产」的全部架构认知。
读完本章,你应当能够:
| 编号 | 子章节 | 核心问题 | 关联后续 |
|---|---|---|---|
| 01 | 分布式训练范式:数据并行、张量并行与流水线并行 | 三大并行怎么工作?为什么要 3D 并行? | 第 6 章推理的张量并行 |
| 02 | K8s 训练 Operator 与 Ray Train | 训练在 K8s 上怎么编排?两套方案怎么选? | 第 8 章混部 |
| 03 | Kubeflow Pipelines 的 DAG 编排 | 训练流水线怎么组织成 DAG?怎么缓存重跑? | 第 4 章实验跟踪 |
| 04 | 模型训练的 CI/CD 集成 | 训练怎么自动化?怎么晋升门禁? | 第 4 章模型注册 |
四个子章节构成「算法 → 平台 → 流水线 → 自动化」的递进:先讲分布式训练的算法原理(01),再讲 K8s 上的训练平台(02),然后讲流水线编排(03),最后讲 CI/CD 自动化(04)。读完这四节,你将拥有从算法到工程到自动化的完整训练体系认知。
分布式训练、数据并行、张量并行、流水线并行、3D 并行、AllReduce、AllGather、ReduceScatter、Ring AllReduce、ZeRO、ZeRO-1、ZeRO-2、ZeRO-3、DeepSpeed、Megatron-LM、Training Operator、PyTorchJob、Ray Train、Kubeflow Pipelines、DAG 编排、GitOps for ML、DVC、LakeFS、模型 CI/CD。