第 5 章 · 分布式训练与 Kubeflow Pipelines


文档摘要

第 5 章 · 分布式训练与 Kubeflow Pipelines 当模型从 1B 长到 100B、从单卡训得动到千卡才训得动,分布式训练就从「优化选项」变成了「必需品」。本章讲清三大并行范式、K8s 训练 Operator 与 Kubeflow Pipelines,把大模型训练变成可版本、可重跑、可编排的工程产物。 章节摘要 第 4 章建立了 MLOps 的全景与组件认知,本章聚焦其中最关键、最复杂的环节——训练。大模型训练从单机走向分布式后,工程复杂度呈数量级上升:要选并行策略(数据并行、张量并行、流水线并行)、要理解通信原语(AllReduce/AllGather)、要做显存优化(ZeRO/DeepSpeed)、要在 K8s 上编排多 Pod 协作、要把它变成可重跑的流水线。

第 5 章 · 分布式训练与 Kubeflow Pipelines

当模型从 1B 长到 100B、从单卡训得动到千卡才训得动,分布式训练就从「优化选项」变成了「必需品」。本章讲清三大并行范式、K8s 训练 Operator 与 Kubeflow Pipelines,把大模型训练变成可版本、可重跑、可编排的工程产物。

章节摘要

第 4 章建立了 MLOps 的全景与组件认知,本章聚焦其中最关键、最复杂的环节——训练。大模型训练从单机走向分布式后,工程复杂度呈数量级上升:要选并行策略(数据并行、张量并行、流水线并行)、要理解通信原语(AllReduce/AllGather)、要做显存优化(ZeRO/DeepSpeed)、要在 K8s 上编排多 Pod 协作、要把它变成可重跑的流水线。

本章首先讲清分布式训练的三大并行范式与通信原语,深入 ZeRO-1/2/3 三阶段显存切分原理。然后讲 K8s 上的训练 Operator 与 Ray Train 的选型——前者是 K8s 原生 CRD 范式,后者是基于 Actor 模型的灵活框架。接着讲 Kubeflow Pipelines 的 DAG 编排:如何把数据→训练→评估→注册组织成可版本、可缓存、可重跑的流水线。最后讲训练的 CI/CD 集成(GitOps for ML、数据版本化、模型晋升门禁),把训练变成持续交付的工程产物。

读完本章,你将掌握把大模型训练从「单机实验」带到「分布式工程化生产」的全部架构认知。

学习目标

读完本章,你应当能够:

  1. 辨析 数据并行(DP)张量并行(TP)流水线并行(PP) 三大范式的原理与适用场景,理解它们为何常常组合使用(3D 并行)。
  2. 讲清 AllReduce / AllGather / ReduceScatter 等集合通信原语的语义与通信量,理解 ZeRO-1/2/3 三阶段显存切分的权衡。
  3. 选型 K8s 上的训练编排方案——Training Operator(CRD 范式)Ray Train(Actor 范式),讲清二者的哲学差异。
  4. Kubeflow Pipelines 把训练组织成 DAG,理解组件化、缓存、重跑、Artifact 传递等核心机制。
  5. 设计训练的 CI/CD 集成(GitOps for ML、数据版本化、模型晋升门禁),把训练变成持续交付的工程产物。

子章节安排与导引

编号 子章节 核心问题 关联后续
01 分布式训练范式:数据并行、张量并行与流水线并行 三大并行怎么工作?为什么要 3D 并行? 第 6 章推理的张量并行
02 K8s 训练 Operator 与 Ray Train 训练在 K8s 上怎么编排?两套方案怎么选? 第 8 章混部
03 Kubeflow Pipelines 的 DAG 编排 训练流水线怎么组织成 DAG?怎么缓存重跑? 第 4 章实验跟踪
04 模型训练的 CI/CD 集成 训练怎么自动化?怎么晋升门禁? 第 4 章模型注册

四个子章节构成「算法 → 平台 → 流水线 → 自动化」的递进:先讲分布式训练的算法原理(01),再讲 K8s 上的训练平台(02),然后讲流水线编排(03),最后讲 CI/CD 自动化(04)。读完这四节,你将拥有从算法到工程到自动化的完整训练体系认知。

配图说明

  • Mermaid「分布式训练三大并行范式对比」:在第 01 节给出,直观展示 DP/TP/PP 各自如何切分模型与数据。
  • SVG「AllReduce Ring 通信示意」:在第 01 节给出,展示 Ring AllReduce 的环形通信流程与通信量分析。
  • 表格「ZeRO 三阶段显存切分对比」:在第 01 节给出,对比 ZeRO-1/2/3 的切分对象与通信开销。
  • Mermaid「Kubeflow Pipeline DAG 与 CI/CD 触发」:在第 03-04 节给出,展示从代码提交到模型注册的完整自动化链路。

SEO 关键词

分布式训练、数据并行、张量并行、流水线并行、3D 并行、AllReduce、AllGather、ReduceScatter、Ring AllReduce、ZeRO、ZeRO-1、ZeRO-2、ZeRO-3、DeepSpeed、Megatron-LM、Training Operator、PyTorchJob、Ray Train、Kubeflow Pipelines、DAG 编排、GitOps for ML、DVC、LakeFS、模型 CI/CD。

章节关联

  • 前置:第 4 章的 MLOps 全景、特征存储、实验跟踪、模型注册是本章的训练对象与产物归宿。第 2-3 章的 GPU 调度与拓扑感知是本章分布式训练的物理基础(特别是 3.2 节的 NVLink 拓扑对张量并行的决定性影响)。
  • 后续:本章训练出的模型会进入第 6-7 章的推理服务。本章的张量并行概念会在第 6 章推理时复用(推理也需要张量并行来装下大模型)。本章的 Pipeline 编排与第 4 章的模型注册共同构成第 8 章综合案例的端到端平台。

发布者: 作者: 灏天文库 转发
评论区 (0)
U