分布式深度学习 分布式训练把计算分散到多个 GPU 和多台机器上,用来训练那些对单设备而言太大或太慢的模型。本文件涵盖混合精度、数据并行、模型并行、流水线并行、ZeRO、FSDP、张量并行,以及 all-reduce 等通信原语——这些是大规模训练 LLM 的必备技术。 在单个 GPU 上训练一个大神经网络,终究会撞到墙:模型可能放不进内存,或者训练要花几个月。分布式训练把工作分散到多个设备(GPU、TPU 或整台机器)上,以更快地训练、训练更大的模型。本文件介绍让这一切成为可能的技术。 要理解为什么分布式重要,先从训练的计算代价说起。