第5章 · 大模型预训练


第 5 章 · 大模型预训练

章节摘要:预训练是大模型获得通用能力的阶段——把互联网规模的文本压缩进参数里。本章按实际工程顺序展开:数据从哪来、怎么洗、怎么配比(5.1);无标注数据上的自监督学习如何自己制造监督信号(5.2);万亿 token 的训练循环怎么在千卡集群上稳定跑完(5.3)。本章结束时你会明白:为什么说"数据质量决定上限",以及为什么 99% 的开发者做的是微调而不是预训练。

学习目标

阅读完本章,你应当能够:

  1. 列出预训练数据的主要来源与配比考量的维度
  2. 描述去重、质量过滤、去毒的完整清洗流水线
  3. 解释自监督如何从无标注数据构造监督信号
  4. 对比 MLM、CLM、对比学习三种目标学到的东西
  5. 说出数据并行、张量并行、管道并行各自的分工
  6. 列出大模型训练稳定性的关键技巧

核心概念速览

本章一句话:预训练 = 用自监督目标,在清洗好的海量数据上,跑通一个稳定的分布式训练循环——三个环节任何一环掉链子,模型就废。

子章节导航

5.1 预训练数据集构建与清洗

数据的来源谱系、多级清洗流水线(精确与模糊去重、质量打分、去毒)、决定能力偏向的配比艺术,以及"质量优先于数量"的证据。

5.2 自监督学习:MLM、CLM 与对比学习

从数据本身制造监督信号的巧思;三种目标各自的机制、所学与代表模型,以及"预测下一个词为何能逼出推理能力"的深层逻辑。

5.3 预训练过程与优化技巧

完整训练流程、三种并行的分工与组合、稳定性技巧(warmup、梯度裁剪、混合精度)、成本账与"中途崩了怎么办"。

子章节之间的逻辑关系

三节对应预训练工程的三大支柱:5.1 是"料",5.2 是"目标",5.3 是"火候"。料不精则上限低,目标不对则白练,火候不稳则前功尽弃。三者按真实工程的先后顺序排列——先备料、再定目标、最后开炉。

┌──────────────┐ 干净且配比好的语料 ┌──────────────┐ 数据+目标就绪 ┌──────────────┐ │ 5.1 数据工程 │ ─────────────────▶ │ 5.2 自监督目标 │ ─────────────▶ │ 5.3 训练工程 │ │ 洗料与配比 │ │ MLM CLM 对比 │ │ 分布式与稳定性 │ └──────────────┘ └──────────────┘ └──────┬───────┘ ▼ 预训练模型 基座 │ ▼ 第6章 在基座上微调与对齐 ​

本章的三条主线回顾

预训练是"把钱花在刀刃上"的学问,全章内容可以浓缩为三条贯穿始终的主线,复习时沿主线检索:

主线一:质量压倒数量。 从 5.1 的清洗流水线(漏斗丢九成保纯度)、配比是核心机密,到 5.2 的"出题方式决定学到什么"、5.3 的课程式分阶段——所有环节都在强调同一件事:训练信号的质量密度决定模型上限。这条线在微调场景同样成立(第 6.1 节两千条精洗胜两万条混杂),是本教程最想传递的工程价值观。

主线二:自监督释放了数据红利。 挖空、遮后文、构造正负对——监督信号从数据自身长出来,标注瓶颈消失,人类语言宝库第一次可以被整体利用。理解这一点,就理解了"为什么是现在"——不是算法突变,是数据枷锁被打开后的规模兑现。

主线三:预训练是可靠性工程。 千卡故障是常态、发散有四道防线、检查点是生命线——5.3 节的工程细节提醒我们:前沿研究的日常不是灵感,而是与不稳定性的持续搏斗。

三条主线合起来给读者的定位是:你大概率不亲手预训练,但"数据质量思维、自监督思想、训练稳定性直觉"这三件装备,在微调、评估、排错的每一天都会用到。

延伸一步:预训练知识在"不预训练"的工作里如何兑现?三个高频场景——诊断微调问题时,判断瓶颈在数据质量还是超参(5.1 与 5.3 的分工);评估模型时,理解"能力上限由数据决定"从而正确解读基准差异(5.1);做继续预训练决策时,算清领域数据量级与成本的账(5.3 的成本表)。带着这三个问题复习本章,针对性最强。

章末的一个思想实验

如果把你带到一家算力无限的机构负责预训练,你首先加大什么?想清楚再回答:多数人直觉是加参数,但读过本章的你应该先问数据——数据配比与质量的天花板决定了参数投入的回报率,无限算力配脏数据等于无限放大噪声。这个思想实验的答案结构(先数据后算力,先质量后数量)是本章全部内容的浓缩,也是这个领域最反直觉、最值钱的一条经验。

前置知识与后续延伸

  • 前置:第 4 章的架构与规模定律(配比话题直接引用最优配比结论)、第 2 章的训练循环与优化器。
  • 为后续铺垫:5.1 的数据工程方法在微调数据构建中同构复用(第 6 章);5.2 的 CLM 目标就是第 6 章 SFT 的损失基础;5.3 的混合精度思想在第 7 章量化推理中换个场景重现。
  • 读法提示:多数读者不会亲手预训练,但本章概念在做微调、评估数据、诊断"模型为什么会这样"时天天用到——带着"我的工作哪里会用到"的问题读,效率最高。

作者与出处
原作者: 灏天文库
来源:平台策划编纂
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U