章节摘要:预训练是大模型获得通用能力的阶段——把互联网规模的文本压缩进参数里。本章按实际工程顺序展开:数据从哪来、怎么洗、怎么配比(5.1);无标注数据上的自监督学习如何自己制造监督信号(5.2);万亿 token 的训练循环怎么在千卡集群上稳定跑完(5.3)。本章结束时你会明白:为什么说"数据质量决定上限",以及为什么 99% 的开发者做的是微调而不是预训练。
阅读完本章,你应当能够:
本章一句话:预训练 = 用自监督目标,在清洗好的海量数据上,跑通一个稳定的分布式训练循环——三个环节任何一环掉链子,模型就废。
数据的来源谱系、多级清洗流水线(精确与模糊去重、质量打分、去毒)、决定能力偏向的配比艺术,以及"质量优先于数量"的证据。
从数据本身制造监督信号的巧思;三种目标各自的机制、所学与代表模型,以及"预测下一个词为何能逼出推理能力"的深层逻辑。
完整训练流程、三种并行的分工与组合、稳定性技巧(warmup、梯度裁剪、混合精度)、成本账与"中途崩了怎么办"。
三节对应预训练工程的三大支柱:5.1 是"料",5.2 是"目标",5.3 是"火候"。料不精则上限低,目标不对则白练,火候不稳则前功尽弃。三者按真实工程的先后顺序排列——先备料、再定目标、最后开炉。
┌──────────────┐ 干净且配比好的语料 ┌──────────────┐ 数据+目标就绪 ┌──────────────┐ │ 5.1 数据工程 │ ─────────────────▶ │ 5.2 自监督目标 │ ─────────────▶ │ 5.3 训练工程 │ │ 洗料与配比 │ │ MLM CLM 对比 │ │ 分布式与稳定性 │ └──────────────┘ └──────────────┘ └──────┬───────┘ ▼ 预训练模型 基座 │ ▼ 第6章 在基座上微调与对齐
预训练是"把钱花在刀刃上"的学问,全章内容可以浓缩为三条贯穿始终的主线,复习时沿主线检索:
主线一:质量压倒数量。 从 5.1 的清洗流水线(漏斗丢九成保纯度)、配比是核心机密,到 5.2 的"出题方式决定学到什么"、5.3 的课程式分阶段——所有环节都在强调同一件事:训练信号的质量密度决定模型上限。这条线在微调场景同样成立(第 6.1 节两千条精洗胜两万条混杂),是本教程最想传递的工程价值观。
主线二:自监督释放了数据红利。 挖空、遮后文、构造正负对——监督信号从数据自身长出来,标注瓶颈消失,人类语言宝库第一次可以被整体利用。理解这一点,就理解了"为什么是现在"——不是算法突变,是数据枷锁被打开后的规模兑现。
主线三:预训练是可靠性工程。 千卡故障是常态、发散有四道防线、检查点是生命线——5.3 节的工程细节提醒我们:前沿研究的日常不是灵感,而是与不稳定性的持续搏斗。
三条主线合起来给读者的定位是:你大概率不亲手预训练,但"数据质量思维、自监督思想、训练稳定性直觉"这三件装备,在微调、评估、排错的每一天都会用到。
延伸一步:预训练知识在"不预训练"的工作里如何兑现?三个高频场景——诊断微调问题时,判断瓶颈在数据质量还是超参(5.1 与 5.3 的分工);评估模型时,理解"能力上限由数据决定"从而正确解读基准差异(5.1);做继续预训练决策时,算清领域数据量级与成本的账(5.3 的成本表)。带着这三个问题复习本章,针对性最强。
如果把你带到一家算力无限的机构负责预训练,你首先加大什么?想清楚再回答:多数人直觉是加参数,但读过本章的你应该先问数据——数据配比与质量的天花板决定了参数投入的回报率,无限算力配脏数据等于无限放大噪声。这个思想实验的答案结构(先数据后算力,先质量后数量)是本章全部内容的浓缩,也是这个领域最反直觉、最值钱的一条经验。