第 5 章 · 大模型预训练 章节摘要:预训练是大模型获得通用能力的阶段——把互联网规模的文本压缩进参数里。本章按实际工程顺序展开:数据从哪来、怎么洗、怎么配比(5.1);无标注数据上的自监督学习如何自己制造监督信号(5.2);万亿 token 的训练循环怎么在千卡集群上稳定跑完(5.3)。本章结束时你会明白:为什么说"数据质量决定上限",以及为什么 99% 的开发者做的是微调而不是预训练。 会员。《第5章 · 大模型预训练》收录于灏天文库文集《AI大模型开发与应用实战》,原作者/来源:灏天文库,整理自「灏天文库」,提供技术教程、实践指南与问题解决方案,支持在线阅读、全文检索与知识沉淀,助力开发者系统化学习。本站整理收录,版权归原作者/开源协议所有。