本节摘要:大模型(Large Model)是参数规模巨大、在海量数据上预训练得到的深度神经网络,处理语言的叫大语言模型(LLM)。它的"大"同时体现在参数、数据、算力三个维度,而规模跨过临界点后出现的能力涌现,是它区别于以往一切模型的核心特征。本节从定义讲到演进脉络,帮你建立整个领域的坐标系。
阅读完本节,你应当能够:
先给定义:大模型是参数规模通常达到数十亿甚至数千亿、在海量通用数据上通过自监督方式预训练得到的深度神经网络。其中以文本为输入输出的叫大语言模型(LLM),如 GPT、LLaMA、GLM、Qwen;把语言与图像、音频等多种模态统一起来的叫多模态大模型。日常语境里说"大模型",多数时候指的就是 LLM。
这个定义里最值得推敲的词是"通常"。没有人规定参数过十亿才算大模型——2019 年 BERT-Large 的 3.4 亿参数在当时也被称作大模型。定义的关键不在某个阈值,而在一个现象:当参数、数据、算力的规模同时跨过某个临界点,模型会表现出小模型完全不具备的能力——不做专门训练就能翻译、写代码、做多步推理。这种量变引起质变的特征,才是"大模型"这个名称真正的含义。
换个角度理解:传统机器学习是"一个任务、一批标注数据、一个模型",模型的角色是学生,题库(训练集)决定它能学会什么。而大模型更像把整个互联网的文本当作教材先通读一遍,再针对具体任务做少量点拨。通读的阶段叫预训练,点拨的阶段叫微调或提示。范式从"教一个专项选手"变成了"培养一个通才再岗前培训"。
"大"不是单指参数量。它同时体现在三个维度:
| 维度 | 量级 | 说明 |
|---|---|---|
| 参数规模 | 数十亿 ~ 数千亿 | 模型的"容量",决定能记住和组合多少知识与模式 |
| 训练数据 | TB 级、数万亿 token | 决定模型见过多少种世界的表达方式 |
| 算力 | 千卡 GPU 集群、训练数周至数月 | 把前两者兑现的工程门槛 |
三者缺一不可,而且要相互匹配。参数多但数据少,模型会过拟合,把训练集背下来而不是学会规律;数据够但参数少,模型容量不足,知识装不下;两者都够但算力不足,训练一次要一年,等于做不了。实践中这三个量大致遵循经验规律共同放大——第 4 章讲规模定律(Scaling Laws)时会展开:给定算力预算,参数量与数据量之间存在一个最优配比,盲目堆参数反而是浪费。
还有一个容易被忽略的第四维:人力工程。数据清洗流水线、分布式训练框架、故障恢复、评测体系,这些"看不见的大"往往决定一个团队能不能真正训出可用的模型。

💡 关键认知:大模型的革命性不是"更准",而是"通用"。过去做智能客服要标注几万条对话训练分类器,做摘要要再训一个模型;现在一个模型加上几段提示词全做了。评估大模型的价值,要看它替代了多少个专用系统的搭建成本。
⚠️ 别误解"涌现":涌现不是魔法,它仍来自规模与数据的量变。也有研究者指出部分"涌现"其实是度量方式造成的假象——用不连续的指标(如完全答对才算分)衡量连续提升的能力,会放大台阶感。此外不是所有能力都稳定涌现:精确算术、事实一致性、遵守字数限制这类任务,大模型至今经常翻车。
理解大模型最好的方式不是背年代,而是看每一代技术解决了上一代的什么问题:
这条线上有两个决定性节点。Transformer 解决了"怎么把模型训大"——没有并行注意力,千亿参数根本训不动;对齐解决了"怎么让大模型好用"——没有 RLHF,再大的模型也只是个续写引擎。本教程第 4 章与第 6 章将分别深挖这两个节点。
不一定。模型表现由参数、数据质量、训练充分度、对齐水平共同决定。一个 7B 参数、数据精洗、对齐良好的模型,实际使用体验完全可能超过 30B 参数但数据粗糙的模型。参数量只是容量上限,不是能力本身。
不知道。它做的是基于上下文的概率生成,没有内置的真值校验。这就是为什么第 8 章的评估与第 10 章的安全治理如此重要——可靠性目前要靠外部机制兜底,而不是指望模型自觉。
零样本和少样本靠提示词、不更新参数,便宜但上限受限;微调更新参数,效果好且推理时无需长提示,但需要训练数据与算力,且每个任务要单独维护。工程上常用顺序是:先试零样本,不够加少样本示例,仍不满足且任务高频稳定,才考虑微调(第 6 章展开)。
初学者容易在两个极端之间摇摆:一端是把大模型当全知神明,另一端是抓住一次翻车就全盘否定。用两个迷思收束本节,帮你在两端之间找到校准点。
迷思一:"大模型等于数据库"。 有人以为模型内部有一个可以查询的知识库,问什么查什么。实际情况更像"压扁的记忆":知识以分布式权重的方式融在参数里,回忆是概率性的重建而非精确检索,所以会有版本混淆(把两次发布会的参数记串)、时间错乱(用过时的汇率回答问题)。这就是为什么严肃的知识问答要走检索增强的路子(第 9.2 节展开)——把"回忆"换成"查资料",可靠性立刻上一个台阶。
迷思二:"会推理等于不会算错"。 模型能做多步逻辑推理,却可能在两位数乘法上出错——因为它的"计算"是基于模式补全,不是执行算法。能力呈现明显的锯齿形分布:难的推理能做对,简单的算术反而翻车。工程上的应对是把精确计算交给工具,让模型调用计算器或代码执行环境,自己只负责擅长的语言理解与任务规划。
带着这两个迷思再回看下一节的对比矩阵,你会更理解"混合架构"为什么是常态:大模型的长板与短板都太鲜明,好的系统设计就是扬长避短的组织学。
搜索引擎检索已有内容,返回的是网页链接;大模型生成新内容,返回的是"为你组织过的回答"。这个区别带来两个推论:搜索引擎的事实性由源页面背书,大模型的事实性没有天然背书(幻觉问题的另一面);但搜索引擎不能理解、改写、组合,大模型可以。当代产品的融合形态——检索提供事实、模型负责理解与组织——正是各取所长的结果,第 9 章会反复见到这个组合。
下一节把镜头拉近:大模型今天究竟用在了哪些场景,以及它与传统机器学习模型的边界画在哪里。