本节摘要:同一个 Transformer,因注意力"能看哪些词"这一个自由度的不同,分出三大家族:双向的编码器(BERT,擅长理解)、单向掩码的解码器(GPT,擅长生成)、两端结合的编解码(T5,擅长转换)。本节讲清三者的结构差异、预训练目标与适用边界,并回答一个行业级问题:为什么 decoder-only 最终统一了大模型江湖。
阅读完本节,你应当能够:
Transformer 的架构差异,浓缩起来就是 3.3 节末尾那个"因果掩码"开关:
一个帮助记忆的具体场景,三种架构对"我喜欢苹果,因为它很甜"的处理方式完全不同:编码器一眼看全句,"它"直接绑定到"苹果"(双向的好处);解码器读到"它"时还看不到后面,只能靠前文猜指代(单向的代价);编解码把整句吃进编码器,再让解码器逐词产出摘要或译文(两段式)。

架构决定了"能看什么",预训练目标决定"拿看到的东西练什么",两者是绑定的:
2018 年前后,业界普遍押注 BERT 式编码器(理解任务多、训练效率高);2020 年之后风向彻底倒向 GPT 式解码器。转折的解释有三层:
第一,训练与使用的同构性。 CLM 训练的每一步就是生成时的每一步——预训练做的正是"无限量的生成练习"。而 BERT 的填空能力无法直接迁移为对话能力,要生成还得改造。规模化的每一分投入,decoder-only 都直接存进"生成能力"这个最终被市场验证的账户。
第二,规模化的涌现表现更好。 实践中发现 decoder-only 随参数与数据扩大的能力曲线更陡,推理、指令遵循等涌现能力在它身上更显著。语言建模这个看似简单的目标,恰好是把语法、事实、推理、常识一次性打包的最通用接口。
第三,工程统一与复用。 一个 decoder-only 模型可以靠提示词同时服务理解与生成任务(理解任务改写成生成即可:情感分类变成"输出正面或负面"),而编解码架构需要为不同任务设计输入输出格式。统一架构让训练管线、推理引擎、优化手段(第 7 章全部内容)都能标准化复用。
⚠️ 两个别绝对化的提醒:其一,"decoder-only 理解不如双向"在实践中已被规模补平——大模型靠长上下文与指令数据,理解类基准全面超过 BERT 时代;其二,编解码并未死透,机器翻译等输入输出异构的任务上它仍有结构优势,且一些新架构(如早期多模态模型的视觉编码器 + 语言解码器)本质是编解码思想的复活。
结合第 1.2 节的选型框架,架构层面的具体建议:
有,但阵地收缩:轻量级理解任务(分类、NER)在资源受限场景仍是性价比之选;更重要的是它的思想活在嵌入模型里——今天 RAG 用的向量编码器,多数是对比学习训练的编码器架构,血统上就是 BERT 后代。
主体一样(decoder-only + CLM + RoPE 等标准件),差异在工程细节:归一化位置、注意力效率变体(分组查询注意力)、FFN 系数、词表与数据。4.3 节的模型地图会给出逐项对照。
翻译的输入与输出长度不同构(中文 20 字对应英文 30 词),decoder-only 必须在单一序列里"读完再写",注意力要在源文与已生成译文间分配;编解码用交叉注意力把源文完整保存在编码器里,解码时随时精确回看,结构上更省力。
三大架构的兴衰史浓缩了大模型领域最值得学习的决策模式,提炼三段启示:
启示一:胜负常在问题定义之外。 编码器路线当年数据效率更高、任务覆盖更广,是更"合理"的选择;但生成式对话被市场验证后,训练与使用同构的解码器路线价值飙升。技术选型的最优解依赖应用形态的判断——赌对应用方向比把当前任务做好一分更值钱。这提醒我们:评估任何架构时,除了看基准分数,更要问"它服务的应用形态会变大还是变小"。
启示二:统一架构的红利随时间复利。 decoder-only 一统后,训练管线、推理引擎、量化方案、微调生态全部围绕它标准化,后来者享受全链条成熟度——即使某个新架构在单点效率上更优,也要先补齐整条生态的差距。这就是为什么第 10.2 节的新架构至今以混合形态存在。生态位的价值,常常超过技术指标的价值。
启示三:败者的思想会被胜者吸收。 编码器没有消失,而是以嵌入模型的形态活在检索管线里;编解码的交叉注意力活在多模态模型中(视觉编码器加语言解码器)。技术演化更像器官移植而非物种替代——学"死掉"的技术并不亏,它的思想大概率还在现役系统里运转。
带着三段启示往回看,本节的架构矩阵就从静态的知识表,变成一张会流动的地图。
有,且性价比不低。其一,企业里大量存量系统仍是 BERT 系小模型在跑(分类、抽取),维护与优化它们需要懂其原理;其二,现代嵌入模型(RAG 的地基)血统上就是编码器加对比学习,第 5、9 章都会用到;其三,理解"填空式预训练与生成式预训练的差异"是理解当代模型能力边界的重要参照。把它当"历史包袱"跳过的读者,往往在第 9 章搭检索系统时回来补课。
看三处即可:一查任务形态——只能续写与对话的是解码器系,能填空与做嵌入的是编码器系;二查自述文档的架构关键词——"decoder-only""auto-regressive"标明身份,"cross-attention"暗示编解码或多模态结构;三查预训练目标描述——"next token prediction"对应 CLM,"masked"对应 MLM。三步之内,任何新模型都能放进本章的坐标系——分类是理解的第一步,尽管它远非终点。
给一个高级答题动作:主动谈反例与边界——比如"decoder-only 统一主流,但我在做检索嵌入时仍会选编码器系的专用模型;做翻译选型时会评估编解码方案"。能说出"主流之外的例外与原因",等于向面试官证明你的知识是"用过筛过的",而不是"背过一遍的"。这一小步,是候选人之间的分水岭。
架构讨论的高频术语对齐:encoder-only 也叫双向编码器或 BERT 系;decoder-only 也叫因果解码器或自回归模型(GPT 系);encoder-decoder 也叫序列到序列(Seq2Seq)模型;因果掩码也叫下三角掩码或单向注意力。交叉注意力是编解码架构特有的组件(解码器回看编码器输出的通道)。这份对齐能消除读不同资料时的名词障碍。
最后补一个观察练习:打开你常用的两个 AI 产品,判断它们的底层大概率属于哪族架构、用了哪些本节的架构特征(流式逐字输出指向自回归解码器、图片理解暗示额外的编码器)。把架构知识对到活的产品上,是检验本章内化程度最直接的方式——你会发现"看得见的交互细节"与"看不见的架构选择"之间存在清晰的因果线。
再补一个易考细节:三大架构的"参数效率"差异。同等参数量下,编解码架构的参数要分摊在两套组件上,单一任务可用容量反而更少;decoder-only 的全部参数都服务于同一条生成路径,规模利用率最高——这是"编解码并不因两头而更强"的量化解释之一,也是 4.2 节选型建议背后的又一个论据。
家族地图画完,下一节拉远镜头:是什么规律决定了各家敢砸几十亿训练费——规模定律与主流模型一览。