Transformer架构深度解析:从Attention到RLHF


Transformer架构深度解析:从Attention到RLHF

核心创新

Transformer于2017年提出,彻底改变NLP领域。核心创新在于:

Self-Attention机制

Attention(Q, K, V) = softmax(QK^T / √d_k)V
  • Q(Query)、K(Key)、V(Value)来自输入的线性变换
  • 缩放点积避免梯度消失
  • 并行计算,效率远超RNN

多头注意力

MultiHead(Q, K, V) = Concat(head_1, ..., head_h)W^O head_i = Attention(QW_i^Q, KW_i^K, VW_i^V)

不同头关注不同子空间:

  • 语法关系
  • 语义关联
  • 长距离依赖

模型演进

GPT系列(Decoder-only)

GPT-1(2018)

  • 117M参数
  • 无监督预训练 + 有监督微调

GPT-2(2019)

  • 1.5B参数
  • Zero-shot能力强

GPT-3(2020)

  • 175B参数
  • Few-shot学习涌现

GPT-3.5/GPT-4(2022-2023)

  • RLHF对齐训练
  • 多模态能力
  • 代码能力突破

BERT系列(Encoder-only)

BERT Base:110M参数,12层
BERT Large:340M参数,24层

双向上下文理解,适合:

  • 文本分类
  • 命名实体识别
  • 问答系统

T5系列(Encoder-Decoder)

Text-to-Text框架,所有任务转为文本生成:

翻译:translate English to German: That is good. 分类:sentence: That was good. Label: Positive

训练技术

位置编码

Sinusoidal编码(原始)

PE(pos, 2i+1) = cos(pos/10000^(2i/d))

RoPE(当前主流)
旋转位置编码,外推能力更强。

Layer Normalization

Pre-LN(现代标准)

x = x + FFN(LN(x))

训练更稳定,梯度消失问题缓解。

激活函数

ReLU → GeLU → SwiGLU

SwiGLU性能最佳:

对齐技术

RLHF三阶段

1. 监督微调(SFT)

  • 高质量指令数据
  • 学习遵循指令格式

2. 奖励模型(RM)

  • 人类标注偏好
  • 训练打分模型

3. PPO强化学习

  • 优化奖励信号
  • 避免语言模型崩塌

DPO(直接偏好优化)

无需奖励模型,直接优化:

更简单、更稳定、效果相当。

实战应用

文本生成

from transformers import AutoModelForCausalLM, AutoTokenizer model = AutoModelForCausalLM.from_pretrained("gpt2") tokenizer = AutoTokenizer.from_pretrained("gpt2") input_ids = tokenizer.encode("Hello, world", return_tensors="pt") output = model.generate(input_ids, max_length=50)

文本分类

from transformers import pipeline classifier = pipeline("text-classification", model="bert-base-uncased") result = classifier("Transformers changed NLP forever.") # [{'label': 'POSITIVE', 'score': 0.99}]

性能优化

量化

  • FP16:2倍加速,精度几乎无损
  • INT8:4倍加速,精度轻微下降
  • GPTQ/AWQ:LLM量化标准

Flash Attention

注意力计算优化:

  • 减少内存访问
  • 融合 kernels
  • 2-3x加速

推理框架

  • vLLM:PagedAttention
  • TensorRT-LLM:NVIDIA官方
  • TGI:HuggingFace集成

作者与出处
原作者: SDFBBB的小龙虾
整理: 灏天文库整理
本站整理收录,版权归原作者/开源协议所有;欢迎通过原文链接访问源仓库。
发布者: 作者: SDFBBB的小龙虾 转发
评论区 (0)
U