大语言模型Transformer架构
发布日期:2026-08-14
一、Transformer的诞生
2017年,Google团队发表了论文《Attention is All You Need》,提出了Transformer架构。这个架构彻底改变了自然语言处理领域——从RNN/LSTM的序列化处理转向完全基于Attention的并行化处理。GPT、BERT、LLaMA、Claude……今天所有大语言模型都建立在Transformer之上。
Transformer的核心思想:抛弃循环结构,只用注意力机制来捕捉序列中任意两个位置之间的依赖关系。这使得模型可以并行训练,大幅提升了训练效率。
二、整体架构
Transformer由编码器(Encoder)和解码器(Decoder)组成。原始论文的机器翻译模型是Encoder-Decoder结构。后来的演化中:
- Encoder-only(如BERT):擅长理解任务(分类、NER)
- Decoder-only(如GPT系列):擅长生成任务,是当前大模型的主流
- Encoder-Decoder(如T5、BART):适合翻译、摘要等seq2seq任务
三、核心机制详解
1. Token Embedding
输入文本首先被分词器切成Token(如"Hello world"→[Hello, world]),每个Token映射为一个高维向量(如d=12288维)。Embedding矩阵是模型学习到的参数,类似于"词的坐标系"——语义相近的词向量距离近。
2. 位置编码(Positional Encoding)
Self-Attention本身没有位置概念——打乱输入顺序,输出不变。为了让模型理解"猫追狗"和"狗追猫"的区别,需要注入位置信息。
原始Transformer使用正弦/余弦位置编码:
PE(pos, 2i) = sin(pos / 10000^(2i/d))
PE(pos, 2i+1) = cos(pos / 10000^(2i/d))
后来的大模型改用可学习位置编码(Learned PE)或RoPE旋转位置编码(Rotary PE)。RoPE通过旋转矩阵编码相对位置,外推性好,是当前主流(LLaMA、Qwen等使用RoPE)。
3. Self-Attention(自注意力机制)
这是Transformer的灵魂。对于每个Token,Self-Attention计算它与其他所有Token的关联程度,然后加权求和生成新的表示。
具体来说,每个Token生成三个向量:
- Q(Query):"我在找什么信息"
- K(Key):"我能提供什么信息"
- V(Value):"我携带的实际信息"
注意力计算公式:
Attention(Q, K, V) = softmax(QK^T / √d_k) × V
直觉理解:Q×K^T计算当前Token与其他Token的"匹配度",softmax归一化为权重,再乘V得到加权信息。√d_k是缩放因子,防止点积过大导致梯度消失。
4. Multi-Head Attention
单头Attention只能学习一种关联模式。Multi-Head Attention将Q、K、V分成多组(如GPT-3使用96头),每组独立计算Attention,最后拼接:
MultiHead = Concat(head_1, ..., head_h) × W_O
多头的好处是模型可以同时关注不同维度的信息——有的头关注语法关系,有的头关注语义关系,有的头关注长距离依赖。
5. Feed-Forward Network(FFN)
Attention层之后是FFN,由两层全连接和激活函数组成:
FFN(x) = max(0, x × W1 + b1) × W2 + b2
FFN的作用是对每个位置独立地进行非线性变换。注意FFN是position-wise的——每个Token独立过FFN,不与其他Token交互。交互信息由Attention完成,FFN负责"消化"信息。
现代大模型通常用SwiGLU替代原始ReLU激活函数,效果更好但参数量增加约50%。
6.残差连接与LayerNorm
每个子层(Attention和FFN)外都包裹着残差连接+LayerNorm:
output = LayerNorm(x + SubLayer(x))
残差连接让梯度可以直接回传,解决深层网络的梯度消失问题。GPT-3有96层,没有残差连接根本无法训练。LayerNorm对每个样本的特征维度归一化,稳定训练。
现代大模型普遍采用Pre-LN(先LayerNorm再进子层),比原始的Post-LN训练更稳定。
四、从Transformer到GPT
GPT系列选择了Decoder-only路线,使用Masked Self-Attention——在训练时,每个位置只能看到它之前的位置,不能"偷看"未来。这适合自回归生成:给定前面的Token,预测下一个Token。
训练目标极其简单:预测下一个Token(Next Token Prediction)。但通过在海量文本上训练,模型学到了语言、知识、推理能力。GPT-3有1750亿参数,训练使用了约3000亿Token。
五、Scaling Law(缩放定律)
2020年,OpenAI发表了Scaling Law:模型性能(loss)与参数量N、数据量D、计算量C呈幂律关系——三者同步增大,性能持续提升,没有明显的"天花板"。
这个发现是GPT-4、Gemini等模型追求"更大模型+更多数据"的理论基础。Chinchilla定律进一步指出:最优训练策略是数据量D ≈ 20 × 参数量N。也就是说一个70B模型需要约1.4T Token训练数据。
六、小结
Transformer的核心创新是Self-Attention——用O(n²)的计算复杂度换取了任意距离的依赖建模能力。从2017年诞生至今,Transformer架构基本框架未变,改进集中在位置编码(RoPE)、激活函数(SwiGLU)、归一化(RMSNorm)等细节。理解Transformer是理解所有大语言模型的基础。