模型排行榜

大语言模型Transformer架构

发布日期:2026-08-14

一、Transformer的诞生

2017年,Google团队发表了论文《Attention is All You Need》,提出了Transformer架构。这个架构彻底改变了自然语言处理领域——从RNN/LSTM的序列化处理转向完全基于Attention的并行化处理。GPT、BERT、LLaMA、Claude……今天所有大语言模型都建立在Transformer之上。

Transformer的核心思想:抛弃循环结构,只用注意力机制来捕捉序列中任意两个位置之间的依赖关系。这使得模型可以并行训练,大幅提升了训练效率。

二、整体架构

Transformer由编码器(Encoder)解码器(Decoder)组成。原始论文的机器翻译模型是Encoder-Decoder结构。后来的演化中:

  • Encoder-only(如BERT):擅长理解任务(分类、NER)
  • Decoder-only(如GPT系列):擅长生成任务,是当前大模型的主流
  • Encoder-Decoder(如T5、BART):适合翻译、摘要等seq2seq任务
Transformer整体架构(Decoder-Only,即GPT路线)Token Embedding + 位置编码Masked Multi-Head Self-Attention(自注意力层:捕捉token间关系)Add & LayerNorm(残差+层归一化)Feed-Forward Network(FFN)(两层全连接 + 激活函数)Add & LayerNorm↑ 重复 N 层(GPT-3: 96层)Linear + Softmax → 输出

三、核心机制详解

1. Token Embedding

输入文本首先被分词器切成Token(如"Hello world"→[Hello, world]),每个Token映射为一个高维向量(如d=12288维)。Embedding矩阵是模型学习到的参数,类似于"词的坐标系"——语义相近的词向量距离近。

2. 位置编码(Positional Encoding)

Self-Attention本身没有位置概念——打乱输入顺序,输出不变。为了让模型理解"猫追狗"和"狗追猫"的区别,需要注入位置信息。

原始Transformer使用正弦/余弦位置编码

PE(pos, 2i) = sin(pos / 10000^(2i/d))

PE(pos, 2i+1) = cos(pos / 10000^(2i/d))

后来的大模型改用可学习位置编码(Learned PE)或RoPE旋转位置编码(Rotary PE)。RoPE通过旋转矩阵编码相对位置,外推性好,是当前主流(LLaMA、Qwen等使用RoPE)。

3. Self-Attention(自注意力机制)

这是Transformer的灵魂。对于每个Token,Self-Attention计算它与其他所有Token的关联程度,然后加权求和生成新的表示。

具体来说,每个Token生成三个向量:

  • Q(Query):"我在找什么信息"
  • K(Key):"我能提供什么信息"
  • V(Value):"我携带的实际信息"

注意力计算公式:

Attention(Q, K, V) = softmax(QK^T / √d_k) × V

直觉理解:Q×K^T计算当前Token与其他Token的"匹配度",softmax归一化为权重,再乘V得到加权信息。√d_k是缩放因子,防止点积过大导致梯度消失。

Self-Attention计算流程QKVQ × K^T点积匹配÷ √d_k缩放Softmax归一化权重权重 × V → 加权求和 → 输出Output = softmax(QK^T/√d_k) × V

4. Multi-Head Attention

单头Attention只能学习一种关联模式。Multi-Head Attention将Q、K、V分成多组(如GPT-3使用96头),每组独立计算Attention,最后拼接:

MultiHead = Concat(head_1, ..., head_h) × W_O

多头的好处是模型可以同时关注不同维度的信息——有的头关注语法关系,有的头关注语义关系,有的头关注长距离依赖。

5. Feed-Forward Network(FFN)

Attention层之后是FFN,由两层全连接和激活函数组成:

FFN(x) = max(0, x × W1 + b1) × W2 + b2

FFN的作用是对每个位置独立地进行非线性变换。注意FFN是position-wise的——每个Token独立过FFN,不与其他Token交互。交互信息由Attention完成,FFN负责"消化"信息。

现代大模型通常用SwiGLU替代原始ReLU激活函数,效果更好但参数量增加约50%。

6.残差连接与LayerNorm

每个子层(Attention和FFN)外都包裹着残差连接+LayerNorm

output = LayerNorm(x + SubLayer(x))

残差连接让梯度可以直接回传,解决深层网络的梯度消失问题。GPT-3有96层,没有残差连接根本无法训练。LayerNorm对每个样本的特征维度归一化,稳定训练。

现代大模型普遍采用Pre-LN(先LayerNorm再进子层),比原始的Post-LN训练更稳定。

四、从Transformer到GPT

GPT系列选择了Decoder-only路线,使用Masked Self-Attention——在训练时,每个位置只能看到它之前的位置,不能"偷看"未来。这适合自回归生成:给定前面的Token,预测下一个Token。

训练目标极其简单:预测下一个Token(Next Token Prediction)。但通过在海量文本上训练,模型学到了语言、知识、推理能力。GPT-3有1750亿参数,训练使用了约3000亿Token。

五、Scaling Law(缩放定律)

2020年,OpenAI发表了Scaling Law:模型性能(loss)与参数量N、数据量D、计算量C呈幂律关系——三者同步增大,性能持续提升,没有明显的"天花板"。

这个发现是GPT-4、Gemini等模型追求"更大模型+更多数据"的理论基础。Chinchilla定律进一步指出:最优训练策略是数据量D ≈ 20 × 参数量N。也就是说一个70B模型需要约1.4T Token训练数据。

六、小结

Transformer的核心创新是Self-Attention——用O(n²)的计算复杂度换取了任意距离的依赖建模能力。从2017年诞生至今,Transformer架构基本框架未变,改进集中在位置编码(RoPE)、激活函数(SwiGLU)、归一化(RMSNorm)等细节。理解Transformer是理解所有大语言模型的基础。

本站声明