一文读懂 Transformer:大模型的核心架构,从 Attention 到 LLM
前言:
提起 ChatGPT、DeepSeek、Qwen、Llama 等大语言模型,几乎都会提到一个词——Transformer
Transformer 可以说是近几年人工智能领域最重要的模型架构之一。自 2017 年提出以来,它不仅改变了自然语言处理(NLP),还推动了计算机视觉、多模态、语音等多个领域的发展
那么,Transformer 到底是什么?为什么几乎所有的大模型都基于它?本文将从零开始,带你理解 Transformer 的核心思想
一、什么是 Transformer?
Transformer 是一种基于 Attention(注意力机制) 的深度学习模型,由 Ashish Vaswani 等人在 2017 年发表的经典论文 《Attention Is All You Need》 中提出
在 Transformer 出现之前,NLP 领域主要使用
-
RNN(循环神经网络)
-
LSTM(长短期记忆网络)
-
GRU(门控循环单元)
这些模型都有一个共同特点:按顺序处理文本,例如:
我
↓
喜欢
↓
学习
↓
人工智能
模型必须一个词一个词地计算,这种方式存在两个问题:
-
无法充分利用 GPU 并行计算
-
长距离依赖学习困难
Transformer 则完全不同,它提出了一种新的思路:
让每个词都可以直接关注(Attention)其他所有词。
二、为什么需要 Transformer?
举一个简单例子:小明把书借给了小红,因为他已经看完了。
这里的 “他” 到底指谁?人类很容易知道 “他”指的是小明
因为:小明已经看完书,所以把书借给小红;模型同样需要学习这种关系
传统 RNN:一个字一个字传递信息,距离越远,信息越容易丢失。
Transformer:
他
↓
同时关注
↓
小明
↓
书
↓
借给
↓
小红
因此能够更容易理解上下文。
三、Transformer 的整体结构
经典 Transformer 包含两部分:
Transformer
┌───────────────────┐
│ Encoder │
└───────────────────┘
│
▼
┌───────────────────┐
│ Decoder │
└───────────────────┘
其中Encoder:负责理解输入;Decoder负责生成输出
举个例子:
输入:
I love AI.
↓
Encoder
↓
Decoder
↓
输出:
我喜欢人工智能。
不过,现在的大语言模型大多只保留了部分结构:
-
BERT:Encoder Only
-
GPT、Qwen、Llama、DeepSeek:Decoder Only
-
T5:Encoder + Decoder
因此,大家常说 GPT 是一种 Decoder-only Transformer
四、Transformer 的核心
Attention
Transformer 最重要的创新就是 Attention(注意力机制)
一句话理解:计算当前词应该关注哪些词,以及关注多少
我
喜欢
学习
Transformer
计算到Transformer时,它可能更加关注”学习“,而不是”我“,因为”学习Transformer“关系更强。
Attention 会给每个词分配一个权重
| 单词 | 权重 |
|---|---|
| 我 | 0.05 |
| 喜欢 | 0.15 |
| 学习 | 0.60 |
| Transformer | 0.20 |
模型主要利用权重较大的信息进行计算,这就是 Attention 的核心思想
位置编码
Attention 有一个问题,它不知道词语顺序。
例如:”我 爱 你“ 和 ”你 爱 我“,Attention 本身无法区分,因此Transformer 引入了 Positional Encoding(位置编码)
我 位置0
爱 位置1
你 位置2
模型把:词向量 + 位置向量一起作为输入
这样Transformer 就知道谁在前,谁在后
Self-Attention(自注意力)
Transformer 使用的是:Self-Attention(自注意力)意思就是:一句话中的每个词,都可以关注同一句话中的所有词
例如:今天 天气 很好 我们 去 公园
计算”公园“时,它可以同时参考:今天 天气 很好 我们 去
而不是像 RNN 那样一步一步传递信息,因此每个词都拥有完整的上下文信息
Q、K、V 是什么?
学习 Transformer 时,大家都会看到这三个字母,他们分别表示:
-
Query(查询)
-
Key(键)
-
Value(值)
先利用 Query 匹配 Key,匹配成功之后再取出对应的 Value
数学公式:[Attention(Q,K,V)=softmax\left(\frac{QK^T}{\sqrt{d_k}}\right)V]
虽然公式看起来复杂,但本质上可以分为三步:
-
计算 Query 与 Key 的相似度。
-
使用 Softmax 得到注意力权重。
-
用权重对 Value 做加权求和,得到最终表示。
Multi-Head Attention?
一个注意力头只能学习一种关系。
例如:苹果 公司 发布 新 产品
一个头可能学习:苹果 → 公司;另一个头可能学习:发布 → 产品
因此Transformer 同时使用多个 Attention,每个 Head 学习不同的信息,最后把所有结果拼接起来
这就是:Multi-Head Attention(多头注意力)五、位置编码(Positional Encoding)
总结
输入句子
│
Embedding
│
位置编码
│
┌───────────────────────┐
│ Multi-Head Attention │
│ Feed Forward │
│ 重复很多层 │
└───────────────────────┘
│
得到上下文表示
│
输出预测
Transformer 并不是单独的 Attention,也不是单独的 Q/K/V,而是一个由 Embedding、位置编码、Attention、前馈网络、残差连接和归一化等模块组成的完整深度学习架构,其中 Attention 是最核心、最有创新性的部分。
五、Transformer 的优势
Transformer 相比传统 RNN/LSTM,具有以下优势:
| 对比项 | RNN/LSTM | Transformer |
|---|---|---|
| 并行计算 | 不支持 | 支持 |
| 长距离依赖 | 较弱 | 很强 |
| 训练速度 | 较慢 | 更快 |
| GPU 利用率 | 较低 | 更高 |
| 扩展到大模型 | 困难 | 容易 |
正因为这些优势,Transformer 成为了现代大模型的基础架构
目前主流的大模型几乎都建立在 Transformer 架构之上
| 模型 | 架构 |
|---|---|
| GPT 系列 | Decoder-only Transformer |
| Qwen 系列 | Decoder-only Transformer |
| DeepSeek 系列 | Decoder-only Transformer |
| Llama 系列 | Decoder-only Transformer |
| BERT | Encoder-only Transformer |
| T5 | Encoder-Decoder Transformer |
可以说:没有 Transformer,就没有今天的大语言模型
更多推荐
所有评论(0)