前言:

提起 ChatGPT、DeepSeek、Qwen、Llama 等大语言模型,几乎都会提到一个词——Transformer

Transformer 可以说是近几年人工智能领域最重要的模型架构之一。自 2017 年提出以来,它不仅改变了自然语言处理(NLP),还推动了计算机视觉、多模态、语音等多个领域的发展

那么,Transformer 到底是什么?为什么几乎所有的大模型都基于它?本文将从零开始,带你理解 Transformer 的核心思想


一、什么是 Transformer?

Transformer 是一种基于 Attention(注意力机制) 的深度学习模型,由 Ashish Vaswani 等人在 2017 年发表的经典论文 《Attention Is All You Need》 中提出

在 Transformer 出现之前,NLP 领域主要使用

  • RNN(循环神经网络)

  • LSTM(长短期记忆网络)

  • GRU(门控循环单元)

这些模型都有一个共同特点:按顺序处理文本,例如:

我
↓
喜欢
↓
学习
↓
人工智能

模型必须一个词一个词地计算,这种方式存在两个问题:

  • 无法充分利用 GPU 并行计算

  • 长距离依赖学习困难

Transformer 则完全不同,它提出了一种新的思路:

让每个词都可以直接关注(Attention)其他所有词。


二、为什么需要 Transformer?

举一个简单例子:小明把书借给了小红,因为他已经看完了。

这里的 “他” 到底指谁?人类很容易知道 “他”指的是小明

因为:小明已经看完书,所以把书借给小红;模型同样需要学习这种关系

传统 RNN:一个字一个字传递信息,距离越远,信息越容易丢失。

Transformer:

他
↓
同时关注
↓
小明
↓
书
↓
借给
↓
小红

因此能够更容易理解上下文。


三、Transformer 的整体结构

经典 Transformer 包含两部分:

                Transformer

          ┌───────────────────┐
          │     Encoder        │
          └───────────────────┘
                    │
                    ▼
          ┌───────────────────┐
          │     Decoder        │
          └───────────────────┘

其中Encoder:负责理解输入;Decoder负责生成输出

举个例子:

输入:
I love AI.
↓
Encoder
↓
Decoder
↓
输出:
我喜欢人工智能。

不过,现在的大语言模型大多只保留了部分结构:

  • BERT:Encoder Only

  • GPT、Qwen、Llama、DeepSeek:Decoder Only

  • T5:Encoder + Decoder

因此,大家常说 GPT 是一种 Decoder-only Transformer


四、Transformer 的核心

Attention

Transformer 最重要的创新就是 Attention(注意力机制)

一句话理解:计算当前词应该关注哪些词,以及关注多少

我

喜欢

学习

Transformer

计算到Transformer时,它可能更加关注”学习“,而不是”我“,因为”学习Transformer“关系更强。

Attention 会给每个词分配一个权重

单词 权重
0.05
喜欢 0.15
学习 0.60
Transformer 0.20

模型主要利用权重较大的信息进行计算,这就是 Attention 的核心思想

位置编码

Attention 有一个问题,它不知道词语顺序。

例如:”我 爱 你“ 和 ”你 爱 我“,Attention 本身无法区分,因此Transformer 引入了 Positional Encoding(位置编码)

我    位置0

爱    位置1

你    位置2

模型把:词向量 + 位置向量一起作为输入

这样Transformer 就知道谁在前,谁在后

Self-Attention(自注意力)

Transformer 使用的是:Self-Attention(自注意力)意思就是:一句话中的每个词,都可以关注同一句话中的所有词

例如:今天 天气 很好 我们 去 公园

计算”公园“时,它可以同时参考:今天 天气 很好 我们 去

而不是像 RNN 那样一步一步传递信息,因此每个词都拥有完整的上下文信息

Q、K、V 是什么?

学习 Transformer 时,大家都会看到这三个字母,他们分别表示:

  • Query(查询)

  • Key(键)

  • Value(值)

先利用 Query 匹配 Key,匹配成功之后再取出对应的 Value

数学公式:[Attention(Q,K,V)=softmax\left(\frac{QK^T}{\sqrt{d_k}}\right)V]

虽然公式看起来复杂,但本质上可以分为三步:

  1. 计算 Query 与 Key 的相似度。

  2. 使用 Softmax 得到注意力权重。

  3. 用权重对 Value 做加权求和,得到最终表示。


Multi-Head Attention?

一个注意力头只能学习一种关系。

例如:苹果 公司 发布 新 产品

一个头可能学习:苹果 → 公司;另一个头可能学习:发布  → 产品

因此Transformer 同时使用多个 Attention,每个 Head 学习不同的信息,最后把所有结果拼接起来

这就是:Multi-Head Attention(多头注意力)五、位置编码(Positional Encoding)

总结

输入句子

Embedding

位置编码

┌───────────────────────┐
│ Multi-Head Attention │
│ Feed Forward │
│ 重复很多层 │
└───────────────────────┘

得到上下文表示

输出预测

Transformer 并不是单独的 Attention,也不是单独的 Q/K/V,而是一个由 Embedding、位置编码、Attention、前馈网络、残差连接和归一化等模块组成的完整深度学习架构,其中 Attention 是最核心、最有创新性的部分。


五、Transformer 的优势

Transformer 相比传统 RNN/LSTM,具有以下优势:

对比项 RNN/LSTM Transformer
并行计算 不支持 支持
长距离依赖 较弱 很强
训练速度 较慢 更快
GPU 利用率 较低 更高
扩展到大模型 困难 容易

正因为这些优势,Transformer 成为了现代大模型的基础架构

目前主流的大模型几乎都建立在 Transformer 架构之上

模型 架构
GPT 系列 Decoder-only Transformer
Qwen 系列 Decoder-only Transformer
DeepSeek 系列 Decoder-only Transformer
Llama 系列 Decoder-only Transformer
BERT Encoder-only Transformer
T5 Encoder-Decoder Transformer

可以说:没有 Transformer,就没有今天的大语言模型

更多推荐