在这里插入图片描述

在这里插入图片描述

子玥酱 (掘金 / 知乎 / CSDN / 简书 同名)

大家好,我是 子玥酱,一名长期深耕在一线的前端程序媛 👩‍💻。曾就职于多家知名互联网大厂,目前在某国企负责前端软件研发相关工作,主要聚焦于业务型系统的工程化建设与长期维护。

我持续输出和沉淀前端领域的实战经验,日常关注并分享的技术方向包括 前端工程化、小程序、React / RN、Flutter、跨端方案
在复杂业务落地、组件抽象、性能优化以及多端协作方面积累了大量真实项目经验。

技术方向:前端 / 跨端 / 小程序 / 移动端工程化
内容平台:
掘金、知乎、CSDN、简书
创作特点:
实战导向、源码拆解、少空谈多落地
文章状态:
长期稳定更新,大量原创输出

我的内容主要围绕 前端技术实战、真实业务踩坑总结、框架与方案选型思考、行业趋势解读 展开。文章不会停留在“API 怎么用”,而是更关注为什么这么设计、在什么场景下容易踩坑、真实项目中如何取舍,希望能帮你在实际工作中少走弯路。

子玥酱 · 前端成长记录官 ✨
👋 如果你正在做前端,或准备长期走前端这条路
📚 关注我,第一时间获取前端行业趋势与实践总结
🎁 可领取 11 类前端进阶学习资源(工程化 / 框架 / 跨端 / 面试 / 架构)
💡 一起把技术学“明白”,也用“到位”

持续写作,持续进阶。
愿我们都能在代码和生活里,走得更稳一点 🌱

引言

AI 过去十几年,其实经历过很多架构时代。

早期是:

CNN

后来是:

RNN

LSTM

GRU

2017 年,《Attention Is All You Need》发布以后:

Transformer

横空出世,当时很多人觉得:

Transformer 只是 NLP 的一个过渡方案。

因为它有很多问题:

O(N²) Attention

长文本成本高

KV Cache 占显存

推理速度慢

于是过去几年,几乎每隔一段时间都会出现一种声音:

Transformer 要被替代了

大家尝试过:

RNN Revival

Linear Attention

Mamba

RWKV

State Space Model

但直到今天:

GPT

Claude

Gemini

DeepSeek

Qwen

Llama

几乎所有主流大模型依然建立在:

Transformer

之上。为什么?为什么一个诞生于 2017 年的架构,经历了这么多年,依然统治整个 AI 世界?

今天我们从系统架构角度来看:

Transformer 为什么至今仍是大模型的核心架构?

一、Transformer 最大的成功:解决了 RNN 无法并行的问题

在 Transformer 出现之前,整个 NLP 世界属于:

RNN

计算过程:

Token1

↓

Token2

↓

Token3

↓

Token4

必须:

一个接一个计算

例如,一句话:

I love AI

RNN 必须:

I

↓

love

↓

AI

串行执行,导致:

GPU 大量等待

因为 GPU 擅长:

矩阵并行

而不擅长:

串行递归

于是训练速度很慢。Transformer 的最大贡献就是:

全并行,整个序列:

Token1

Token2

Token3

Token4

同时进入:

Attention

计算,形成:

Matrix × Matrix

GPU 利用率瞬间提升。这也是 Transformer 能扩展到:

万亿 Token

训练规模的根本原因。

二、Attention 让模型拥有全局视野

RNN 的记忆能力其实很差,例如:

小明出生在北京。

……

经过几千字内容。

……

他后来去了上海。

当模型生成 “他” 时,RNN 很可能已经忘记:

小明

因为:

信息逐步衰减

而 Attention 不一样。生成当前 Token 时,它可以直接看到:

所有历史 Token

例如:

Q × K

找到:

最相关内容

形成:

动态记忆

因此,Transformer 天然拥有:

长距离依赖能力

这也是大模型理解能力提升的重要原因。

三、Transformer 本质上非常适合 GPU

为什么 GPU 时代属于 Transformer?因为,Transformer 几乎全是:

MatMul

例如:

Q × K

Attention × V

FFN

Projection

最终都是:

矩阵乘法

而 GPU 最擅长:

Tensor Core

SIMD

Matrix Compute

形成:

天作之合

甚至可以说:

Transformer 是第一个真正为 GPU 而生的神经网络。

这也是为什么,H100 算力越来越强、Transformer 性能也越来越强。两者相互促进。

四、Scaling Law 证明了 Transformer 能无限扩展

真正让 Transformer 统治世界的。不是 Attention,而是:

Scaling Law

大家发现,只要不断增加:

参数

数据

算力

模型能力会持续提升,形成:

Loss ↓

近似幂律下降,例如:

1B

↓

7B

↓

70B

↓

600B

能力不断提高,这是过去模型从未做到的。

CNN,有天花板;RNN,有天花板;Transformer,似乎没有明显上限。

于是整个行业形成共识:

Scale Up

就能持续获得收益,这也是 GPT 系列成功的基础。

五、Transformer 的模块化极强

其实今天的大模型,已经不再是原始 Transformer。而是:

Transformer +

例如:

1、FlashAttention,优化 Attention。

2、RoPE,位置编码升级。

3、GQA,减少 KV Cache。

4、MoE,降低 FLOPS。

5、Multi-Query Attention,减少显存。

6、Sliding Window,支持长上下文。

7、Speculative Decoding,加速推理。

大家会发现,所有创新几乎都是:

Transformer +

某种插件

而不是:

推翻 Transformer

因为 Transformer 的模块化太好了。像乐高一样,可以不断升级。

六、生态已经形成巨大护城河

今天 AI Infra 整个生态,都是围绕 Transformer 构建。例如,训练框架:

PyTorch

Megatron

DeepSpeed

推理框架:

vLLM

TensorRT-LLM

SGLang

优化库:

FlashAttention

Triton

xFormers

硬件:

H100

B200

TPU

几乎全部针对:

Transformer

优化。这意味着,即使出现更优秀的架构。

也会遇到一个问题:

软件生态跟不上。

很多时候:

理论提升 20%

但:

生态损失 200%

因此很难替代。

七、Mamba 为什么没有取代 Transformer

2024 年,Mamba 火过一阵。最大的卖点:

O(N)

复杂度,长文本优势巨大。很多人认为:

Transformer 结束了

结果几年过去,主流模型依然是:

Transformer

原因很简单,虽然:

Attention

O(N²)

但是:


FlashAttention

PagedAttention

GQA

RoPE

Sliding Window

KV Cache

PD Separation

不断优化。实际上,工程性能已经非常好。

反而,Mamba 存在:

生态不成熟

Kernel 不成熟

训练经验不足

导致,理论优势没有转化成产品优势。这也是 AI 世界的一条规律:

工程成熟度,很多时候比理论复杂度更重要。

八、Transformer 天然适合 MoE

MoE 能够成功。其实离不开 Transformer。

因为,FFN Layer 天然可以替换成:

Expert Layer

形成:

Attention

↓

MoE FFN

↓

Attention

↓

MoE FFN

整个结构几乎不需要修改,于是:

DeepSeek-V3

Mixtral

Qwen-MoE

GPT-4

都建立在:

Transformer + MoE

基础上。如果没有 Transformer 的模块化,MoE 很难发展到今天。

九、未来 Agent 时代仍然需要 Transformer

未来模型不只是聊天。而是:

Memory

Planning

Tool Calling

Reasoning

形成:

Agent Runtime

很多人以为,Agent 时代需要全新的网络。实际上:


CoT

ReAct

Self Reflection

Tree Search

Multi-Agent

底层依然建立在:

Transformer

之上,因为,Transformer 最强大的能力其实不是生成。而是:

Context Modeling

而 Agent 本质上,就是上下文建模。

十、Transformer 最大的敌人,其实是自己

Transformer 最大的问题,大家都知道。

1、 Attention

O(N²)

2、KV Cache 占显存。

3、长上下文成本高。

4、Decode 串行。

5、推理吞吐有限。

因此未来几年,真正会发生的事情可能不是:

Transformer 消失

而是:

Transformer 持续进化

例如:

Linear Attention

Hybrid Mamba

State Space

Memory Layer

External Memory

Sparse Attention

逐步融入 Transformer,最终形成:

Transformer 2.0

就像今天,现代 CPU 已经不是 1970 年的 CPU。但依然叫:

CPU

未来的大模型可能也一样。核心仍然是:

Transformer

只是内部已经完全不同。

总结

如果用一句话解释:

Transformer 为什么至今仍是大模型的核心架构?

答案其实非常简单:

因为它是目前唯一同时满足能力、扩展性、工程成熟度和生态完整性的架构。

从工程角度来看,Transformer 的优势来自:

Attention 全局建模

GPU 友好

支持并行训练

符合 Scaling Law

模块化扩展能力强

生态成熟

适合 MoE

适合 Agent

过去 AI 行业竞争的是:

模型结构

而今天竞争的核心已经变成:

训练系统

推理系统

Agent Runtime

因为大家慢慢发现:

真正决定大模型上限的,不一定是谁发明了新的架构。

而是谁能把 Transformer 的潜力继续榨干,也许未来会出现新的模型结构。

但至少在未来很多年里:

Transformer,大概率依然会是整个 AI 世界的「CPU 架构」。

更多推荐