在这里插入图片描述

在这里插入图片描述

子玥酱 (掘金 / 知乎 / CSDN / 简书 同名)

大家好,我是 子玥酱,一名长期深耕在一线的前端程序媛 👩‍💻。曾就职于多家知名互联网大厂,目前在某国企负责前端软件研发相关工作,主要聚焦于业务型系统的工程化建设与长期维护。

我持续输出和沉淀前端领域的实战经验,日常关注并分享的技术方向包括 前端工程化、小程序、React / RN、Flutter、跨端方案
在复杂业务落地、组件抽象、性能优化以及多端协作方面积累了大量真实项目经验。

技术方向:前端 / 跨端 / 小程序 / 移动端工程化
内容平台:
掘金、知乎、CSDN、简书
创作特点:
实战导向、源码拆解、少空谈多落地
文章状态:
长期稳定更新,大量原创输出

我的内容主要围绕 前端技术实战、真实业务踩坑总结、框架与方案选型思考、行业趋势解读 展开。文章不会停留在“API 怎么用”,而是更关注为什么这么设计、在什么场景下容易踩坑、真实项目中如何取舍,希望能帮你在实际工作中少走弯路。

子玥酱 · 前端成长记录官 ✨
👋 如果你正在做前端,或准备长期走前端这条路
📚 关注我,第一时间获取前端行业趋势与实践总结
🎁 可领取 11 类前端进阶学习资源(工程化 / 框架 / 跨端 / 面试 / 架构)
💡 一起把技术学“明白”,也用“到位”

持续写作,持续进阶。
愿我们都能在代码和生活里,走得更稳一点 🌱

引言

过去两年,AI Infra 圈发生了一个明显变化。

大家讨论的话题,已经从:

模型训练
参数规模
数据集

慢慢转向:

推理系统
GPU利用率
吞吐优化
KV Cache
PD分离

因为越来越多公司发现:

训练一次

推理一辈子

训练成本可能只有:

100万美元

但上线以后:

每天推理成本
几十万美元

于是整个行业开始进入:

Inference First

时代。

而过去两年几乎所有 AI 公司都在做一件事:

用各种工程优化,把每一个 Token 的成本压到极致。

今天,我们就从系统架构角度,聊聊:

大模型推理加速的十大核心技术。

一、KV Cache:推理优化的第一块基石

没有 KV Cache,大模型几乎无法商用。例如:

用户输入:

你好

模型生成:

你好,请问有什么可以帮助你?

生成第一个 Token:

Transformer 80层全部计算

生成第二个 Token 时,如果重新计算:

你好
请问

历史内容。那么:

每生成一个 Token

都会重新计算全部上下文

复杂度接近:

O(N²)

因此行业引入:

KV Cache

核心思想:

已经算过的 Key、Value

直接缓存

后续只计算:

新 Token

于是:

Decode阶段

计算量下降几十倍

KV Cache 成为了现代推理系统的基础。

几乎所有推理框架:

vLLM
TensorRT-LLM
SGLang
TGI

都依赖 KV Cache。

二、Continuous Batching:吞吐提升神器

传统服务器:

Request A

↓

执行结束

↓

Request B

GPU 经常空闲。而 Continuous Batching 的思想是:

动态拼车

例如,时刻1:

用户A

时刻2:

用户B

时刻3:

用户C

传统方式:

三次执行

Continuous Batching:

一起执行

形成:

大 Batch

GPU 利用率大幅提高。吞吐提升:

2~10倍

vLLM 最核心的能力之一就是:

Continuous Batch

三、PagedAttention:显存利用率革命

很多 GPU 看起来显存很大:

80GB H100

实际上大量显存被浪费。因为:

KV Cache 长度不同

传统连续内存分配会产生:

显存碎片

例如:

用户A

8K Context

用户B

32K Context

用户C

4K Context

大量空间无法复用,vLLM 提出的:

PagedAttention

借鉴操作系统,虚拟内存分页思想。

将 KV Cache:

拆成 Block

按需映射,效果:

显存利用率提高

吞吐提高

成本降低

这也是 vLLM 能成为行业标准的重要原因。

四、FlashAttention:Attention加速革命

Transformer 最大瓶颈:

Attention

传统计算:

Q × K

↓

Softmax

↓

V

需要频繁访问:

HBM显存

真正慢的不是计算,而是:

Memory IO

FlashAttention 的核心思想:

减少HBM访问

通过:

Tile

SRAM缓存

Kernel Fusion

实现:

IO-aware Attention

效果:

速度提升2~4倍

目前:

GPT
Claude
DeepSeek
Qwen

几乎全部采用。

五、Quantization:参数压缩

FP16:

2 Byte

70B模型:

140GB

单卡根本放不下,于是出现:

INT8

INT4

FP8

AWQ

GPTQ

例如,4bit量化后:

70B

↓

35GB

显存占用减少:

75%

推理速度提升:

2倍以上

现在很多部署方案:

Qwen3
DeepSeek
Llama

都会优先采用:

AWQ + INT4

部署。

六、Speculative Decoding:预测未来 Token

这是最近最火的技术之一。

传统生成:

Token1

↓

Token2

↓

Token3

严格串行,GPU 大量等待。

Speculative Decoding 引入,Draft Model 小模型:

一次预测多个Token

例如:

Token1~Token5

再由大模型验证:

是否正确

正确:

一次接受多个 Token

于是:

TPS提升2~3倍

Google、OpenAI 都在使用。

七、PD 分离:Prefill 和 Decode 解耦

传统架构:

同一组 GPU

负责:

Prefill

+

Decode

问题:

资源冲突

因为:

Prefill

计算密集型 ➡️ GPU利用率100%

Decode

访存密集型 ➡️ GPU利用率低

两者混在一起:

互相拖累

于是出现:

PD Separation

架构:

Prefill Cluster

↓

KV Transfer

↓

Decode Cluster

收益:

吞吐提高

延迟降低

GPU利用率提高

目前:

DeepSeek
vLLM
Moonshot
字节
阿里

都在深入研究。

八、Tensor Parallel:模型切分

70B模型单卡放不下。于是:

8张GPU

共同完成计算。例如,Transformer Layer:

Linear层

被拆成:

GPU1

GPU2

GPU3

GPU4

同时计算,形成:

Tensor Parallel

优势:

支持超大模型

缺点:

AllReduce通信巨大

因此:

NVLink
NVSwitch

越来越重要。

九、MoE:只激活部分参数

Dense Model:

600B参数

全部执行

成本巨大,MoE:

600B参数存在

只激活30B

通过:

Router

选择:

Expert1

Expert8

Expert21

参与计算,于是:

模型能力巨大

推理成本接近30B

这也是:

DeepSeek-V3

Mixtral

Qwen-MoE

成功的重要原因,未来:

Sparse Model

可能成为主流。

十、CUDA Kernel Fusion:减少 Kernel 启动开销

很多人以为:

GPU慢

实际上:

Kernel 启动次数过多

才是真正问题。例如,传统:

MatMul

↓

Add

↓

Softmax

↓

LayerNorm

每一步:

一次Kernel

GPU频繁同步。Kernel Fusion,直接合并:

MatMul + Add + Softmax + LayerNorm

变成:

一个Kernel

减少:

Kernel Launch

Memory Copy

Synchronization

TensorRT-LLM 最大优势之一就是:

大量 Kernel Fusion

速度远超普通 PyTorch。

十一、未来真正的王炸:推测执行 + Agent Runtime

今天优化的对象还是:

Token

未来优化的对象可能变成:

Task

例如 Agent,传统:

思考

↓

搜索

↓

工具调用

↓

总结

串行执行,未来可能:

多路径推测

↓

并行工具调用

↓

结果验证

↓

自动合并

类似 CPU:

Branch Prediction

思想,优化对象从:

单次推理

升级成:

整个任务流

这可能是下一代 AI Runtime 最大方向。

总结

如果按照影响力排序,大模型推理加速最核心的十大技术可以总结为:

KV Cache

Continuous Batching

PagedAttention

FlashAttention

Quantization

Speculative Decoding

PD Separation

Tensor Parallel

MoE

Kernel Fusion

过去 AI 的竞争是:

谁模型更大

现在竞争的是:

谁每秒 Token 更多

而未来竞争的核心将变成:

谁每美元产生更多 Intelligence

因为在 Agent 时代,真正决定 AI 公司生死的,已经不是训练能力。

而是:

谁能把每一个 Token、每一次任务、每一张 GPU 的价值压榨到极致。

下一阶段的 AI Infra,竞争的不是模型,而是 Runtime。

Logo

免费领 150 小时云算力,进群参与显卡、AI PC 幸运抽奖

更多推荐