AI为什么这么“吃内存”?一个大模型到底需要多少存储空间?
AI为什么这么“吃内存”?一个大模型到底需要多少存储空间?
讨论AI硬件时,人们最容易关注一个参数:
算力。
GPU有多少算力?
NPU有多少TOPS?
芯片跑模型有多快?
但真正部署过AI模型的人通常还会遇到另外一个问题:
内存不够。
甚至有时候,计算芯片性能还没有完全跑满,内存容量就先成了限制。
为什么AI这么“吃内存”?
一、先搞清楚两个概念:存储和内存并不是一回事
日常使用手机时,我们经常说:
“这个手机有12GB+256GB。”
这里其实是两种完全不同的存储资源。
12GB:运行内存
通常来自DRAM或LPDDR。
它负责保存正在运行的数据。
特点是:
速度快,但断电以后数据会消失。
256GB:长期存储
通常来自NAND Flash,例如UFS或者SSD。
它负责长期保存:
- App
- 图片
- 视频
- 文件
- AI模型
特点是:
容量大、断电不丢数据,但速度通常低于DRAM。
运行AI模型时,这两类存储都非常重要。
二、一个AI模型首先需要“放得下”
假设你下载了一个本地大模型。
模型本质上也是一组数据。
这些数据首先需要保存在:
手机UFS、电脑SSD或者服务器存储中。
模型参数越多,文件通常也越大。
例如同样一个模型,在不同精度下:
FP16
INT8
INT4
文件大小可能存在明显差异。
这也是为什么端侧模型经常会进行:
量化。
简单理解,就是尽可能使用更低的数据精度表示模型参数,从而降低容量和计算需求。
三、“模型文件大小”不等于“运行内存占用”
这是很多人容易误解的地方。
一个模型文件假设只有几GB,并不意味着只需要几GB运行内存。
模型运行时还需要空间保存:
- 模型权重;
- 输入数据;
- 中间计算结果;
- 系统开销;
- 上下文数据;
- KV Cache。
因此:
模型能下载下来,不代表设备一定能跑起来。
这也是为什么一些电脑明明SSD还有很多空间,但运行本地大模型时仍然提示内存不足。
四、什么是KV Cache?
如果你经常看大模型相关资料,可能会看到一个词:
KV Cache。
不用理解得太复杂。
可以把它简单理解成:
大模型在对话过程中,为了避免每生成一个新Token都把前面的内容重新计算一次,会把部分已经计算过的信息保存下来。
对话越长,需要保留的信息通常越多。
因此上下文长度增加以后,KV Cache也可能占用更多内存。
所以当人们追求:
32K
128K
甚至更长上下文
背后不仅仅是模型能力问题,同时也意味着更高的内存压力。
五、为什么AI PC开始强调大内存?
传统办公场景里,16GB内存已经可以满足很多用户。
但如果一台电脑需要同时运行:
Windows
浏览器
Office
多个应用
本地AI模型
内存压力会迅速增加。
特别是一些更大的模型,对内存容量要求会明显提升。
因此AI PC发展以后,32GB甚至更高容量的配置受到越来越多关注,并不奇怪。
本地AI真正普及以后:
内存容量很可能从一个普通配置参数,变成影响AI体验的重要指标。
六、只有容量够还不行,还要够快
假设一颗NPU计算能力非常强。
但是模型参数需要不停从内存读取。
如果内存带宽不足,计算单元就会等待数据。
因此AI系统存在两个不同的问题:
容量问题
模型能不能装进去、运行起来。
带宽问题
数据能不能足够快地送给处理器。
这也是为什么AI时代同时推动了:
- 更大容量DRAM;
- 更高速LPDDR;
- DDR升级;
- HBM;
- 更高速SSD;
- 更高性能UFS。
AI对存储的需求,并不是简单的“容量越来越大”。
而是:
容量、速度和带宽都在提升。
七、NAND又在AI里面负责什么?
如果DRAM是工作台,
那么NAND更像仓库。
很多数据需要长期保存在NAND中:
- AI模型;
- 向量数据库;
- 训练数据;
- 图片;
- 视频;
- 用户文件;
- AI生成内容。
特别是随着AI开始处理越来越多图片、语音和视频,非结构化数据规模会继续增长。
因此AI带来的存储需求并不只发生在GPU旁边。
从服务器SSD,到AI PC,再到手机UFS,都可能受到影响。
八、AI其实是一场“数据搬运”的竞争
很多时候,大家把AI理解成:
芯片疯狂计算。
但从整个系统看,它更像:
数据从SSD读取
↓
进入DRAM
↓
送给GPU/NPU
↓
完成计算
↓
生成新的数据
↓
再次保存
也就是说:
AI不仅在计算数据,也在不停搬运数据。
当模型越来越大、上下文越来越长、视频和多模态数据越来越多以后,数据搬运能力就会变得越来越重要。
写在最后
所以以后再看到一个AI设备,可以不只问:
它有多少TOPS?
还可以继续问三个问题:
内存有多大?
内存有多快?
模型存在哪里?
这三个问题,正在越来越深地影响AI设备的真实体验。
而到了数据中心,情况会更加极端。
GPU计算速度越来越快以后,普通内存已经很难完全满足它对数据带宽的需求。
于是,一种原本并不被普通消费者熟悉的存储技术走到了AI舞台中央:
HBM。
下一篇,我们就来说说:
HBM到底是什么,为什么AI GPU越来越离不开它。
更多推荐
所有评论(0)