AI为什么这么“吃内存”?一个大模型到底需要多少存储空间?

讨论AI硬件时,人们最容易关注一个参数:

算力。

GPU有多少算力?

NPU有多少TOPS?

芯片跑模型有多快?

但真正部署过AI模型的人通常还会遇到另外一个问题:

内存不够。

甚至有时候,计算芯片性能还没有完全跑满,内存容量就先成了限制。

为什么AI这么“吃内存”?


一、先搞清楚两个概念:存储和内存并不是一回事

日常使用手机时,我们经常说:

“这个手机有12GB+256GB。”

这里其实是两种完全不同的存储资源。

12GB:运行内存

通常来自DRAM或LPDDR。

它负责保存正在运行的数据。

特点是:

速度快,但断电以后数据会消失。


256GB:长期存储

通常来自NAND Flash,例如UFS或者SSD。

它负责长期保存:

  • App
  • 图片
  • 视频
  • 文件
  • AI模型

特点是:

容量大、断电不丢数据,但速度通常低于DRAM。

运行AI模型时,这两类存储都非常重要。


二、一个AI模型首先需要“放得下”

假设你下载了一个本地大模型。

模型本质上也是一组数据。

这些数据首先需要保存在:

手机UFS、电脑SSD或者服务器存储中。

模型参数越多,文件通常也越大。

例如同样一个模型,在不同精度下:

FP16
INT8
INT4

文件大小可能存在明显差异。

这也是为什么端侧模型经常会进行:

量化。

简单理解,就是尽可能使用更低的数据精度表示模型参数,从而降低容量和计算需求。


三、“模型文件大小”不等于“运行内存占用”

这是很多人容易误解的地方。

一个模型文件假设只有几GB,并不意味着只需要几GB运行内存。

模型运行时还需要空间保存:

  • 模型权重;
  • 输入数据;
  • 中间计算结果;
  • 系统开销;
  • 上下文数据;
  • KV Cache。

因此:

模型能下载下来,不代表设备一定能跑起来。

这也是为什么一些电脑明明SSD还有很多空间,但运行本地大模型时仍然提示内存不足。


四、什么是KV Cache?

如果你经常看大模型相关资料,可能会看到一个词:

KV Cache。

不用理解得太复杂。

可以把它简单理解成:

大模型在对话过程中,为了避免每生成一个新Token都把前面的内容重新计算一次,会把部分已经计算过的信息保存下来。

对话越长,需要保留的信息通常越多。

因此上下文长度增加以后,KV Cache也可能占用更多内存。

所以当人们追求:

32K
128K
甚至更长上下文

背后不仅仅是模型能力问题,同时也意味着更高的内存压力。


五、为什么AI PC开始强调大内存?

传统办公场景里,16GB内存已经可以满足很多用户。

但如果一台电脑需要同时运行:

Windows
浏览器
Office
多个应用
本地AI模型

内存压力会迅速增加。

特别是一些更大的模型,对内存容量要求会明显提升。

因此AI PC发展以后,32GB甚至更高容量的配置受到越来越多关注,并不奇怪。

本地AI真正普及以后:

内存容量很可能从一个普通配置参数,变成影响AI体验的重要指标。


六、只有容量够还不行,还要够快

假设一颗NPU计算能力非常强。

但是模型参数需要不停从内存读取。

如果内存带宽不足,计算单元就会等待数据。

因此AI系统存在两个不同的问题:

容量问题

模型能不能装进去、运行起来。

带宽问题

数据能不能足够快地送给处理器。

这也是为什么AI时代同时推动了:

  • 更大容量DRAM;
  • 更高速LPDDR;
  • DDR升级;
  • HBM;
  • 更高速SSD;
  • 更高性能UFS。

AI对存储的需求,并不是简单的“容量越来越大”。

而是:

容量、速度和带宽都在提升。


七、NAND又在AI里面负责什么?

如果DRAM是工作台,

那么NAND更像仓库。

很多数据需要长期保存在NAND中:

  • AI模型;
  • 向量数据库;
  • 训练数据;
  • 图片;
  • 视频;
  • 用户文件;
  • AI生成内容。

特别是随着AI开始处理越来越多图片、语音和视频,非结构化数据规模会继续增长。

因此AI带来的存储需求并不只发生在GPU旁边。

从服务器SSD,到AI PC,再到手机UFS,都可能受到影响。


八、AI其实是一场“数据搬运”的竞争

很多时候,大家把AI理解成:

芯片疯狂计算。

但从整个系统看,它更像:

数据从SSD读取

进入DRAM

送给GPU/NPU

完成计算

生成新的数据

再次保存

也就是说:

AI不仅在计算数据,也在不停搬运数据。

当模型越来越大、上下文越来越长、视频和多模态数据越来越多以后,数据搬运能力就会变得越来越重要。


写在最后

所以以后再看到一个AI设备,可以不只问:

它有多少TOPS?

还可以继续问三个问题:

内存有多大?

内存有多快?

模型存在哪里?

这三个问题,正在越来越深地影响AI设备的真实体验。

而到了数据中心,情况会更加极端。

GPU计算速度越来越快以后,普通内存已经很难完全满足它对数据带宽的需求。

于是,一种原本并不被普通消费者熟悉的存储技术走到了AI舞台中央:

HBM。

下一篇,我们就来说说:

HBM到底是什么,为什么AI GPU越来越离不开它。

更多推荐