logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

模型推理阶段的一些问题总结

硬盘→显存:预加载阶段,速度慢(GB/s级),一次性完成显存↔GPU:运行阶段,速度极快(100GB/s~TB/s级),持续进行显存带宽指的是第2个阶段——模型已经在显存里"待命"后,GPU以多快的速度从中取数据进行计算。这也是为啥AI推理卡(如A100/H100)要配备HBM高带宽显存,因为生成每个token都需要把几百GB的参数过一遍显存总线。想象一个图书馆:模型权重 = 书架上的百科全书(永

#智能电视
    共 39 条
  • 1
  • 2
  • 3
  • 4
  • 请选择