logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

cuda学习(三)矩阵乘法

共享内存是每个线程块(block)内部的高速内存,线程块内的所有线程都能访问共享内存。因此,直接将整个矩阵加载到共享内存并不是一个可行的选择,除非矩阵的尺寸非常小,或者使用多个线程块来分担内存工作。根据矩阵的大小和线程块的大小计算出所需的线程块数量,保证每个矩阵元素都有一个线程负责计算。会使得线程块在加载数据时,线程按行访问,这可以减少不必要的内存访问延迟。是线程块的大小,这里设置为 16,表示每

文章图片
#学习#矩阵#线性代数
到底了