
简介
该用户还未填写简介
擅长的技术栈
未填写擅长的技术栈
可提供的服务
暂无可提供的服务
cuda学习(三)矩阵乘法
共享内存是每个线程块(block)内部的高速内存,线程块内的所有线程都能访问共享内存。因此,直接将整个矩阵加载到共享内存并不是一个可行的选择,除非矩阵的尺寸非常小,或者使用多个线程块来分担内存工作。根据矩阵的大小和线程块的大小计算出所需的线程块数量,保证每个矩阵元素都有一个线程负责计算。会使得线程块在加载数据时,线程按行访问,这可以减少不必要的内存访问延迟。是线程块的大小,这里设置为 16,表示每

到底了







