logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

cuda atomicAdd函数讲解

是CUDA提供的原子操作函数,用于在‌。如需验证设备支持的数据类型,可通过。

NVIDIAGPU 架构中的不变常量(宏观 → 微观)

GPU 芯片的 SM 总数、GPC 总数、L2 缓存大小,都随架构和型号剧烈变化。旗舰卡可能有 128 个 SM,入门卡可能只有 20 个,这是 GPU 厂商划分产品线的主要手段。

#架构
Python学习之Seaborn

Matplotlib需要大量的代码创建细节,而seaborn可以说是高级封装形成的一个“快捷方式”,相比Matplotllib,seaborn代码更简洁,美观,但缺点是很多内容是固定的,定制化能力较差。如果说Matplotlib试图让简单的事情变得容易,让困难的事情成为可能,那么Seaborn试图让一组定义明确的复杂的事情变得简单.编码方式:Figure-Level & Axes-Level。

文章图片
#python#学习#开发语言
CUDA 归约求和(Reduction)算法

这段代码是CUDA并行编程中经典的‌‌的核心部分,用于高效累加数组元素。

#算法
cudaMemcpy函数说明

类比理解:就像快递员在不同仓库(CPU内存和GPU显存)之间搬运货物(数据)。

文章图片
并行计算三剑客:5分钟看懂SIMD、SIMT与MIMD差异

现代芯片正走向异构计算CPU核心:MIMD处理复杂逻辑GPU核心:SIMT加速并行计算NPU核心:SIMD优化AI推理理解这三种范式,你就能像搭积木一样设计出高性能系统!

到底了