
简介
该用户还未填写简介
擅长的技术栈
未填写擅长的技术栈
可提供的服务
暂无可提供的服务
第8板块·第1节:主机与设备内存管理基础与统一内存
默认情况下,使用malloc分配的主机内存是可分页的,操作系统可能将其换出到磁盘,导致数据在物理内存中不连续。在进行 H2D 或 D2H 拷贝时,CUDA 驱动需要先将可分页内存复制到一个临时的页锁定缓冲区,然后再通过 DMA 传输到设备,增加了额外开销。**页锁定内存(Pinned Memory,也称 Page‑Locked Memory)**是使用或分配的主机内存,它不会被操作系统换出,物理地
第4板块·第3节:Tensor Core 硬件原理与编程模型
Tensor Core 是 NVIDIA 从 Volta 架构开始引入的专用硬件单元,专门加速矩阵乘加运算,能在单个时钟周期内完成多个浮点乘加操作,大幅提升深度学习训练和推理的性能。在相同矩阵大小(如 512×512×512)下,对比 FP32 GEMM 和 Tensor Core(FP16)GEMM 的性能,使用 cudaEvent 计时。在练习 2 的基础上,加入共享内存分块和 K 维循环,提
Codex 实战:用 AI 写运维脚本
回顾全文要点,展望 AI 辅助运维脚本编写的未来趋势,并给出进一步学习建议。
到底了







