logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

第8板块·第1节:主机与设备内存管理基础与统一内存

默认情况下,使用malloc分配的主机内存是可分页的,操作系统可能将其换出到磁盘,导致数据在物理内存中不连续。在进行 H2D 或 D2H 拷贝时,CUDA 驱动需要先将可分页内存复制到一个临时的页锁定缓冲区,然后再通过 DMA 传输到设备,增加了额外开销。**页锁定内存(Pinned Memory,也称 Page‑Locked Memory)**是使用或分配的主机内存,它不会被操作系统换出,物理地

#人工智能#c++
第4板块·第3节:Tensor Core 硬件原理与编程模型

Tensor Core 是 NVIDIA 从 Volta 架构开始引入的专用硬件单元,专门加速矩阵乘加运算,能在单个时钟周期内完成多个浮点乘加操作,大幅提升深度学习训练和推理的性能。在相同矩阵大小(如 512×512×512)下,对比 FP32 GEMM 和 Tensor Core(FP16)GEMM 的性能,使用 cudaEvent 计时。在练习 2 的基础上,加入共享内存分块和 K 维循环,提

#人工智能#c++
Codex 实战:用 AI 写运维脚本

回顾全文要点,展望 AI 辅助运维脚本编写的未来趋势,并给出进一步学习建议。

#人工智能#运维#大数据
到底了