logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

cuda ncu section 含义解释

示例 Metrics:类似 l1tex__t_bytes_pipe_lsu_mem_global_op_ld(全局内存加载字节数)。示例 Metrics:l1tex__t_sectors_pipe_lsu_mem_global_op_ld(全局内存加载扇区)。示例 Metrics:sm__inst_executed(指令数)、flop_sp_efficiency(单精度浮点效率)。示例 Metri

流畅的Python笔记

特殊方法 继承图 列表与元组方法对比

#python
PyTorch 学习笔记(5): PyTorch 2: Faster Machine Learning Through Dynamic Python Bytecode Transformation

PyTorch 2通过(Python字节码动态改写的JIT前端)与(默认编译后端)实现核心能力,在保留PyTorch动态易用性的同时,于NVIDIA A100上实现推理2.27×、训练1.41×几何平均加速,图捕获覆盖率达93%–100%,远超TorchScript等传统方案,兼顾Python灵活性与编译优化性能。PyTorch为动态命令式(Eager)框架,易用易调试,但难以做跨算子图优化;原有

#机器学习#python#pytorch
CUDA编程中影响性能的小细节总结

通过结合具体场景分析(如矩阵计算、图像处理、深度学习)选择优化策略,并利用性能分析工具验证改进效果。

PyTorch 学习笔记(13):third_party 第三方依赖全景图

PyTorch 的目录本质上是一幅深度学习系统栈的完整拼图硬件覆盖的广度:从 NVIDIA(CUTLASS/NCCL/cudnn_frontend)到 AMD(composable_kernel/aiter)到 Intel(ideep/ittapi)到 ARM(kleidiai/XNNPACK),再到 Vulkan 移动 GPU,几乎覆盖所有主流计算硬件性能层次的深度。

#pytorch#学习
PyTorch 学习笔记(13):third_party 第三方依赖全景图

PyTorch 的目录本质上是一幅深度学习系统栈的完整拼图硬件覆盖的广度:从 NVIDIA(CUTLASS/NCCL/cudnn_frontend)到 AMD(composable_kernel/aiter)到 Intel(ideep/ittapi)到 ARM(kleidiai/XNNPACK),再到 Vulkan 移动 GPU,几乎覆盖所有主流计算硬件性能层次的深度。

#pytorch#学习
Pytorch 学习笔记(9): PyTorch.Compile

是 PyTorch 2.0+ 引入的编译器模块,提供了模型编译、优化和部署的核心 API。本文系统整理所有官方 API 及其用途。

#pytorch#学习
LLVM AMDGPU 后端代码分析研究(1):PassPipe Line

本系列文章是对GPU LLVM后端的探索与学习,后端的学习资料主要有LLVM源码和公开的Spec. 众所周知,在PC GPU领域的玩家主要有三家公司:NV, AMD, INTEL. 在LLVM 后端开源的代码只有NV, AMD,而AMD相对NV的文档分享会更Open一些,比较容易找到它的Spec. 所以整个系统文章会以AMD的GPU作为研究目标,AMD 开源的代码对应的芯片有两款:R600 , G

GPU L2 Cache 设计哲学概述

吞吐量最大化:通过大容量、多分区、非阻塞设计,以极高的带宽满足所有SM的并发请求,保障计算单元的吞吐量。流量优化与节能:通过强大的请求合并能力,减少对显存的访问次数和流量,提升有效带宽,降低功耗。全局协调与串行化:作为全局内存系统的枢纽,高效、正确地处理原子操作和多SM之间的数据交互。最终,一个成功的L2 Cache设计是让SM“感觉”不到Global Memory的巨大延迟,仿佛在访问一个吞吐量

#硬件架构
LESSONS IN TABLEGEN 报告总结

该文档是Nicolai Hähnle在FOSDEM 2019上关于LLVM TableGen的分享内容,核心介绍了TableGen作为LLVM中的工具与语言,其工具端包含和(共享前端、不同后端),可生成MCInstrDesc、指令选择等目标文件,语言端是记录定义的超集,支持类、多类等特性;还详细阐述了TableGen的类型系统(如bit、dag等)、核心语言特性(类、let语句、多类、foreac

    共 15 条
  • 1
  • 2
  • 请选择