
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
示例 Metrics:类似 l1tex__t_bytes_pipe_lsu_mem_global_op_ld(全局内存加载字节数)。示例 Metrics:l1tex__t_sectors_pipe_lsu_mem_global_op_ld(全局内存加载扇区)。示例 Metrics:sm__inst_executed(指令数)、flop_sp_efficiency(单精度浮点效率)。示例 Metri
特殊方法 继承图 列表与元组方法对比
PyTorch 2通过(Python字节码动态改写的JIT前端)与(默认编译后端)实现核心能力,在保留PyTorch动态易用性的同时,于NVIDIA A100上实现推理2.27×、训练1.41×几何平均加速,图捕获覆盖率达93%–100%,远超TorchScript等传统方案,兼顾Python灵活性与编译优化性能。PyTorch为动态命令式(Eager)框架,易用易调试,但难以做跨算子图优化;原有
通过结合具体场景分析(如矩阵计算、图像处理、深度学习)选择优化策略,并利用性能分析工具验证改进效果。
PyTorch 的目录本质上是一幅深度学习系统栈的完整拼图硬件覆盖的广度:从 NVIDIA(CUTLASS/NCCL/cudnn_frontend)到 AMD(composable_kernel/aiter)到 Intel(ideep/ittapi)到 ARM(kleidiai/XNNPACK),再到 Vulkan 移动 GPU,几乎覆盖所有主流计算硬件性能层次的深度。
PyTorch 的目录本质上是一幅深度学习系统栈的完整拼图硬件覆盖的广度:从 NVIDIA(CUTLASS/NCCL/cudnn_frontend)到 AMD(composable_kernel/aiter)到 Intel(ideep/ittapi)到 ARM(kleidiai/XNNPACK),再到 Vulkan 移动 GPU,几乎覆盖所有主流计算硬件性能层次的深度。
是 PyTorch 2.0+ 引入的编译器模块,提供了模型编译、优化和部署的核心 API。本文系统整理所有官方 API 及其用途。
本系列文章是对GPU LLVM后端的探索与学习,后端的学习资料主要有LLVM源码和公开的Spec. 众所周知,在PC GPU领域的玩家主要有三家公司:NV, AMD, INTEL. 在LLVM 后端开源的代码只有NV, AMD,而AMD相对NV的文档分享会更Open一些,比较容易找到它的Spec. 所以整个系统文章会以AMD的GPU作为研究目标,AMD 开源的代码对应的芯片有两款:R600 , G
吞吐量最大化:通过大容量、多分区、非阻塞设计,以极高的带宽满足所有SM的并发请求,保障计算单元的吞吐量。流量优化与节能:通过强大的请求合并能力,减少对显存的访问次数和流量,提升有效带宽,降低功耗。全局协调与串行化:作为全局内存系统的枢纽,高效、正确地处理原子操作和多SM之间的数据交互。最终,一个成功的L2 Cache设计是让SM“感觉”不到Global Memory的巨大延迟,仿佛在访问一个吞吐量
该文档是Nicolai Hähnle在FOSDEM 2019上关于LLVM TableGen的分享内容,核心介绍了TableGen作为LLVM中的工具与语言,其工具端包含和(共享前端、不同后端),可生成MCInstrDesc、指令选择等目标文件,语言端是记录定义的超集,支持类、多类等特性;还详细阐述了TableGen的类型系统(如bit、dag等)、核心语言特性(类、let语句、多类、foreac







