
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
系列文章中篇。上篇解决了环境、基线和 Profile 的可信度问题;这一篇进入算子层,记录专用 Prefill Attention、Q10/Q20 Query 复用、Gate/Up Triton GEMV,以及一批看起来合理但最终没有采用的实验。
系列文章上篇。本文记录我们在单卡 gfx936 DCU 上优化 Qwen3.5-27B 推理服务的第一阶段:环境核对、评测基线、长上下文分块规律,以及如何拿到一份不掺启动噪声的 HIP Profile。
这次做 DCU 推理优化,最容易上瘾的是看一个 kernel 从 0.50 ms 变成 0.33 ms。真正难的却是后面的判断:它一层有多少次调用,是否命中 CUDA Graph,是否改变生成路径,是否只在某个 chunk 上有效,部署到另一个容器后会不会悄悄回退。Profile 找热点,真实形状做微基准,局部候选用 guard 接入,服务结果决定去留,精度最后否决。DCU、ROCm、Triton
这次做 DCU 推理优化,最容易上瘾的是看一个 kernel 从 0.50 ms 变成 0.33 ms。真正难的却是后面的判断:它一层有多少次调用,是否命中 CUDA Graph,是否改变生成路径,是否只在某个 chunk 上有效,部署到另一个容器后会不会悄悄回退。Profile 找热点,真实形状做微基准,局部候选用 guard 接入,服务结果决定去留,精度最后否决。DCU、ROCm、Triton
系列文章中篇。上篇解决了环境、基线和 Profile 的可信度问题;这一篇进入算子层,记录专用 Prefill Attention、Q10/Q20 Query 复用、Gate/Up Triton GEMV,以及一批看起来合理但最终没有采用的实验。
以下所有数据来自同一套超算环境(Lustre文件系统、NetCDF 4.4.1、1991-2020 OSTIA SST数据),确保对比的公平性。
这篇文章摘要(150字): 海光DCU深度使用手记(上)分享了基于MCC2026超算竞赛的实战经验。文章首先澄清海光DCU(Deep Computing Unit)是兼容AMD ROCm生态的通用计算加速卡,其HIP编程接口与CUDA高度相似。作者详细介绍了超算环境配置(海光Z200系列DCU、DTK 25.04.4工具链)和从CPU到DCU的移植策略,重点设计了五阶段流水线架构,实现I/O与计算







