DCU使用技术报告_下篇_gfx936_DCU_Qwen3.5-27B_rocBLAS-hipBLASLt调优、vLLM工程化与踩坑实战
这次做 DCU 推理优化,最容易上瘾的是看一个 kernel 从 0.50 ms 变成 0.33 ms。真正难的却是后面的判断:它一层有多少次调用,是否命中 CUDA Graph,是否改变生成路径,是否只在某个 chunk 上有效,部署到另一个容器后会不会悄悄回退。Profile 找热点,真实形状做微基准,局部候选用 guard 接入,服务结果决定去留,精度最后否决。DCU、ROCm、Triton
所有评论(0)