
简介
该用户还未填写简介
擅长的技术栈
未填写擅长的技术栈
可提供的服务
暂无可提供的服务
海光DCU大模型推理性能优化实战:Qwen2-7B性能提升
本文以海光K100 DCU部署Qwen2-7B-Instruct大模型为例,详细介绍了推理性能优化的全过程。通过三层瓶颈定位法(端到端→算子层→硬件层)确定核心瓶颈为访存效率问题,进而分阶段实施优化:首先通过NUMA绑定、FP8 KV缓存等零代码配置优化提升42%吞吐;再针对GEMV和小算子进行内核定制开发,实现35%的性能提升。最终单卡生成吞吐从20.3 token/s提升至46.1 token
到底了







