
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
整理一套从环境校验、依赖安装、服务部署到压测验证的全链路可运行脚本,全程无额外依赖,复制到服务器按顺序执行即可完成整套推理环境搭建,适合快速部署生产级推理服务。
海光DCU大模型推理生产落地实战指南 本文总结了海光DCU大模型推理从环境搭建到生产运维的完整落地经验,针对国产算力在生产环境中常见的性能跳水、显存泄漏、服务崩溃等问题,提供系统性解决方案。 核心要点 环境配置 DTK版本需与硬件匹配,深算二号K100建议DTK 26.04 PyTorch安装需对应ROCm版本,避免版本混乱 NUMA亲和性绑定可提升20-40%多卡并行效率 部署选型 7B模型单卡
本文以海光K100 DCU部署Qwen2-7B-Instruct大模型为例,详细介绍了推理性能优化的全过程。通过三层瓶颈定位法(端到端→算子层→硬件层)确定核心瓶颈为访存效率问题,进而分阶段实施优化:首先通过NUMA绑定、FP8 KV缓存等零代码配置优化提升42%吞吐;再针对GEMV和小算子进行内核定制开发,实现35%的性能提升。最终单卡生成吞吐从20.3 token/s提升至46.1 token
本文以海光K100 DCU部署Qwen2-7B-Instruct大模型为例,详细介绍了推理性能优化的全过程。通过三层瓶颈定位法(端到端→算子层→硬件层)确定核心瓶颈为访存效率问题,进而分阶段实施优化:首先通过NUMA绑定、FP8 KV缓存等零代码配置优化提升42%吞吐;再针对GEMV和小算子进行内核定制开发,实现35%的性能提升。最终单卡生成吞吐从20.3 token/s提升至46.1 token







