logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

海光 DCU 大模型推理环境全流程脚本集

整理一套从环境校验、依赖安装、服务部署到压测验证的全链路可运行脚本,全程无额外依赖,复制到服务器按顺序执行即可完成整套推理环境搭建,适合快速部署生产级推理服务。

#python#github#git
海光DCU大模型推理生产落地:从环境搭建到稳定运维的完整实战笔记

海光DCU大模型推理生产落地实战指南 本文总结了海光DCU大模型推理从环境搭建到生产运维的完整落地经验,针对国产算力在生产环境中常见的性能跳水、显存泄漏、服务崩溃等问题,提供系统性解决方案。 核心要点 环境配置 DTK版本需与硬件匹配,深算二号K100建议DTK 26.04 PyTorch安装需对应ROCm版本,避免版本混乱 NUMA亲和性绑定可提升20-40%多卡并行效率 部署选型 7B模型单卡

#运维#人工智能
海光DCU大模型推理性能优化实战:Qwen2-7B性能提升

本文以海光K100 DCU部署Qwen2-7B-Instruct大模型为例,详细介绍了推理性能优化的全过程。通过三层瓶颈定位法(端到端→算子层→硬件层)确定核心瓶颈为访存效率问题,进而分阶段实施优化:首先通过NUMA绑定、FP8 KV缓存等零代码配置优化提升42%吞吐;再针对GEMV和小算子进行内核定制开发,实现35%的性能提升。最终单卡生成吞吐从20.3 token/s提升至46.1 token

#性能优化#python#github +1
海光DCU大模型推理性能优化实战:Qwen2-7B性能提升

本文以海光K100 DCU部署Qwen2-7B-Instruct大模型为例,详细介绍了推理性能优化的全过程。通过三层瓶颈定位法(端到端→算子层→硬件层)确定核心瓶颈为访存效率问题,进而分阶段实施优化:首先通过NUMA绑定、FP8 KV缓存等零代码配置优化提升42%吞吐;再针对GEMV和小算子进行内核定制开发,实现35%的性能提升。最终单卡生成吞吐从20.3 token/s提升至46.1 token

#性能优化#python#github +1
到底了