logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

在Ubuntu 22.04 使用 vLLM 部署千问 Qwen3-8B

在 16GB 显存的 Quadro RTX 5000 上用 vLLM 部署 Qwen3-8B 推理服务。通过 AWQ 4bit 量化(~4.7GB)+ YaRN 位置编码扩展(49152 tokens)+ 高显存利用率(0.97)解决显存瓶颈,使用 ModelScope 解决国内下载问题。

#人工智能#深度学习#transformer
到底了