logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

如何使用vLLM部署通义千问大模型Qwen?使用docker的Python基础镜像部署大模型

1. 报了显存不足的问题,此时要么是你的GPU的显存无法支持你的模型,要么是你让vLLM占用的显存比例太大,而你的显存没有剩下那么多,此时应降低启动时的--gpu-memory-utilization。--gpu-memory-utilization 0.9 占用90%比例的显存,若显存被其他服务占用则可以降低该值。Qwen/Qwen2.5-32B-Instruct-GPTQ-Int4表示你要下载

#docker#容器#运维 +1
如何使用vLLM部署通义千问大模型Qwen?使用docker的Python基础镜像部署大模型

1. 报了显存不足的问题,此时要么是你的GPU的显存无法支持你的模型,要么是你让vLLM占用的显存比例太大,而你的显存没有剩下那么多,此时应降低启动时的--gpu-memory-utilization。--gpu-memory-utilization 0.9 占用90%比例的显存,若显存被其他服务占用则可以降低该值。Qwen/Qwen2.5-32B-Instruct-GPTQ-Int4表示你要下载

#docker#容器#运维 +1
到底了