
简介
该用户还未填写简介
擅长的技术栈
未填写擅长的技术栈
可提供的服务
暂无可提供的服务
如何使用vLLM部署通义千问大模型Qwen?使用docker的Python基础镜像部署大模型
1. 报了显存不足的问题,此时要么是你的GPU的显存无法支持你的模型,要么是你让vLLM占用的显存比例太大,而你的显存没有剩下那么多,此时应降低启动时的--gpu-memory-utilization。--gpu-memory-utilization 0.9 占用90%比例的显存,若显存被其他服务占用则可以降低该值。Qwen/Qwen2.5-32B-Instruct-GPTQ-Int4表示你要下载
如何使用vLLM部署通义千问大模型Qwen?使用docker的Python基础镜像部署大模型
1. 报了显存不足的问题,此时要么是你的GPU的显存无法支持你的模型,要么是你让vLLM占用的显存比例太大,而你的显存没有剩下那么多,此时应降低启动时的--gpu-memory-utilization。--gpu-memory-utilization 0.9 占用90%比例的显存,若显存被其他服务占用则可以降低该值。Qwen/Qwen2.5-32B-Instruct-GPTQ-Int4表示你要下载
到底了







