1.创建虚拟环境

conda create -n vllm python=3.11
conda activate vllm

2.下载包

pip install vllm
conda install cudatoolkit

3.下载并运行模型

#1.5B模型
vllm serve "deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B"
#7B模型
vllm serve "deepseek-ai/DeepSeek-R1-Distill-Qwen-7B"

查了一下满血版未量化模型大小 

642G	/root/DeepSeek-R1/.git
764K	/root/DeepSeek-R1/figures
1.3T	/root/DeepSeek-R1

4.对本地模型进行操作

用 huggingface cli 扫描本地下载过的所有模型

#安装工具包
pip install huggingface_hub[cli]
#查看本地模型
huggingface-cli scan-cache
#删除指定模型
huggingface-cli delete-cache --repo-type model "deepseek-ai/DeepSeek-R1-Distill-Qwen-7B"

5.问题

显存不足尝试下面命令

export HF_ENDPOINT=https://hf-mirror.com
vllm serve "deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B" \
  --gpu-memory-utilization 0.98 \
  --max-model-len 4096 \
  --block-size 16 \
  --max-num-seqs 8

6.测试

curl -X POST "http://localhost:8000/v1/chat/completions" \
	-H "Content-Type: application/json" \
	--data '{
		"model": "deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B",
		"messages": [
			{
				"role": "user",
				"content": "What is the capital of France?"
			}
		]
	}'
Logo

免费领 150 小时云算力,进群参与显卡、AI PC 幸运抽奖

更多推荐