VLLM部署DeepSeek
·
1.创建虚拟环境
conda create -n vllm python=3.11
conda activate vllm
2.下载包
pip install vllm
conda install cudatoolkit
3.下载并运行模型
#1.5B模型
vllm serve "deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B"
#7B模型
vllm serve "deepseek-ai/DeepSeek-R1-Distill-Qwen-7B"
查了一下满血版未量化模型大小
642G /root/DeepSeek-R1/.git
764K /root/DeepSeek-R1/figures
1.3T /root/DeepSeek-R1
4.对本地模型进行操作
用 huggingface cli 扫描本地下载过的所有模型
#安装工具包
pip install huggingface_hub[cli]
#查看本地模型
huggingface-cli scan-cache
#删除指定模型
huggingface-cli delete-cache --repo-type model "deepseek-ai/DeepSeek-R1-Distill-Qwen-7B"
5.问题
显存不足尝试下面命令
export HF_ENDPOINT=https://hf-mirror.com
vllm serve "deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B" \
--gpu-memory-utilization 0.98 \
--max-model-len 4096 \
--block-size 16 \
--max-num-seqs 8
6.测试
curl -X POST "http://localhost:8000/v1/chat/completions" \
-H "Content-Type: application/json" \
--data '{
"model": "deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B",
"messages": [
{
"role": "user",
"content": "What is the capital of France?"
}
]
}'更多推荐


所有评论(0)