1.安装服务器环境

pip install modelscope
pip install vllm

2.进入魔搭社区 首页 · 魔搭社区

3.搜索想要下载的大模型,并点击下载模型

4.点击复制

5.在服务器执行指令进行下载,建议添加--local_dir ./dir参数选择指定的下载目录

6.下载完成之后执行以下指令启动大模型

python -m vllm.entrypoints.openai.api_server \
  --model /root/autodl-tmp/models/Qwen/Qwen3-8B \       #本地模型路径
  --served-model-name qwen3-8b \                                   #模型接口名字
  --max-model-len 8k \                                                       #上下文长度
  --host 0.0.0.0 \                                                                 #IP
  --port 6006 \                                                                     #端口
  --dtype bfloat16 \                                                             #模型精度
  --gpu-memory-utilization 0.8 \                                         #采样温度,越大同样的问题模型每次生成内容差异越大,越小同样的问题模型越容易生成一样的答案
  --enable-auto-tool-choice \                                              #使用自动工具选择
  --tool-call-parser hermes \                                               #使能工具调用功能

至此服务器布置的大模型就启动完成啦,下一节讲解如何在本地计算机调用服务器部署的大模型。

更多推荐