大模型私有化部署(一)
1.安装服务器环境
pip install modelscope
pip install vllm
2.进入魔搭社区 首页 · 魔搭社区
3.搜索想要下载的大模型,并点击下载模型

4.点击复制

5.在服务器执行指令进行下载,建议添加--local_dir ./dir参数选择指定的下载目录

6.下载完成之后执行以下指令启动大模型
python -m vllm.entrypoints.openai.api_server \
--model /root/autodl-tmp/models/Qwen/Qwen3-8B \ #本地模型路径
--served-model-name qwen3-8b \ #模型接口名字
--max-model-len 8k \ #上下文长度
--host 0.0.0.0 \ #IP
--port 6006 \ #端口
--dtype bfloat16 \ #模型精度
--gpu-memory-utilization 0.8 \ #采样温度,越大同样的问题模型每次生成内容差异越大,越小同样的问题模型越容易生成一样的答案
--enable-auto-tool-choice \ #使用自动工具选择
--tool-call-parser hermes \ #使能工具调用功能

至此服务器布置的大模型就启动完成啦,下一节讲解如何在本地计算机调用服务器部署的大模型。
更多推荐
所有评论(0)