LLM 本地部署框架 vLLM 和 LMDeploy
·
1. 安装vLLM的环境
1.1 安装要求
1. vLLM 包含预编译的 C++ 和 CUDA (12.8) 二进制文件。
2. 要求:
操作系统: Linux
Python: 3.9 -- 3.12 # (实测:推荐安装3.10以上版本)
GPU: 计算能力 7.0 或更高 (例如, V100, T4, RTX20xx, A100, L4, H100 等)
查看详细的信息:https://docs.vllm.com.cn/en/latest/getting_started/installation/gpu.html
1.2 安装conda并创建python的虚拟环境
# 1.安装conda环境 参照conda官网
# https://www.anaconda.com/download/success
# 2. 创建一个python的虚拟环境
conda create -n [虚拟环境名称] python=3.10 # 指定python的版本号
# 3.切换到虚拟环境
# 可以使用 conda env list 查看所有的虚拟环境列表
conda activate [虚拟环境名称]
1.3 安装PyTorch
# 官网上选择相应的版本
# https://pytorch.org/get-started/locally/

1.4 安装vLLM
# 1.安装命令
pip install vllm
# 2.从Hugging Face 下载模型或者从魔塔社区下载,建议从魔塔社区下载,国内速度快
下载地址:https://www.modelscope.cn/models
下载方式:
pip install modelscope
使用SDK下载
创建一个download.py 文件,然后在服务器上执行
#模型下载
from modelscope import snapshot_download
model_dir = snapshot_download('Qwen/Qwen3-0.6B', cache_dir="/root/autodl-tmp/llm/Qwen/Qwen3-0.6B") # 指定模型的存放位置
启动vLLM
# 启动vLLM
vllm serve /root/autodl-tmp/llm/Qwen/Qwen3-0.6B # serve 后面跟本地模型存放的绝对路径
测试
from openai import OpenAI
clinet = OpenAI(base_url="http://localhost:23333/v1/", api_key="1231231") # 注意查看启动后的web 访问的端口号, api_key 不能为空,可以随便填
res = client.chat.completions.create(
model="/root/autodl-tmp/llm/Qwen/Qwen3-0.6B" # 本地的模型的路径(绝对路径)
messages=[
{'role': 'user', 'content': '请介绍下一下什么是大模型?'}
]
)
2. 安装LMDeploy
与vLLM的安装基本一致
2.1 创建虚拟环境,安装lmdeploy
conda create -n lmdeploy python=3.10 -y
conda activate lmdeploy
pip install lmdeploy
2.2 启动
lmdeploy serve api_server /root/autodl-tmp/llm/Qwen/Qwen3-0.6B # 调用本地的模型
测试与vLLM一样,只是端口号不同
更多推荐


所有评论(0)