1. 安装vLLM的环境

1.1 安装要求

1. vLLM 包含预编译的 C++ 和 CUDA (12.8) 二进制文件。
2. 要求:
操作系统: Linux
	Python: 3.9 -- 3.12  # (实测:推荐安装3.10以上版本)
	GPU: 计算能力 7.0 或更高 (例如, V100, T4, RTX20xx, A100, L4, H100 等)
查看详细的信息:https://docs.vllm.com.cn/en/latest/getting_started/installation/gpu.html

1.2 安装conda并创建python的虚拟环境

# 1.安装conda环境 参照conda官网
# https://www.anaconda.com/download/success
# 2. 创建一个python的虚拟环境
conda create -n [虚拟环境名称] python=3.10 # 指定python的版本号
# 3.切换到虚拟环境
# 可以使用 conda env list 查看所有的虚拟环境列表
conda activate [虚拟环境名称]

1.3 安装PyTorch

# 官网上选择相应的版本
# https://pytorch.org/get-started/locally/

在这里插入图片描述

1.4 安装vLLM

# 1.安装命令
pip install vllm

# 2.从Hugging Face 下载模型或者从魔塔社区下载,建议从魔塔社区下载,国内速度快
下载地址:https://www.modelscope.cn/models

下载方式:
在这里插入图片描述

pip install modelscope

使用SDK下载
创建一个download.py 文件,然后在服务器上执行

#模型下载
from modelscope import snapshot_download
model_dir = snapshot_download('Qwen/Qwen3-0.6B', cache_dir="/root/autodl-tmp/llm/Qwen/Qwen3-0.6B")  # 指定模型的存放位置
启动vLLM
# 启动vLLM
vllm serve /root/autodl-tmp/llm/Qwen/Qwen3-0.6B  # serve 后面跟本地模型存放的绝对路径
测试
from openai import OpenAI
 clinet = OpenAI(base_url="http://localhost:23333/v1/", api_key="1231231") # 注意查看启动后的web 访问的端口号, api_key 不能为空,可以随便填
 res = client.chat.completions.create(
	   model="/root/autodl-tmp/llm/Qwen/Qwen3-0.6B"  # 本地的模型的路径(绝对路径)
    messages=[
        {'role': 'user', 'content': '请介绍下一下什么是大模型?'}
    ]
)
 

2. 安装LMDeploy

与vLLM的安装基本一致

2.1 创建虚拟环境,安装lmdeploy

conda create -n lmdeploy python=3.10 -y
conda activate lmdeploy
pip install lmdeploy

2.2 启动

lmdeploy serve api_server /root/autodl-tmp/llm/Qwen/Qwen3-0.6B # 调用本地的模型
测试与vLLM一样,只是端口号不同
Logo

免费领 150 小时云算力,进群参与显卡、AI PC 幸运抽奖

更多推荐