vLLM 安装及部署 Qwen/Qwen3-0.6B教程
一、vLLM特点
最重要的,vLLM 可以直接运行Hugging Face 和modelscope的下载的模型,而ollama害的经过转换成gguf才能运行,但是要求配置较高生产级别的

vLLM 是一个高性能的大型语言模型推理和服务库,vLLM = Very Large Language Model inference,是加州伯克利 LMSYS 团队 2023 年开源的大语言模型推理 / 服务引擎(SOSP 顶会论文)。 核心定位:解决传统 Transformers 推理显存浪费、并发低、吞吐差的痛点,同等显卡下吞吐量比原生 PyTorch 高 2~24 倍,是工业界主流生产部署方案。
具有以下特点:
高性能:吞吐量高,推理速度快。
内存优化:通过 PagedAttention 技术高效管理内存。
易用性:与 Hugging Face 模型无缝集成,支持多种模型。
分布式推理:支持多 GPU 分布式推理,提升处理能力。
开源:社区驱动,支持广泛,便于开发者使用和改进。
它支持多种模型(如 Llama、Mixtral 等)和硬件(如 NVIDIA GPU、AMD GPU 等),能够显著降低推理成本并提高资源利用率。
Vllm一般适用于在linux上部署大模型,本文以ubuntu 24.02.2 系统、内存32G、显卡Nvidia、显存12G上部署为例讲解。
二、准备工作
A、硬件配制要求:CUDA 12.2。
B、python已安装:版本3.8以上。
C、系统已安装cuda:通过如下命令查看
D、根据自己的硬件下载对应的Qwen版本:
魔塔网站:ModelScope 魔搭社区,搜索“Qwen3-0.6b”:
Qwen3-0.6B:小巧但聪明的模型
Qwen3是通义千问系列的最新版本,而0.6B这个型号,可以理解为它的“轻量便携版”。
0.6B:指的是模型有6亿个参数。相比动辄百亿、千亿参数的大模型,它非常小巧,对电脑配置要求低,但在很多任务上表现依然出色。
FP8:这是一种低精度格式。你可以把它想象成把一张高清图片压缩成体积更小但依然清晰的版本。FP8格式能让模型在运行时占用更少的内存,速度也更快,特别适合我们在个人电脑上部署和测试。
它能做什么:虽然体积小,但它继承了Qwen3的核心能力,比如流畅的对话、基本的逻辑推理、代码理解和多语言支持。对于学习、体验和开发简单的AI应用来说,完全够用。
点击自己要安装的模型,进入其详情页,点“模型文件”-》“下载模型”按照里面说明安装modelsope然后用modelscope下载即可。也可以区huggingface网站下载,。
pip install modelscope
modelscope download --model Qwen/Qwen3-0.6B --local_dir /mnt/llm
三、Vllm部署Qwen3-0.6B
安装基础环境和包
apt update && apt install gcc g++ build-essential -y
wget https://mirrors.tuna.tsinghua.edu.cn/anaconda/miniconda/Miniconda3-latest-Linux-x86_64.sh
bash Miniconda3-latest-Linux-x86_64.sh
source /root/.bashrc
1、创建虚拟环境并激活
虚拟环境可以隔离不同项目所需的 Python 库,避免库版本冲突,保持环境的纯净和隔离。
先创建一个新的python虚拟环境,后面在此环境中部署运行,如若用conda命令创建新虚拟环境myenv,并激活它:
conda create -n myenv python=3.12
conda activate myenv
运行项目并下载源码
2、安装vllm
在激活的虚拟环境中,执行以下命令安装 vLLM:
pip install vllm
3、Vllm启动Qwen3服务
将上面下载的Qwen3解压缩,假设解压后的目录/mnt/llm,则终端中用下面命令示例启动Qwen3推理服务:
VLLM_USE_V1=0 vllm serve /mnt/llm --port 8000 --max-model-len 6384
运行项目并下载源码
命令解释:
实际是启动一个基于 vLLM 的 OpenAI API 服务器。Qwen3是兼容openai api协议的。
1)CUDA_VISIBLE_DEVICES=0
作用:设置环境变量 CUDA_VISIBLE_DEVICES,指定可用的 GPU 设备。
参数解释:
0:表示只使用系统中的第一个 GPU 设备(设备编号从 0 开始)。如果有多个 GPU,可以通过设置为 0,1 等来指定多个设备,并且可以指定--tensor-parallel-size参数-启用n卡张量并行。
2)--port 8000
作用:指定 API 服务器运行的端口号。客户端可以通过 http://localhost:8000 访问该服务。
参数解释:
--port:表示指定端口号的参数。
8000:API 服务器将监听的端口号。
四、代码测试
#使用openai的API风格调用本地模型
from openai import OpenAI
client = OpenAI(base_url="http://localhost:8000/v1/",api_key="suibianxie")
chat_completion = client.chat.completions.create(
messages=[{"role":"user","content":"你好,请介绍下你自己。"}],model="/mnt/llm"
)
print(chat_completion.choices[0])
更多推荐



所有评论(0)