vLLM加速部署LLM
·
文章来源:AI世界探索-vLLM加速部署LLM
(一)vLLM 环境准备
特别注意的是:vLLM目前只支持Linux操作系统(包括Windows WSL子系统),因此环境准备分为 2 部分:
-
Linux 环境准备:我们的操作系统如果是Linux系统,那就无需其他操作。
-
Python 研发环境准备。
Linux环境准备
拉取现成的镜像,直接拉取nvidia现成的镜像
docker pull nvcr.io/nvidia/cuda:12.3.2-cudnn9-runtime-ubuntu20.04
拉取成功后启动容器,在容器中进行以下操作。
Python研发环境准备
安装python
1.更新包列表和已安装的包:
sudo apt updatesudo apt upgrade
2.安装依赖项:
sudo apt install -y software-properties-common
3.添加Python 3.8的PPA(个人包归档)到你的源列表中:
sudo add-apt-repository ppa:deadsnakes/ppa
4.再次更新包列表以确保可以获取PPA中的包:
sudo apt update
5.安装Python 3.10:
sudo apt install -y python3.10
conda环境安装
在linux上安装Conda环境,您可以按照以下步骤操作:
如果您还没有安装Conda可以从Miniconda或者Anaconda官网下载对应的安装脚本:
https://repo.anaconda.com/archive/
wget -c https://repo.anaconda.com/archive/Anaconda3-2023.03-1-Linux-x86_64.sh
运行安装脚本:
bash Anaconda3-2023.03-1-Linux-x86_64.sh
安装过程中会提出问题,按照提示进行操作,例如同意协议,选择安装路径等。
安装完成后,设置环境变量:
vim ~/.bashrcexport PATH=$PATH:/root/anaconda3/binsource ~/.bashrc
(二)下载 Qwen2 模型权重文件
请先通过如下命令安装ModelScope
pip install modelscope
下载完整模型repo
modelscope download --model qwen/Qwen2-7B-Instruct
下载成功后默认能看到如下目录
/root/.cache/modelscope/hub/qwen/Qwen2-7B-Instruct
(三)使用 vLLM 部署和推理大模型
通过 PIP 直接安装依赖包
pip install "vllm>=0.4.3"
直接启动(V100卡),以兼容openai协议方式启动service
python -m vllm.entrypoints.openai.api_server --model Qwen2-7B-Instruct --port 20220 --host 0.0.0.0 --dtype=half
启动后通过openai兼容协议即可调用
/v1/chat/completions
{"model":"Qwen2-7B-Instruct","messages": [{"role": "user","content": "你叫什么?"}],"temperature": 0.7,"top_p": 0.8,"repetition_penalty": 1.05,"max_tokens": 512,"stream":false}
返回
{"id": "chat-8a532d9b8928461989ba3e8d15dbeaa7","object": "chat.completion","created": 1726478504,"model": "Qwen2-7B-Instruct","choices": [{"index": 0,"message": {"role": "assistant","content": "我是阿里云开发的大规模语言模型,我叫通义千问。","tool_calls": []},"logprobs": null,"finish_reason": "stop","stop_reason": null}],"usage": {"prompt_tokens": 23,"total_tokens": 40,"completion_tokens": 17},"prompt_logprobs": null}
更多推荐



所有评论(0)