在WSL中使用SGLang部署LLM(大语言模型)
·
在WSL中使用SGLang部署LLM(大语言模型)
配置信息
使用16g内存,3060(laptop) 6GB显存
一、前置准备(必做)
- NVIDIA 驱动 ≥ 535(支持 CUDA 12.x);
- 关闭后台占用内存/显存的软件(浏览器、游戏等);
- 开启 Windows 虚拟内存(建议 ≥16G)。
二、完整部署步骤(一键复制执行)
1. 安装 SGLang(CUDA 加速版)
打开 CMD/终端,执行命令(自动适配你的 3060 显卡):
# 安装核心依赖(含 CUDA 加速)
pip install "sglang[all]" --upgrade
# 安装千问模型专用工具
pip install transformers torch accelerate
2. 模型选择(关键:必须 4-bit 量化)
不要用原生 FP16 模型(需要 18G 显存),直接用 Hugging Face 官方 4-bit 量化版:
推荐模型:
Qwen/Qwen3.5-9B-Instruct-GPTQ-Int4
(GPTQ 4-bit 量化,专为 NVIDIA 显卡优化,显存占用仅 5.1G)
3. 启动服务(6G 显存专属优化命令)
这是为你 3060 6G 显存量身定制的命令,直接复制运行:
python -m sglang.launch_server \
--model Qwen/Qwen3.5-9B-Instruct-GPTQ-Int4 \
--quantization gptq \
--offload-model 0.65 \ # 核心:65%模型放GPU,35%放CPU内存(6G显存最优值)
--max-seq-len 8192 \ # 上下文窗口8k(可改4096更省显存)
--gpu-mem-util 0.95 \ # 显存利用率95%(充分利用3060)
--port 30000 # 服务端口
4. 测试调用(本地 API)
浏览器访问 http://localhost:30000,或用 curl 测试:
curl http://localhost:30000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.5-9b",
"messages": [{"role": "user", "content": "你好,介绍一下自己"}]
}'
三、6G 显存专属优化参数(必看)
| 参数 | 取值 | 作用 |
|---|---|---|
--offload-model 0.65 |
0.6~0.7 | 控制 GPU/CPU 模型分配,6G 显存最优值 |
--max-seq-len |
4096/8192 | 4k 最稳,8k 平衡性能 |
--quantization gptq |
gptq | 强制启用 4-bit 量化,显存减半 |
--gpu-mem-util |
0.95 | 充分利用 3060 仅剩的显存空间 |
四、常见问题解决
- 显存溢出(OOM)
降低--offload-model到 0.6,或把--max-seq-len改成 4096; - 速度慢
升高--offload-model到 0.7,关闭后台软件; - 模型下载慢
设置 Hugging Face 镜像:set HF_ENDPOINT=https://hf-mirror.com(Windows)。
总结
- SGLang 是你 3060 6G 显存的最优选择之一:速度最快、API 最友好、部署极简;
- 严格用 4-bit 量化模型 +
offload-model 0.65,就能稳定跑 Qwen3.5-9B; - 相比 Ollama/llama.cpp,SGLang 更适合想本地搭高性能大模型服务的用户。
更多推荐

所有评论(0)