在WSL中使用SGLang部署LLM(大语言模型)


配置信息

使用16g内存,3060(laptop) 6GB显存

一、前置准备(必做)

  1. NVIDIA 驱动 ≥ 535(支持 CUDA 12.x);
  2. 关闭后台占用内存/显存的软件(浏览器、游戏等);
  3. 开启 Windows 虚拟内存(建议 ≥16G)。

二、完整部署步骤(一键复制执行)

1. 安装 SGLang(CUDA 加速版)

打开 CMD/终端,执行命令(自动适配你的 3060 显卡):

# 安装核心依赖(含 CUDA 加速)
pip install "sglang[all]" --upgrade
# 安装千问模型专用工具
pip install transformers torch accelerate

2. 模型选择(关键:必须 4-bit 量化)

不要用原生 FP16 模型(需要 18G 显存),直接用 Hugging Face 官方 4-bit 量化版:

推荐模型:Qwen/Qwen3.5-9B-Instruct-GPTQ-Int4
(GPTQ 4-bit 量化,专为 NVIDIA 显卡优化,显存占用仅 5.1G)

3. 启动服务(6G 显存专属优化命令)

这是为你 3060 6G 显存量身定制的命令,直接复制运行:

python -m sglang.launch_server \
  --model Qwen/Qwen3.5-9B-Instruct-GPTQ-Int4 \
  --quantization gptq \
  --offload-model 0.65 \  # 核心:65%模型放GPU,35%放CPU内存(6G显存最优值)
  --max-seq-len 8192 \    # 上下文窗口8k(可改4096更省显存)
  --gpu-mem-util 0.95 \   # 显存利用率95%(充分利用3060)
  --port 30000            # 服务端口

4. 测试调用(本地 API)

浏览器访问 http://localhost:30000,或用 curl 测试:

curl http://localhost:30000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3.5-9b",
    "messages": [{"role": "user", "content": "你好,介绍一下自己"}]
  }'

三、6G 显存专属优化参数(必看)

参数 取值 作用
--offload-model 0.65 0.6~0.7 控制 GPU/CPU 模型分配,6G 显存最优值
--max-seq-len 4096/8192 4k 最稳,8k 平衡性能
--quantization gptq gptq 强制启用 4-bit 量化,显存减半
--gpu-mem-util 0.95 充分利用 3060 仅剩的显存空间

四、常见问题解决

  1. 显存溢出(OOM)
    降低 --offload-model 到 0.6,或把 --max-seq-len 改成 4096;
  2. 速度慢
    升高 --offload-model 到 0.7,关闭后台软件;
  3. 模型下载慢
    设置 Hugging Face 镜像:set HF_ENDPOINT=https://hf-mirror.com(Windows)。

总结

  1. SGLang 是你 3060 6G 显存的最优选择之一:速度最快、API 最友好、部署极简;
  2. 严格用 4-bit 量化模型 + offload-model 0.65,就能稳定跑 Qwen3.5-9B;
  3. 相比 Ollama/llama.cpp,SGLang 更适合想本地搭高性能大模型服务的用户。
Logo

免费领 150 小时云算力,进群参与显卡、AI PC 幸运抽奖

更多推荐