使用 Docker 安装 Ollama ,通过 Ollama 部署 Qwen3 系列模型(如 Qwen3、Qwen3-72B 等)


🧱 一、环境准备

✅ 前提条件:

  • Linux 系统(推荐 Ubuntu)
  • 已安装 Docker
  • 推荐 GPU 支持(用于运行大模型,如 Qwen3-72B)

使用以下命令检查是否已安装 Docker:

docker --version

如果未安装,请参考:Docker 官方安装指南


🐳 二、使用 Docker 安装 Ollama

Ollama 官方提供了 Docker 镜像,可以通过以下方式部署。

1. 拉取 Ollama Docker 镜像

docker pull ollama/ollama:latest

2. 启动 Ollama 容器

docker run -d -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama:latest

参数说明:

  • -d: 后台运行
  • -v ollama:/root/.ollama: 挂载数据卷,保存模型文件
  • -p 11434:11434: 映射默认 API 端口
  • --name ollama: 给容器命名方便管理

3. 检查服务状态

curl http://localhost:11434/api/version

如果返回类似 "version":"0.1.x",说明 Ollama 成功启动了。


🤖 三、使用 Ollama 安装 Qwen3 系列模型

可以在 ModelScope(魔搭)平台 上找到并下载 Qwen3 模型,并将其转换为 Ollama 可用格式。

不过,Ollama 社区已经支持一些主流模型的自动拉取,比如:

ollama run qwen3

但如果你需要手动部署,可以按照以下步骤进行。


📦 四、手动部署 Qwen3 到 Ollama(高级选手)

1. 下载 Qwen3 模型

前往 Qwen3 官网或 ModelScope 页面 下载你需要的版本(例如 Qwen3-7B、Qwen3-72B-GPTQ 等)。

假设你已经将模型解压到 /models/Qwen3-7B

2. 构建 GGUF 或 GGML 格式(适用于 CPU)

如果你希望在 CPU 上运行,需要将模型转换为 GGUF 或 GGML 格式。可以使用 llama.cpp 工具。

步骤:
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
pip install -r requirements.txt

# 转换 HuggingFace 模型为 GGUF
python convert_hf_to_gguf.py /models/Qwen3-7B --outfile ./qwen3-7b.gguf

3. 创建 Modelfile

在当前目录下创建一个 Modelfile 文件,内容如下:

FROM ./qwen3-7b.gguf
TEMPLATE "{{ if .System }}<|system|>\n{{ .System }}\n{{ end }}{{ if .Prompt }}<|user|>\n{{ .Prompt }}\n{{ end }}<|assistant|>\n"
PARAMETER temperature 0.8
PARAMETER top_p 0.95
PARAMETER top_k 40

4. 使用 Ollama 加载模型

进入容器内部:

docker exec -it ollama sh

然后执行:

cd /root/
mkdir -p models/qwen3
cp /path/to/qwen3-7b.gguf models/qwen3/
cat > models/qwen3/Modelfile <<EOF
FROM ./qwen3-7b.gguf
TEMPLATE "{{ if .System }}<|system|>\n{{ .System }}\n{{ end }}{{ if .Prompt }}<|user|>\n{{ .Prompt }}\n{{ end }}<|assistant|>\n"
PARAMETER temperature 0.8
PARAMETER top_p 0.95
PARAMETER top_k 40
EOF

ollama create qwen3 -f models/qwen3/Modelfile

5. 运行模型

ollama run qwen3

🌐 五、通过 API 使用模型(可选)

可以通过 REST API 来调用模型:

curl http://localhost:11434/api/generate -d '{
  "model": "qwen3",
  "prompt": "你好,请介绍一下你自己"
}'

🧪 六、查看所有模型

ollama list

输出示例:

NAME         SIZE      MODIFIED
qwen3        14.5 GB   1 hour ago

✅ 总结

步骤 内容
1 安装 Docker
2 拉取并运行 Ollama 容器
3 自动拉取或手动部署 Qwen3 模型
4 通过 CLI 或 API 使用模型

如果你想使用 GPU 加速运行 Qwen3-72B,建议使用 NVIDIA 容器工具(如 nvidia-docker),并且模型格式需为 GGUF + CUDA 支持。

Logo

免费领 150 小时云算力,进群参与显卡、AI PC 幸运抽奖

更多推荐