从零搭建本地AI开发环境:Ollama + LM Studio + Docker 实战指南

发布时间: 2026-08-07
适合人群: 有一定开发基础,想在本地跑 AI 模型的开发者
预计耗时: 跟着本文操作约 30 分钟完成环境搭建


为什么要本地部署 AI?

作为开发者,你可能已经用惯了 ChatGPT、DeepSeek 这些在线服务。但本地部署 AI 模型有它不可替代的价值:

  1. 隐私安全:敏感代码、公司内部文档不上云
  2. 离线可用:出差、会议、没网的时候照样能用
  3. 成本控制:高频调用 API 的费用,本地跑一次只花电费
  4. 深度定制:换模型、调参数、接自己的工作流,完全自主

本文手把手教你用 Ollama(命令行)+ LM Studio(图形界面)+ Docker(容器化)搭建一套完整的本地 AI 开发环境。

在这里插入图片描述


一、环境准备

硬件要求

运行 7B 参数级别的模型(如 Qwen2.5-7B、DeepSeek-R1-7B),建议配置:

配置项 最低要求 推荐配置
内存 16GB 32GB
显存 集成显卡可用 8GB+ 独立显卡(NVIDIA)
硬盘空间 20GB 可用 50GB+ SSD
操作系统 Windows 10/11 64位 Windows 11 64位

亲测:16GB 内存 + 核显的笔记本跑 Qwen2.5-7B-Q4_K_M(量化后约 5.3GB),响应速度可接受,日常问答和代码辅助没问题。

前置软件

需要提前安装以下工具(均为免费):

工具 用途 下载地址
Git 版本控制、克隆仓库 https://git-scm.com/download/win
Node.js 18+ 运行基于 Node 的 AI 工具 https://nodejs.org/zh-cn/download/
VS Code 代码编辑、AI 编程插件 https://code.visualstudio.com/Download
Docker Desktop 容器化部署 AI 服务 https://www.docker.com/products/docker-desktop/

二、Ollama:命令行跑模型的首选

2.1 安装 Ollama

# 官网下载安装包(约 1.4GB)
# https://ollama.com/download

# 安装完成后,在 PowerShell/Git Bash 验证
ollama --version
# 输出类似:ollama version 0.5.12

2.2 拉取并运行模型

在这里插入图片描述

# 拉取 DeepSeek-R1 7B 蒸馏版(推理能力强)
ollama pull deepseek-r1:7b

# 拉取 Qwen2.5 7B(中文理解好)
ollama pull qwen2.5:7b

# 拉取 Qwen3.5 9B(阿里最新开源)
ollama pull qwen3.5:9b

# 运行模型,进入交互模式
ollama run deepseek-r1:7b

2.3 常用命令速查

# 列出已下载的模型
ollama list

# 删除某个模型(释放空间)
ollama rm qwen2.5:7b

# 查看模型信息
ollama show deepseek-r1:7b

# 后台运行模型服务(供 API 调用)
ollama serve

2.4 通过 API 调用本地模型

Ollama 启动后会自动暴露 REST API(默认端口 11434):

在这里插入图片描述

# 测试 API 是否可用
curl http://localhost:11434/api/generate -d '{
  "model": "deepseek-r1:7b",
  "prompt": "用 Python 写一个快速排序算法"
}'

这样你就可以把本地模型接入自己的应用、脚本或 VS Code 插件中了。

在这里插入图片描述


三、LM Studio:图形化管理模型

如果你不喜欢命令行,LM Studio 提供了完整的图形界面,操作更直观。

在这里插入图片描述

3.1 安装 LM Studio

  1. 访问 https://lmstudio.ai 下载安装包(约 589MB)
  2. 双击安装,按向导完成
  3. 启动后界面如下(文字描述):
    • 左侧:模型列表、聊天历史
    • 中间:对话区域
    • 右侧:模型参数调整(Temperature、Top-P 等)

3.2 导入 .gguf 模型文件

LM Studio 支持直接从 Hugging Face 下载,也支持导入本地 .gguf 文件:

在这里插入图片描述

  1. 点击左侧 “My Models”
  2. 点击 “+” 或 “Import Model”
  3. 选择本地的 .gguf 文件
  4. 加载完成后即可开始对话

3.3 推荐模型文件

模型文件 参数规模 量化格式 大小 特点
DeepSeek-R1-Distill-Qwen-7B-Q8_0.gguf 7B Q8_0 7.6GB 推理能力强,数学和代码优秀
Qwen3.5-9B-Q4_K_M.gguf 9B Q4_K_M 5.3GB 阿里最新开源,中文理解强
Qwen2.5-7B-Instruct-Q8_0.gguf 7B Q8_0 7.6GB 指令遵循能力强,通用场景首选

下载来源:https://huggingface.co(可用迅雷或 IDM 加速下载)

在这里插入图片描述

3.4 配置本地 API 服务

LM Studio 也可以当成本地 API 服务器用:

在这里插入图片描述

  1. 点击右下角的 “Start Server”
  2. 默认端口是 1234
  3. 用以下方式调用:
curl http://localhost:1234/v1/chat/completions -H "Content-Type: application/json" -d '{
  "model": "deepseek-r1-7b",
  "messages": [{"role": "user", "content": "你好"}]
}'

四、Docker:容器化部署更复杂的服务

对于需要运行多个 AI 服务(如 Embedding 模型、向量数据库、RAG 系统)的场景,Docker 是最佳方案。

4.1 安装 Docker Desktop

  1. 下载安装包(约 544MB)
  2. 安装时勾选 “Use WSL 2 instead of Hyper-V”(Windows 推荐)
  3. 安装完成后重启电脑
  4. 启动 Docker Desktop,等左下角显示 “Engine running”

4.2 一键部署常用 AI 服务

# 部署 Ollama + WebUI(带网页界面的 Ollama)
docker run -d -p 3000:8080 --gpus all --name ollama-webui -v ollama:/root/.ollama -v open-webui:/app/backend/data ghcr.io/open-webui/open-webui:ollama

# 部署向量数据库(用于 RAG)
docker run -d -p 6333:6333 --name qdrant qdrant/qdrant

# 部署本地 Embedding 服务
docker run -d -p 8000:8000 --name embedding-api ghcr.io/huggingface/text-embeddings-inference:cpu-latest --model-id BAAI/bge-large-zh-v1.5

4.3 Docker Compose 配置示例

创建一个 docker-compose.yml

version: '3.8'
services:
  ollama:
    image: ollama/ollama
    ports:
      - "11434:11434"
    volumes:
      - ollama-data:/root/.ollama
    deploy:
      resources:
        reservations:
          devices:
            - driver: nvidia
              count: 1
              capabilities: [gpu]

  webui:
    image: ghcr.io/open-webui/open-webui:main
    ports:
      - "3000:8080"
    environment:
      - OLLAMA_BASE_URL=http://ollama:11434
    depends_on:
      - ollama

  qdrant:
    image: qdrant/qdrant
    ports:
      - "6333:6333"
    volumes:
      - qdrant-data:/qdrant/storage

volumes:
  ollama-data:
  qdrant-data:

然后一条命令启动全部服务:

docker-compose up -d

五、实战:搭建一个本地代码助手

把以上工具串起来,你可以拥有一个完全本地、完全私有的 AI 编程助手。

在这里插入图片描述

5.1 在 VS Code 中配置本地模型

  1. 安装 VS Code 插件:Continue.devCline
  2. 在插件设置中添加本地 API:
    • Provider: Ollama
    • API Base URL: http://localhost:11434
    • Model: deepseek-r1:7b
  3. 在代码编辑器中按 Ctrl+L(Continue)或 Ctrl+Shift+L(Cline)呼出 AI 助手
  4. 选中代码 → 右键 “Explain” / “Refactor” / “Generate Tests”

5.2 本地知识库(RAG)

结合 Qdrant + Embedding + Ollama,可以搭建个人知识库:

# 伪代码示意
from qdrant_client import QdrantClient
import requests

# 1. 把文档切分成片段,生成 Embedding,存入 Qdrant
# 2. 提问时,先把问题转成 Embedding,去 Qdrant 检索相关片段
# 3. 把检索到的片段 + 原始问题一起发给 Ollama
# 4. Ollama 基于上下文生成回答

这样你的 AI 就能回答基于你个人/公司文档的问题了,而且数据完全不出本机。


六、性能优化技巧

6.1 量化模型选择

量化级别 精度损失 速度 显存占用 适用场景
Q4_K_M 中等 最低 日常问答、代码辅助
Q8_0 中等 中等 需要更高精度的推理
FP16 最高 研究、高精度需求

6.2 GPU 加速

有 NVIDIA 显卡的话,Ollama 和 LM Studio 会自动调用 CUDA 加速。验证是否生效:

# 查看 Ollama 是否使用了 GPU
ollama ps
# 如果有 GPU 列显示,说明正在使用显卡加速

6.3 内存不足时的方案

如果内存不够跑 7B 模型:

  1. 选择更小的模型(如 Qwen2.5-3B、Phi-3-mini)
  2. 使用 Q4 量化而不是 Q8
  3. 关闭其他占用内存的应用
  4. 增加虚拟内存(Windows 设置 → 系统 → 关于 → 高级系统设置 → 性能 → 高级 → 虚拟内存)

七、常见问题 FAQ

Q: 本地模型和在线 API 差距大吗?
A: 7B 级别模型在日常问答、代码辅助、文档总结等场景已经够用。复杂推理、创意写作还是 GPT-4o/Claude 更强,但本地模型胜在隐私和成本。

Q: Mac 能用吗?
A: Ollama 和 LM Studio 都支持 macOS,M 系列芯片还有专门的 Metal 加速版本。

Q: 模型文件太大,有没有更好的下载方式?
A: 用迅雷或 IDM 多线程下载 Hugging Face 模型,或者使用国内的 ModelScope 镜像站。

Q: 可以和 Cursor/TRAE 这些 AI IDE 配合用吗?
A: 可以。Cursor 支持自定义模型接入,把 Ollama 的 API 地址填进去即可。TRAE 目前主要用自己的模型,暂不支持自定义。


八、总结

本地 AI 部署已经不是"极客玩具",而是开发者提升效率的实用方案。本文的 Ollama + LM Studio + Docker 组合覆盖了从入门到进阶的完整路径:

  • Ollama:命令行快速跑模型,适合自动化脚本和 API 集成
  • LM Studio:图形界面友好,适合日常对话和参数调试
  • Docker:容器化部署复杂服务,适合搭建知识库、RAG 系统等

全套工具均为免费开源,跟着本文 30 分钟即可搭好环境。


相关资源:

需要本文涉及的安装包(Git、Node.js、VS Code、Docker、Ollama、LM Studio 等)的离线安装包和一键配置脚本?私信回复"本地AI"获取完整工具包。


标签: Ollama LMStudio 本地AI Docker 大模型部署 开发者工具 RAG

话题: #AI部署 #本地大模型 #Docker #Ollama #开发者效率

更多推荐