从零搭建本地AI开发环境:Ollama + LM Studio + Docker 实战指南
从零搭建本地AI开发环境:Ollama + LM Studio + Docker 实战指南
发布时间: 2026-08-07
适合人群: 有一定开发基础,想在本地跑 AI 模型的开发者
预计耗时: 跟着本文操作约 30 分钟完成环境搭建
为什么要本地部署 AI?
作为开发者,你可能已经用惯了 ChatGPT、DeepSeek 这些在线服务。但本地部署 AI 模型有它不可替代的价值:
- 隐私安全:敏感代码、公司内部文档不上云
- 离线可用:出差、会议、没网的时候照样能用
- 成本控制:高频调用 API 的费用,本地跑一次只花电费
- 深度定制:换模型、调参数、接自己的工作流,完全自主
本文手把手教你用 Ollama(命令行)+ LM Studio(图形界面)+ Docker(容器化)搭建一套完整的本地 AI 开发环境。

一、环境准备
硬件要求
运行 7B 参数级别的模型(如 Qwen2.5-7B、DeepSeek-R1-7B),建议配置:
| 配置项 | 最低要求 | 推荐配置 |
|---|---|---|
| 内存 | 16GB | 32GB |
| 显存 | 集成显卡可用 | 8GB+ 独立显卡(NVIDIA) |
| 硬盘空间 | 20GB 可用 | 50GB+ SSD |
| 操作系统 | Windows 10/11 64位 | Windows 11 64位 |
亲测:16GB 内存 + 核显的笔记本跑 Qwen2.5-7B-Q4_K_M(量化后约 5.3GB),响应速度可接受,日常问答和代码辅助没问题。
前置软件
需要提前安装以下工具(均为免费):
| 工具 | 用途 | 下载地址 |
|---|---|---|
| Git | 版本控制、克隆仓库 | https://git-scm.com/download/win |
| Node.js 18+ | 运行基于 Node 的 AI 工具 | https://nodejs.org/zh-cn/download/ |
| VS Code | 代码编辑、AI 编程插件 | https://code.visualstudio.com/Download |
| Docker Desktop | 容器化部署 AI 服务 | https://www.docker.com/products/docker-desktop/ |
二、Ollama:命令行跑模型的首选
2.1 安装 Ollama
# 官网下载安装包(约 1.4GB)
# https://ollama.com/download
# 安装完成后,在 PowerShell/Git Bash 验证
ollama --version
# 输出类似:ollama version 0.5.12
2.2 拉取并运行模型

# 拉取 DeepSeek-R1 7B 蒸馏版(推理能力强)
ollama pull deepseek-r1:7b
# 拉取 Qwen2.5 7B(中文理解好)
ollama pull qwen2.5:7b
# 拉取 Qwen3.5 9B(阿里最新开源)
ollama pull qwen3.5:9b
# 运行模型,进入交互模式
ollama run deepseek-r1:7b
2.3 常用命令速查
# 列出已下载的模型
ollama list
# 删除某个模型(释放空间)
ollama rm qwen2.5:7b
# 查看模型信息
ollama show deepseek-r1:7b
# 后台运行模型服务(供 API 调用)
ollama serve
2.4 通过 API 调用本地模型
Ollama 启动后会自动暴露 REST API(默认端口 11434):

# 测试 API 是否可用
curl http://localhost:11434/api/generate -d '{
"model": "deepseek-r1:7b",
"prompt": "用 Python 写一个快速排序算法"
}'
这样你就可以把本地模型接入自己的应用、脚本或 VS Code 插件中了。

三、LM Studio:图形化管理模型
如果你不喜欢命令行,LM Studio 提供了完整的图形界面,操作更直观。

3.1 安装 LM Studio
- 访问 https://lmstudio.ai 下载安装包(约 589MB)
- 双击安装,按向导完成
- 启动后界面如下(文字描述):
- 左侧:模型列表、聊天历史
- 中间:对话区域
- 右侧:模型参数调整(Temperature、Top-P 等)
3.2 导入 .gguf 模型文件
LM Studio 支持直接从 Hugging Face 下载,也支持导入本地 .gguf 文件:

- 点击左侧 “My Models”
- 点击 “+” 或 “Import Model”
- 选择本地的
.gguf文件 - 加载完成后即可开始对话
3.3 推荐模型文件
| 模型文件 | 参数规模 | 量化格式 | 大小 | 特点 |
|---|---|---|---|---|
| DeepSeek-R1-Distill-Qwen-7B-Q8_0.gguf | 7B | Q8_0 | 7.6GB | 推理能力强,数学和代码优秀 |
| Qwen3.5-9B-Q4_K_M.gguf | 9B | Q4_K_M | 5.3GB | 阿里最新开源,中文理解强 |
| Qwen2.5-7B-Instruct-Q8_0.gguf | 7B | Q8_0 | 7.6GB | 指令遵循能力强,通用场景首选 |
下载来源:https://huggingface.co(可用迅雷或 IDM 加速下载)

3.4 配置本地 API 服务
LM Studio 也可以当成本地 API 服务器用:

- 点击右下角的 “Start Server”
- 默认端口是 1234
- 用以下方式调用:
curl http://localhost:1234/v1/chat/completions -H "Content-Type: application/json" -d '{
"model": "deepseek-r1-7b",
"messages": [{"role": "user", "content": "你好"}]
}'
四、Docker:容器化部署更复杂的服务
对于需要运行多个 AI 服务(如 Embedding 模型、向量数据库、RAG 系统)的场景,Docker 是最佳方案。
4.1 安装 Docker Desktop
- 下载安装包(约 544MB)
- 安装时勾选 “Use WSL 2 instead of Hyper-V”(Windows 推荐)
- 安装完成后重启电脑
- 启动 Docker Desktop,等左下角显示 “Engine running”
4.2 一键部署常用 AI 服务
# 部署 Ollama + WebUI(带网页界面的 Ollama)
docker run -d -p 3000:8080 --gpus all --name ollama-webui -v ollama:/root/.ollama -v open-webui:/app/backend/data ghcr.io/open-webui/open-webui:ollama
# 部署向量数据库(用于 RAG)
docker run -d -p 6333:6333 --name qdrant qdrant/qdrant
# 部署本地 Embedding 服务
docker run -d -p 8000:8000 --name embedding-api ghcr.io/huggingface/text-embeddings-inference:cpu-latest --model-id BAAI/bge-large-zh-v1.5
4.3 Docker Compose 配置示例
创建一个 docker-compose.yml:
version: '3.8'
services:
ollama:
image: ollama/ollama
ports:
- "11434:11434"
volumes:
- ollama-data:/root/.ollama
deploy:
resources:
reservations:
devices:
- driver: nvidia
count: 1
capabilities: [gpu]
webui:
image: ghcr.io/open-webui/open-webui:main
ports:
- "3000:8080"
environment:
- OLLAMA_BASE_URL=http://ollama:11434
depends_on:
- ollama
qdrant:
image: qdrant/qdrant
ports:
- "6333:6333"
volumes:
- qdrant-data:/qdrant/storage
volumes:
ollama-data:
qdrant-data:
然后一条命令启动全部服务:
docker-compose up -d
五、实战:搭建一个本地代码助手
把以上工具串起来,你可以拥有一个完全本地、完全私有的 AI 编程助手。

5.1 在 VS Code 中配置本地模型
- 安装 VS Code 插件:Continue.dev 或 Cline
- 在插件设置中添加本地 API:
- Provider: Ollama
- API Base URL:
http://localhost:11434 - Model:
deepseek-r1:7b
- 在代码编辑器中按
Ctrl+L(Continue)或Ctrl+Shift+L(Cline)呼出 AI 助手 - 选中代码 → 右键 “Explain” / “Refactor” / “Generate Tests”
5.2 本地知识库(RAG)
结合 Qdrant + Embedding + Ollama,可以搭建个人知识库:
# 伪代码示意
from qdrant_client import QdrantClient
import requests
# 1. 把文档切分成片段,生成 Embedding,存入 Qdrant
# 2. 提问时,先把问题转成 Embedding,去 Qdrant 检索相关片段
# 3. 把检索到的片段 + 原始问题一起发给 Ollama
# 4. Ollama 基于上下文生成回答
这样你的 AI 就能回答基于你个人/公司文档的问题了,而且数据完全不出本机。
六、性能优化技巧
6.1 量化模型选择
| 量化级别 | 精度损失 | 速度 | 显存占用 | 适用场景 |
|---|---|---|---|---|
| Q4_K_M | 中等 | 快 | 最低 | 日常问答、代码辅助 |
| Q8_0 | 低 | 中等 | 中等 | 需要更高精度的推理 |
| FP16 | 无 | 慢 | 最高 | 研究、高精度需求 |
6.2 GPU 加速
有 NVIDIA 显卡的话,Ollama 和 LM Studio 会自动调用 CUDA 加速。验证是否生效:
# 查看 Ollama 是否使用了 GPU
ollama ps
# 如果有 GPU 列显示,说明正在使用显卡加速
6.3 内存不足时的方案
如果内存不够跑 7B 模型:
- 选择更小的模型(如 Qwen2.5-3B、Phi-3-mini)
- 使用 Q4 量化而不是 Q8
- 关闭其他占用内存的应用
- 增加虚拟内存(Windows 设置 → 系统 → 关于 → 高级系统设置 → 性能 → 高级 → 虚拟内存)
七、常见问题 FAQ
Q: 本地模型和在线 API 差距大吗?
A: 7B 级别模型在日常问答、代码辅助、文档总结等场景已经够用。复杂推理、创意写作还是 GPT-4o/Claude 更强,但本地模型胜在隐私和成本。
Q: Mac 能用吗?
A: Ollama 和 LM Studio 都支持 macOS,M 系列芯片还有专门的 Metal 加速版本。
Q: 模型文件太大,有没有更好的下载方式?
A: 用迅雷或 IDM 多线程下载 Hugging Face 模型,或者使用国内的 ModelScope 镜像站。
Q: 可以和 Cursor/TRAE 这些 AI IDE 配合用吗?
A: 可以。Cursor 支持自定义模型接入,把 Ollama 的 API 地址填进去即可。TRAE 目前主要用自己的模型,暂不支持自定义。
八、总结
本地 AI 部署已经不是"极客玩具",而是开发者提升效率的实用方案。本文的 Ollama + LM Studio + Docker 组合覆盖了从入门到进阶的完整路径:
- Ollama:命令行快速跑模型,适合自动化脚本和 API 集成
- LM Studio:图形界面友好,适合日常对话和参数调试
- Docker:容器化部署复杂服务,适合搭建知识库、RAG 系统等
全套工具均为免费开源,跟着本文 30 分钟即可搭好环境。
相关资源:
需要本文涉及的安装包(Git、Node.js、VS Code、Docker、Ollama、LM Studio 等)的离线安装包和一键配置脚本?私信回复"本地AI"获取完整工具包。
标签: Ollama LMStudio 本地AI Docker 大模型部署 开发者工具 RAG
话题: #AI部署 #本地大模型 #Docker #Ollama #开发者效率
更多推荐
所有评论(0)