本地部署大模型实战:Ollama 跑通 DeepSeek-R1 和 Qwen2.5,显存不够也能玩
本地部署大模型实战:Ollama 跑通 DeepSeek-R1 和 Qwen2.5,显存不够也能玩
不想把对话记录发给云端、想离线用大模型、或者单纯想折腾——本地部署是 2025 年以来最热的方向之一。这篇文章用 Ollama 从零跑通,含显存不够的解决方案和常见报错。
前言
2025 年 DeepSeek 火出圈之后,本地部署大模型就成了很多人的新玩具。说实话,本地跑 7B 级别的小模型,能力比不上云端的满血版,但它有云上给不了的三个好处:免费、隐私、离线。数据不出本机,断网也能用,这在有些场景下是刚需。
我前后折腾了两三天,把 Ollama 从装到用、再到显存不够怎么救,全部捋清楚了。这篇文章全程实操,照着敲就行。

一、Ollama 是什么,怎么装
Ollama 是目前最流行的本地大模型运行工具,没有之一。它的厉害之处在于:装一个软件,一行命令就能跑各种开源模型,不用你手动配 Python、配 CUDA、调参。底层自动做模型量化加载、显存管理,对普通用户极其友好。
安装超级简单:
- 打开官网
https://ollama.com,下载 Windows 安装包(.exe); - 双击安装,一路下一步,装完它会在后台自动运行一个服务;
- 验证是否装好,Win+R 打开 cmd:
ollama --version
能输出版本号就 OK 了。如果提示"不是内部或外部命令",多半是没装成功或者没重开终端,重装一次,或者重启电脑。

二、拉取模型:一行命令跑起来
装完 Ollama 之后,跑模型只需要一条命令:
ollama run deepseek-r1:7b
第一次运行会自动下载模型(几个 G,取决于网速),下完自动进入对话模式,直接输入文字就能聊,输入 /bye 退出。
不想下 DeepSeek 的话,这几款都值得试:
| 模型 | 命令 | 特点 |
|---|---|---|
| DeepSeek-R1 蒸馏版 | ollama run deepseek-r1:7b | 推理能力强,会展示思考过程,中文好 |
| Qwen2.5 | ollama run qwen2.5:7b | 通义千问,中文最强之一,日常对话首选 |
| Llama 3.1 | ollama run llama3.1:8b | Meta 出品,英文强 |
| 轻量级 | ollama run qwen2.5:3b | 配置低的电脑也能跑 |
想看看自己机器里有哪些模型、删除模型,用这两个命令:
ollama list # 列出已下载的模型
ollama rm 模型名 # 删除某个模型
运行验证:ollama run qwen2.5:7b 能进入对话并回答中文问题;ollama list 能看到已下载的模型;退出对话后 ollama serve 服务仍在(http://localhost:11434 可访问)——部署即成功。回答很慢或报错,按第三节"显存不够怎么办"换小模型。
三、显存不够怎么办(重点,先看这节)
很多人卡在这一步:模型下完了,一跑就报 CUDA out of memory 或者龟速。
先说结论:7B 模型量化版大约需要 5-6G 显存,12G 显存跑 7B 很舒服,8G 能跑但有点紧。如果你的显卡只有 4-6G 显存,别慌,有救:
方案 1:选更小的量化版本
模型名后面的 :7b 是参数量,还有更小的:
ollama run deepseek-r1:1.5b # 1.5B,2G 显存就能跑,速度飞快
ollama run qwen2.5:3b # 3B,3-4G 显存
另外同一参数量的模型还有不同的量化档位(q4、q8 等),默认就是平衡版,一般不用手动指定。
方案 2:让模型用 CPU 跑(慢但能跑)
把 OLLAMA_NUM_GPU 环境变量设成 0,Ollama 就会退回到 CPU 计算:
setx OLLAMA_NUM_GPU 0
重启终端生效。CPU 跑 7B 模型大概每秒几个 token,属于"能聊天但别急"的水平,至少比报错强。
方案 3:把模型放到其他盘(C 盘空间不够时)
模型默认下载到 C 盘,C 盘紧张的朋友设置一下:
setx OLLAMA_MODELS D:\ollama_models
设完重启电脑(或者重启 ollama 服务),再重新拉模型,就会下载到 D 盘了。
方案 4:双卡 / 内存共享
Win 11 支持把显存不足的部分用内存顶上(设置 → 系统 → 显示 → 图形 → 默认图形设置,开启"硬件加速 GPU 调度"),或者直接调大虚拟内存。这个属于"能用但慢"的兜底方案,不推荐作为主力。
四、给 Ollama 加个好看的聊天界面(Open WebUI)
命令行聊天用久了眼睛疼,这里强烈推荐 Open WebUI——目前最流行的本地大模型聊天界面,界面和 ChatGPT 差不多,支持多模型切换、历史记录、联网搜索插件,还支持多用户。
Windows 上没有 Docker 的话,用 pip 装最简单:
pip install open-webui
open-webui serve
(如果你前面已经按深度学习教程装了 Miniconda,建议先 conda create -n webui python=3.11 -y && conda activate webui 再装,环境干净不容易出幺蛾子。)
启动成功后浏览器打开 http://localhost:8080:
- 第一次访问会让你注册一个账号(本地账号,数据只存在自己电脑上);
- 登录后在右上角或设置里选模型(你
ollama list里有的那些都会自动出现在列表里); - 选好模型直接聊,体验跟在线版几乎没有差别。
五、程序化调用:让 Ollama 变成你的"API 服务器"
这是本地部署最有价值的部分——模型跑起来之后,它就是一个本地 API 服务,默认监听 http://localhost:11434,任何程序都能调。
命令行验证一下:
curl http://localhost:11434/api/generate -d "{\"model\":\"qwen2.5:7b\",\"prompt\":\"用一句话介绍你自己\",\"stream\":false}"
还能直接用 OpenAI 兼容接口,很多现成的 AI 应用都能无缝切换成本地模型(把 base_url 指过来就行):
from openai import OpenAI
client = OpenAI(base_url="http://localhost:11434/v1", api_key="ollama")
resp = client.chat.completions.create(
model="qwen2.5:7b",
messages=[{"role": "user", "content": "你好"}],
)
print(resp.choices[0].message.content)
pip install openai 之后跑这个脚本,就能在自己的程序里用上本地大模型了。做笔记工具、写代码助手、个人知识库(RAG),都是从这一行开始的。
六、常见问题排查
| 问题 | 原因 | 解决 |
|---|---|---|
CUDA out of memory | 显存不够 | 换更小模型(:3b、:1.5b)或设 OLLAMA_NUM_GPU=0 退回 CPU |
| 模型下载到一半卡住 / 特别慢 | 网络问题 | 重试;开全局代理;换个时间下 |
| 提示 11434 端口被占用 | 之前有 ollama 实例 | 任务管理器结束 ollama 进程,或 ollama serve 手动重启 |
| C 盘被模型塞满 | 默认下载到 C 盘 | setx OLLAMA_MODELS D:\ollama_models 后重启,重新拉模型 |
| CPU 跑得比乌龟还慢 | 没走 GPU | 检查驱动;确认没设 OLLAMA_NUM_GPU=0;换小模型 |
| 中文回答质量差 | 模型本身原因 | 中文场景用 Qwen 系(qwen2.5),不要硬用英文模型 |
| 重启电脑后 ollama 不在了 | 服务没开机自启 | 设置 → 应用 → 启动,把 Ollama 打开;或用 ollama serve 手动起 |
七、总结
本地部署大模型没有想象中难,记住这条链路:
- 装 Ollama(一个安装包)→ ollama run 模型名(一行命令);
- 显存不够就换小模型 / 换量化版 / 退回 CPU;
- 想要好看界面装 Open WebUI,想要程序化调用直接用 11434 的 API。
进阶方向:等 7B 玩腻了,可以试试 vLLM 部署更大的模型、用 LangChain 做 RAG 知识库、或者把本地模型接进自己的自动化脚本里。本地模型的生态这两年爆发式增长,值得投入时间。
觉得有用记得点赞收藏,找不到了可就亏了;有问题评论区见,看到都会回。
更多推荐
所有评论(0)