【Day3 保姆级实操】Ollama 一键安装教程,零基础 3 分钟完成本地大模型部署,零踩坑
【Day3 保姆级实操】Ollama 一键安装教程,零基础 3 分钟完成本地大模型部署,零踩坑
大家好,我是你们的 AI 大模型入门导师。今天是我们 "零基础学 AI 大模型避坑指南" 系列的第三天。前两天我们聊了 AI 大模型的学习路线和各种坑,很多同学在评论区说:"道理我都懂,但我就是想先跑起来一个模型看看!"
没问题,今天这篇文章就是为你们准备的。我敢保证,哪怕你连 Python 都不会写,哪怕你从来没接触过命令行,只要跟着我一步步来,3 分钟之内,你就能在自己的电脑上跑起来一个真正的大语言模型。而且全程零成本、零翻墙、零复杂配置,真正的一键部署。
为什么我强烈推荐新手从 Ollama 开始?
在讲具体步骤之前,我必须先跟大家说清楚,为什么在众多本地大模型部署工具中,我只推荐 Ollama 给零基础的同学。
我见过太多新手,一开始就被各种复杂的工具劝退了。有人去装 Transformers 库,结果卡在 CUDA 版本不兼容;有人去用 Text Generation WebUI,光是安装依赖就花了一下午,还各种报错;还有人去下载几十 GB 的模型文件,结果发现自己的显卡根本带不动。
Ollama 的出现,彻底改变了这个局面。它就像是大模型界的 "Steam 平台",你只需要输入一行命令,它就会自动帮你下载模型、配置环境、启动服务。所有的复杂细节都被隐藏在了背后,你只需要关心 "我想用哪个模型" 就够了。
我给大家做个对比,你就知道 Ollama 有多香了:
表格
| 部署方式 | 安装复杂度 | 模型管理 | 启动速度 | 新手友好度 |
|---|---|---|---|---|
| 原生 Transformers | ★★★★★ | 手动管理 | 慢 | ★☆☆☆☆ |
| Text Generation WebUI | ★★★★☆ | 较复杂 | 中等 | ★★☆☆☆ |
| LM Studio | ★★☆☆☆ | 图形界面 | 较快 | ★★★☆☆ |
| Ollama | ★☆☆☆☆ | 一行命令 | 极快 | ★★★★★ |
更重要的是,Ollama 的生态已经非常成熟了。现在几乎所有主流的开源大模型,都有官方的 Ollama 版本。从 7B 的小模型到 70B 的大模型,从通用对话模型到代码模型、多模态模型,应有尽有。而且它还提供了标准的 API 接口,你可以很方便地把它集成到自己的应用里。
前置准备:先看看你的电脑够不够格
在开始安装之前,我们先花 30 秒检查一下你的电脑配置。很多人担心自己的电脑跑不动大模型,其实完全没必要。现在的开源大模型已经优化得非常好了,哪怕是没有独立显卡的笔记本,也能跑起来一些轻量级的模型。
最低配置要求
- 操作系统:Windows 10/11(需要开启 WSL2)、macOS 12+、任意 Linux 发行版
- 内存:至少 8GB(推荐 16GB 以上)
- 硬盘:至少 10GB 可用空间(模型文件会占用空间)
- 显卡:
- 没有独立显卡也能跑(纯 CPU 模式)
- NVIDIA 显卡:显存 4GB 以上(推荐 8GB 以上)
- AMD 显卡:显存 8GB 以上
- Apple Silicon:M1 及以上(强烈推荐,体验最好)
不同配置能跑什么模型?
我给大家整理了一个非常实用的对照表,你可以根据自己的电脑配置选择合适的模型:
表格
| 电脑配置 | 推荐模型 | 运行速度 | 体验评价 |
|---|---|---|---|
| 8GB 内存 + 无独显 | Qwen2:7B-instruct-q4_0 | 约 5-10 token/s | 能流畅对话,适合日常使用 |
| 16GB 内存 + 无独显 | Llama 3:8B-instruct-q4_0 | 约 10-15 token/s | 体验很好,接近 ChatGPT 3.5 |
| 16GB 内存 + RTX 3060 (6GB) | Llama 3:8B-instruct-q5_1 | 约 20-30 token/s | 非常流畅,响应迅速 |
| 32GB 内存 + RTX 3080 (10GB) | Llama 3:70B-instruct-q4_0 | 约 15-20 token/s | 顶级体验,能力接近 GPT-4 |
| Apple M1/M2(8GB) | Qwen2:7B-instruct-q4_0 | 约 15-20 token/s | 优化极好,发热低 |
| Apple M1 Pro/M2 Pro(16GB) | Llama 3:8B-instruct-q6_K | 约 30-40 token/s | 丝滑流畅,体验最佳 |
看到了吗?哪怕是最普通的办公笔记本,也能跑起来 7B 参数的模型。而且现在的量化技术已经非常成熟了,4-bit 量化的模型在能力上和原版几乎没有区别,但体积和显存占用却只有原来的 1/4。
第一步:一键安装 Ollama(真的只需要点一下)
好了,现在我们正式开始安装。我会分别讲解 Windows、Mac 和 Linux 三个平台的安装方法,每一个都是真正的一键安装。
Windows 系统安装步骤
- 打开 Ollama 的官方网站:https://ollama.com/
- 点击页面上的 "Download for Windows" 按钮
- 下载完成后,双击运行
OllamaSetup.exe安装程序 - 点击 "Install",等待几秒钟安装完成
- 点击 "Finish",Ollama 就会自动在后台运行了
注意:Windows 版本的 Ollama 会自动帮你安装和配置 WSL2。如果你之前没有开启过 WSL2,安装程序会提示你重启电脑。重启之后,安装会自动继续完成,不需要你做任何操作。
macOS 系统安装步骤
- 打开 Ollama 的官方网站:https://ollama.com/
- 点击页面上的 "Download for macOS" 按钮
- 下载完成后,打开
Ollama.dmg文件 - 将 Ollama 图标拖到 Applications 文件夹中
- 打开应用程序文件夹,双击运行 Ollama
- 第一次运行时会提示你输入密码,输入你的 Mac 登录密码即可
特别提示:对于 Apple Silicon 芯片的 Mac(M1/M2/M3 系列),Ollama 做了极致的优化,运行速度比同配置的 Windows 电脑快很多,而且几乎没有发热。这也是我最推荐用 Mac 来跑本地大模型的原因。
Linux 系统安装步骤
Linux 用户更简单了,只需要打开终端,输入一行命令:
bash
运行
curl -fsSL https://ollama.com/install.sh | sh
然后按回车键,等待脚本自动完成安装即可。这个脚本会自动检测你的 Linux 发行版,添加软件源,安装 Ollama 并配置系统服务。
第二步:运行你的第一个大模型(30 秒搞定)
安装完成后,我们就可以开始运行大模型了。这一步真的简单到离谱。
- 打开终端(Windows 用户可以用 PowerShell 或者 CMD,Mac 用户用终端,Linux 用户用你喜欢的终端)
- 输入以下命令,然后按回车键:
bash
运行
ollama run llama3
- 等待 Ollama 自动下载 Llama 3 模型
- 下载完成后,你就可以直接和大模型对话了!
就是这么简单!没有任何复杂的配置,没有任何环境变量要设置,没有任何依赖要安装。你只需要输入一行命令,剩下的事情 Ollama 全都帮你搞定了。
第一次运行会下载模型文件,Llama 3:8B 的 4-bit 量化版本大约是 4.7GB。下载速度取决于你的网络情况,一般几分钟就能下完。下载完成后,以后再运行就不需要重新下载了,直接秒开。
第三步:试试这些常用命令,玩转 Ollama
现在你已经成功跑起来了一个本地大模型。接下来我给大家介绍几个最常用的 Ollama 命令,掌握了这些,你就能玩转 Ollama 了。
1. 查看已安装的模型
bash
运行
ollama list
这个命令会列出你电脑上已经下载的所有模型,以及它们的大小和修改时间。
2. 运行其他模型
Ollama 支持几百种不同的模型,你只需要把上面命令中的llama3换成其他模型的名字就可以了。比如:
bash
运行
# 运行通义千问2(阿里出品,中文能力最强)
ollama run qwen2:7b
# 运行DeepSeek-Coder(代码能力最强)
ollama run deepseek-coder:6.7b
# 运行Llama 3:70B大模型(能力最强,需要32GB以上内存)
ollama run llama3:70b
# 运行多模态模型(可以看图说话)
ollama run llava:7b
你可以在 Ollama 的模型库(https://ollama.com/library)里找到所有可用的模型。
3. 删除不需要的模型
如果你下载了很多模型,硬盘空间不够用了,可以用这个命令删除不需要的模型:
bash
运行
ollama rm llama3
4. 查看 Ollama 版本
bash
运行
ollama --version
5. 退出对话
在对话界面中,输入/bye或者按Ctrl+D就可以退出了。
避坑指南:这些问题 90% 的新手都会遇到
虽然我说是零踩坑,但还是有一些小问题是新手经常会遇到的。我把它们都整理在这里了,如果你遇到了问题,直接来这里找答案就行。
坑 1:Windows 系统下载模型速度特别慢
问题描述:Windows 用户在下载模型的时候,速度只有几十 KB/s,甚至经常下载失败。
原因分析:这是因为 Ollama 的默认下载服务器在国外,国内访问速度比较慢。
解决方案:配置国内镜像源。
- 按下
Win+R,输入sysdm.cpl,打开系统属性 - 切换到 "高级" 选项卡,点击 "环境变量"
- 在 "系统变量" 中点击 "新建"
- 变量名输入:
OLLAMA_MODELS - 变量值输入:
https://ollama.winai.me - 点击确定保存,然后重启电脑
重启之后,再下载模型速度就会快很多了。
坑 2:模型运行特别慢,一卡一卡的
问题描述:模型能运行,但回复特别慢,一个字一个字地蹦。
原因分析:这通常是因为内存不够,或者 Ollama 没有使用你的独立显卡。
解决方案:
- 关闭电脑上其他占用内存的程序(浏览器、微信、QQ 等)
- 尝试运行更小的模型(比如把 llama3 换成 qwen2:7b)
- 对于 NVIDIA 显卡用户,确保你已经安装了最新的 NVIDIA 驱动
- 检查 Ollama 是否识别到了你的显卡:
bash
运行
在输出的信息中,如果你看到 "GPU" 那一行有数字,就说明显卡已经被正确使用了。ollama run llama3 # 然后输入: /info
坑 3:Windows 系统提示 "WSL 2 安装失败"
问题描述:在安装 Ollama 的时候,提示 "WSL 2 安装失败" 或者 "需要启用虚拟机平台"。
解决方案:手动开启 WSL 2 功能。
- 按下
Win+X,选择 "Windows 终端 (管理员)" - 输入以下命令:
bash
运行
wsl --install - 等待命令执行完成,然后重启电脑
- 重启之后,重新运行 Ollama 安装程序
坑 4:Mac 系统提示 "无法打开,因为无法验证开发者"
问题描述:在运行 Ollama 的时候,提示 "无法打开 Ollama,因为无法验证开发者"。
解决方案:
- 打开 "系统设置"
- 点击 "隐私与安全性"
- 往下拉,找到 "安全性" 部分
- 你会看到 "已阻止使用 'Ollama',因为来自身份不明的开发者"
- 点击 "仍要打开",然后输入你的密码即可
进阶玩法:让你的本地大模型更好用
现在你已经掌握了 Ollama 的基本用法。但这只是开始,Ollama 还有很多强大的功能等着你去探索。
1. 给大模型设置自定义角色
你可以通过 Modelfile 来创建自定义的模型角色。比如,你可以创建一个专门写代码的助手,或者一个专门教英语的老师。
举个例子,创建一个 "Python 编程专家":
- 新建一个文本文件,命名为
Modelfile - 写入以下内容:
plaintext
FROM llama3 SYSTEM "你是一位经验丰富的Python编程专家。你擅长用简单易懂的语言解释复杂的编程概念,能够写出清晰、规范、高效的Python代码。当用户问你编程问题时,你会先给出简洁的答案,然后提供详细的代码示例和解释。" PARAMETER temperature 0.3 PARAMETER top_p 0.9 - 保存文件,然后在终端中运行:
bash
运行
ollama create python-expert -f Modelfile - 现在你就可以运行这个自定义模型了:
bash
运行
ollama run python-expert
2. 使用图形界面对话
虽然命令行界面很简洁,但对于大多数人来说,还是图形界面用起来更舒服。Ollama 有很多优秀的第三方前端界面,我给大家推荐几个:
- Open WebUI:功能最全面的前端界面,支持对话历史、模型切换、多模态、插件系统等,几乎和 ChatGPT 一模一样。
- ChatOllama:轻量级的前端界面,界面简洁,运行速度快。
- Lobe Chat:设计非常精美的前端界面,支持语音输入和输出。
安装这些前端界面也非常简单,大多数都提供了 Docker 一键部署的方式。比如安装 Open WebUI,只需要一行命令:
bash
运行
docker run -d -p 3000:3000 -v open-webui:/app/backend/data --name open-webui --restart always ghcr.io/open-webui/open-webui:main
然后在浏览器中打开http://localhost:3000就可以使用了。
3. 调用 Ollama API 开发自己的应用
Ollama 提供了标准的 RESTful API 接口,你可以很方便地把它集成到自己的应用里。比如,你可以用 Python 写一个简单的聊天机器人:
python
运行
import requests
def chat_with_ollama(prompt):
url = "http://localhost:11434/api/generate"
data = {
"model": "llama3",
"prompt": prompt,
"stream": False
}
response = requests.post(url, json=data)
return response.json()["response"]
# 测试
while True:
user_input = input("你:")
if user_input.lower() in ["退出", "bye", "再见"]:
break
response = chat_with_ollama(user_input)
print("Ollama:", response)
写在最后:本地大模型的意义是什么?
很多人会问:"现在有那么多免费的在线大模型可以用,我为什么还要费劲在本地跑一个呢?"
这个问题问得非常好。我认为本地大模型最大的优势有三个:
第一,绝对的隐私安全。你和大模型的所有对话都只保存在你的电脑上,不会上传到任何服务器。你可以放心地让它处理你的私人文件、工作文档、商业机密,不用担心数据泄露的问题。
第二,完全的控制权。你可以根据自己的需求微调模型,设置任何你想要的角色和规则,不会有任何内容限制。你想让它做什么,它就做什么。
第三,无限的可能性。你可以把本地大模型集成到任何你能想到的应用里。比如,你可以做一个本地的文档助手,帮你总结和分析电脑上的所有文件;你可以做一个本地的代码助手,帮你写代码和调试;你甚至可以做一个完全离线的智能家居控制中心。
这才是 AI 真正的魅力所在 —— 它不再是少数科技公司掌握的黑盒子,而是每个人都能拥有和控制的工具。
如果这篇文章对你有帮助,别忘了点赞👍、收藏⭐、关注我! 我会持续更新这个 "零基础学 AI 大模型避坑指南" 系列,带你从一个完全的小白,一步步成长为 AI 大模型高手。
有任何问题都可以在评论区留言,我会一一回复。我们下一篇文章见!
更多推荐



所有评论(0)