Ollama本地部署大模型完全指南:从下载到API调用的完整教程
·
Ollama本地部署大模型完全指南
为什么要在本地部署大模型?
- 数据安全:敏感数据不出门
- 零延迟:无需网络请求
- 无限调用:没有API限额
- 成本可控:一次性硬件投入
安装Ollama
macOS / Linux
curl -fsSL https://ollama.com/install.sh | sh
Windows
直接从官网 https://ollama.com 下载安装包。
Docker部署
docker run -d --name ollama \
-v ollama:/root/.ollama \
-p 11434:11434 \
ollama/ollama
模型管理
下载模型
# 基本用法
ollama pull llama3
# 常用推荐模型
ollama pull llama3 # Meta Llama 3 8B
ollama pull qwen2 # 通义千问2 7B
ollama pull mistral # Mistral 7B
ollama pull llama3-chinese # 中文优化版
ollama pull deepseek-coder # 代码专用
查看已有模型
ollama list
删除模型
ollama rm llama3
使用Ollama
命令行对话
# 直接对话
ollama run qwen2
# 单条指令
ollama run qwen2 "用Python写一个快速排序算法"
API调用
Ollama启动后会自动在11434端口提供REST API:
# Chat API
curl http://localhost:11434/api/chat \
-d '{
"model": "qwen2",
"messages": [
{"role": "user", "content": "你好,请介绍一下自己"}
],
"stream": false
}'
使用OpenAI兼容接口
from openai import OpenAI
client = OpenAI(
base_url="http://localhost:11434/v1",
api_key="ollama" # 随便填
)
response = client.chat.completions.create(
model="qwen2",
messages=[{"role": "user", "content": "你好"}]
)
print(response.choices[0].message.content)
创建自定义模型
Modelfile
# 基础模型
FROM qwen2
# 设置系统提示词
SYSTEM """你是AI编程助手,专注于帮助开发者解决问题。
回答要简洁准确,必要时提供代码示例。"""
# 设置参数
PARAMETER temperature 0.3
PARAMETER top_p 0.9
# 创建自定义模型
ollama create my-coding-assistant -f ./Modelfile
# 使用
ollama run my-coding-assistant
性能优化
GPU加速
# 检查是否启用GPU
ollama run llama3 "Hello" --verbose
# 如果支持GPU,输出中会显示"gpu"
量化模型
# 使用量化版本减少内存占用
ollama pull llama3:7b-q4_0 # 4bit量化
ollama pull qwen2:7b-q4_K_M # K_M量化
多模型并发
# 通过Docker Compose启动多个实例
services:
ollama-coder:
image: ollama/ollama
ports:
- "11434:11434"
volumes:
- ollama-coder:/root/.ollama
ollama-chat:
image: ollama/ollama
ports:
- "11435:11434"
volumes:
- ollama-chat:/root/.ollama
常见问题
Q: 内存不够怎么办?
A: 使用量化模型(Q4/Q8),或选择更小的模型(3B/7B)。
Q: 推理速度慢?
A: 确保GPU加速已启用,可以考虑使用vLLM等推理框架。
Q: 中文效果不好?
A: 推荐使用Qwen2、Yi等中文优化模型。
总结
Ollama让"每个人都能运行大模型"成为现实。从个人学习到企业级私有化部署,Ollama都提供了简便的解决方案。
更多推荐


所有评论(0)