Ollama本地部署大模型完全指南

为什么要在本地部署大模型?

  1. 数据安全:敏感数据不出门
  2. 零延迟:无需网络请求
  3. 无限调用:没有API限额
  4. 成本可控:一次性硬件投入

安装Ollama

macOS / Linux

curl -fsSL https://ollama.com/install.sh | sh

Windows

直接从官网 https://ollama.com 下载安装包。

Docker部署

docker run -d --name ollama \
  -v ollama:/root/.ollama \
  -p 11434:11434 \
  ollama/ollama

模型管理

下载模型

# 基本用法
ollama pull llama3

# 常用推荐模型
ollama pull llama3          # Meta Llama 3 8B
ollama pull qwen2           # 通义千问2 7B
ollama pull mistral         # Mistral 7B
ollama pull llama3-chinese  # 中文优化版
ollama pull deepseek-coder  # 代码专用

查看已有模型

ollama list

删除模型

ollama rm llama3

使用Ollama

命令行对话

# 直接对话
ollama run qwen2

# 单条指令
ollama run qwen2 "用Python写一个快速排序算法"

API调用

Ollama启动后会自动在11434端口提供REST API:

# Chat API
curl http://localhost:11434/api/chat \
  -d '{
    "model": "qwen2",
    "messages": [
      {"role": "user", "content": "你好,请介绍一下自己"}
    ],
    "stream": false
  }'

使用OpenAI兼容接口

from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:11434/v1",
    api_key="ollama"  # 随便填
)

response = client.chat.completions.create(
    model="qwen2",
    messages=[{"role": "user", "content": "你好"}]
)
print(response.choices[0].message.content)

创建自定义模型

Modelfile

# 基础模型
FROM qwen2

# 设置系统提示词
SYSTEM """你是AI编程助手,专注于帮助开发者解决问题。
回答要简洁准确,必要时提供代码示例。"""

# 设置参数
PARAMETER temperature 0.3
PARAMETER top_p 0.9
# 创建自定义模型
ollama create my-coding-assistant -f ./Modelfile

# 使用
ollama run my-coding-assistant

性能优化

GPU加速

# 检查是否启用GPU
ollama run llama3 "Hello" --verbose

# 如果支持GPU,输出中会显示"gpu"

量化模型

# 使用量化版本减少内存占用
ollama pull llama3:7b-q4_0  # 4bit量化
ollama pull qwen2:7b-q4_K_M # K_M量化

多模型并发

# 通过Docker Compose启动多个实例
services:
  ollama-coder:
    image: ollama/ollama
    ports:
      - "11434:11434"
    volumes:
      - ollama-coder:/root/.ollama
  
  ollama-chat:
    image: ollama/ollama
    ports:
      - "11435:11434"
    volumes:
      - ollama-chat:/root/.ollama

常见问题

Q: 内存不够怎么办?
A: 使用量化模型(Q4/Q8),或选择更小的模型(3B/7B)。

Q: 推理速度慢?
A: 确保GPU加速已启用,可以考虑使用vLLM等推理框架。

Q: 中文效果不好?
A: 推荐使用Qwen2、Yi等中文优化模型。

总结

Ollama让"每个人都能运行大模型"成为现实。从个人学习到企业级私有化部署,Ollama都提供了简便的解决方案。

更多推荐