告别Token焦虑!Linux + Ollama 本地部署大模型完全指南(零成本,无限Token,3步搞定)

适用系统:Ubuntu 20.04/22.04、CentOS 7/8、Debian 11+
难度:⭐⭐☆☆☆(零基础可跟)
阅读时间:约 12 分钟
你将获得:从安装到生产环境部署的完整链路 + 常见坑 + 性能调优


一、为什么本地部署是目前最香的方案?

2024-2025 年,大模型 API 的价格战打了两年,但核心痛点始终没解决:

痛点云 API(OpenAI / Claude / 通义)本地 Ollama
Token 费用按量计费,重度使用月费轻松破千0 元,跑在你自己服务器上
Token 上限有 context window 限制,超出就截断自己设,想给多少给多少
速率限制429 Too Many Requests,排队等无限制,机器不卡就是没限
数据隐私数据过云端,合规风险数据不出局域网
网络依赖必须能访问外网(国内还需梯子)纯离线可跑

一句话总结:你的服务器就是无限 Token 永动机,电费都算不上成本。

而且 Ollama 的安装体验,比 yum install nginx 还简单。下面直接上手。


二、硬件准备:到底需要多少配置?

别被"大模型"三个字吓到,现在量化模型对硬件的要求已经非常亲民:

模型参数量量化最低显存/内存推荐显存推理速度(A10/4090)
llama3.1:8b8Bq4_K_M6 GB8 GB~30 tok/s
llama3.1:70b70Bq4_K_M40 GB48 GB+~8 tok/s
qwen2.5:72b72Bq4_K_M44 GB48 GB+~6 tok/s
mistral:24b24Bq4_K_M14 GB16 GB~18 tok/s
deepseek-r1:14b14Bq4_K_M10 GB12 GB~22 tok/s

没有 GPU 能跑吗? 能。纯 CPU 跑 7B~14B 的 q4 量化模型,大概 3-8 tok/s,慢但能用。有 16G 内存的机器就能跑 8B 模型。

实操建议:开发调试用 8B 起步,生产环境上 14B~32B,预算充足直接 70B+。


三、环境安装(3 步搞定)

Step 1:一键安装 Ollama

# 官方一键脚本(支持 Ubuntu/Debian/CentOS/RHEL/Arch)
curl -fsSL https://ollama.com/install.sh | sh

更多推荐