本地大模型 + Ollama:什么场景该上私有化
《大模型实战》第 9/10 篇
上篇:Agent 安全
下篇预告:从 Demo 到生产
「数据不能出域」「API 账单扛不住」「内网离线也要用」——这三句话里只要命中两条,就该认真考虑本地大模型了。
但私有化不是「装个 Ollama 就完事」。2026 年的务实问题是:哪些链路该本地、哪些该留云端、硬件要买到什么程度、和现有 RAG/Agent 怎么接。
本篇给你决策树、运行时选型、模型推荐、混合路由和硬件参考。
你将学到
- 什么场景值得私有化,什么场景别硬上
- Ollama / vLLM / llama.cpp 怎么选
- Qwen / DeepSeek / Llama 系本地模型推荐
- 本地 RAG + Agent 最小方案
- 与云端模型的混合路由
- 硬件与性能预期
一、先结论:私有化是路由问题,不是信仰问题
适合本地 / 私有化
| 场景 | 原因 |
|---|---|
| L3/L4 机密数据进 Prompt | 合规、客户合同 |
| 高频、低延迟、可接受 7B~14B 质量 | 降本、内网 SLA |
| 离线环境(工厂、政务专网) | 无外网 |
| 开发调试、CI 门禁、代码补全 | 成本可控 |
| 敏感 Agent 工具链(读本地 DB) | 减少出域面 |
先别硬上本地
| 场景 | 更合适的做法 |
|---|---|
| 要强推理、长规划的多步 Agent | 云端旗舰 + 本地只做预处理 |
| 团队无人运维 GPU | 托管 API 或云 GPU |
| 要最新多模态(图/视频) | 云端,本地滞后 |
| 只有 CPU、又要 32K+ 长上下文 | 体验可能不可接受 |
一句话:本地模型解决「数据与成本」,云端模型解决「能力上限」。 混合路由才是常态。
二、运行时选型:Ollama / vLLM / llama.cpp
对比
| 运行时 | 定位 | 优点 | 缺点 |
|---|---|---|---|
| Ollama | 开箱即用、桌面到服务器 | 安装简单、模型库全、OpenAI 兼容 API | 高并发吞吐不如 vLLM |
| vLLM | 生产级推理服务 | 高吞吐、PagedAttention、多卡 | 运维门槛高 |
| llama.cpp | 极致轻量、CPU/Apple Silicon | 低资源、量化成熟 | 功能偏底层,要自己拼服务 |
怎么选
- 个人 / 小团队验证 → Ollama
- 线上多租户、QPS 高 → vLLM(或 TGI、SGLang 同类)
- 笔记本、NAS、无 GPU → llama.cpp + Q4/Q5 量化
- 已有 K8s GPU 池 → vLLM + 统一网关
Ollama 本地起服务后,很多框架可直接当 OpenAI 兼容端点:
curl http://localhost:11434/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model":"qwen2.5:14b","messages":[{"role":"user","content":"你好"}]}'
三、模型选择:Qwen / DeepSeek / Llama
2026 本地常用梯队(按场景,非榜单)
| 规模 | 推荐方向 | 适合 |
|---|---|---|
| 3B~8B | Qwen2.5、Llama 3.x、Gemma | 分类、抽取、简单 RAG |
| 14B~32B | Qwen2.5、DeepSeek、Llama | 主力对话、中等 Agent |
| 70B+ | Qwen、Llama、DeepSeek 量化版 | 强推理,需多卡或大显存 |
选型四问
- 中文占比高吗? → Qwen / DeepSeek 通常更省心
- 要 Tool Calling 吗? → 选官方标注支持 function calling 的版本
- 上下文要多长? → 看模型原生窗口,别只靠外推
- 量化能接受多少精度损失? → Q4 省显存,Q8 更稳
和云端的关系
本地 14B 不必和 GPT-4 级比「谁更聪明」,要比:
- 这条链路是否必须本地
- 质量是否够交付(用评测集测,别凭感觉)
- 延迟和成本是否更优
四、本地 RAG + Agent 最小方案
架构
用户
→ 网关(鉴权 / 路由)
→ 本地 Embedding(bge-m3 等)
→ 向量库(PGVector / Milvus / sqlite-vec)
→ 本地 LLM(Ollama)
→ (可选)本地 Tool:SQL / 文件 / 内网 API
组件建议
| 组件 | 本地常见选择 |
|---|---|
| Embedding | bge-m3、multilingual-e5 |
| 向量库 | PGVector(省事)、Milvus(规模大) |
| 编排 | LangChain / LlamaIndex / 自研 |
| Agent | 同一 OpenAI 兼容端点 + Tool schema |
注意点
- Embedding 和 LLM 可以不同进程,Embedding 常更轻
- 检索仍要做权限过滤(见第 3、8 篇)
- 本地 Agent 工具权限更要收紧——内网不等于安全
五、混合路由:本地与云端怎么分工
典型路由策略
请求
→ 敏感检测(PII / 机密标签)
→ 命中 → 本地模型
→ 任务分类(简单 / 复杂 / 需工具)
→ 简单 FAQ → 本地 8B
→ 复杂推理 / 长文档总结 → 云端旗舰
→ 失败降级
→ 云端超时 → 本地小模型 + 「能力降级」提示
路由信号
| 信号 | 路由倾向 |
|---|---|
| 数据分级 L3+ | 本地 |
| Token 预估 > 8K 且要高质量 | 云端 |
| 要调仅内网 Tool | 本地 Agent 环 |
| 用户显式选「增强模式」 | 云端 |
统一抽象
应用层只认 LLMProvider,后面挂:
ollama://qwen2.5:14bopenai://gpt-4.xanthropic://claude-...
便于 A/B、熔断、成本统计(第 7 篇)。
六、硬件与性能预期
显存粗算(推理,非训练)
| 模型规模 | FP16 约需 | Q4 量化约需 |
|---|---|---|
| 7B | ~14 GB | ~5 GB |
| 14B | ~28 GB | ~9 GB |
| 32B | ~64 GB | ~20 GB |
| 70B | 多卡 | 单卡 48GB+ 量化可跑 |
硬件档位
| 配置 | 能做什么 |
|---|---|
| M 系 Mac 24GB+ 统一内存 | 8B~14B 日常开发、轻 RAG |
| 单卡 RTX 4090 24GB | 14B 舒适,32B 量化 |
| 双卡 / A100 40GB | 32B~70B 生产推理 |
| 纯 CPU 32GB 内存 | 7B Q4,延迟高,仅离线兜底 |
7B Q4 常见 10~40 tok/s;Agent 场景还要看 Tool 往返次数,别只盯 tok/s。
踩坑清单
- 一上来就上 70B:验证阶段用 7B/14B 足够,先证明链路再冲参数。
- Ollama 当生产唯一推理层:并发与队列起来后应评估 vLLM / 专用 serving。
- 本地了就不管权限:私有化不免除 RAG 过滤与审计。
- 只比 tok/s:Agent 瓶颈常在工具往返与检索,不在生成速度。
- 全切本地、切断云端:混合路由通常更稳——本地兜底,云端冲高。
小结
本地大模型不是替代云端,而是补全 合规、成本、离线 三块短板:
- 场景先决——机密、高频、离线才优先本地
- Ollama 验证,vLLM 生产——按规模升级
- Qwen/DeepSeek 偏中文,Llama 偏生态——用评测选,别迷信参数
- RAG + Agent 能全本地——但权限与审计不能省
- 混合路由是终态——本地兜底,云端冲高
下一篇,我们把 Demo 和生产的差距一次讲透,给 30 天演进路线和 20 项上线清单。
下篇预告:《大模型实战》第 10/10 篇
从 Demo 到生产:Agent 上线清单与 30 天演进。
系列导航
第 1 篇:2026 大模型格局一张图 · 第 2 篇:Prompt 到 Agent 四层架构 · 第 3 篇:RAG 还值不值得做 · 第 4 篇:MCP 协议实战 · 第 5 篇:Tool Calling 工程化 · 第 6 篇:多 Agent 协作 · 第 7 篇:大模型成本治理 · 第 8 篇:Agent 安全 · 第 9 篇:本地大模型 + Ollama(本篇) · 第 10 篇:从 Demo 到生产
更多推荐


所有评论(0)