《大模型实战》第 9/10 篇
上篇:Agent 安全
下篇预告:从 Demo 到生产

「数据不能出域」「API 账单扛不住」「内网离线也要用」——这三句话里只要命中两条,就该认真考虑本地大模型了。

但私有化不是「装个 Ollama 就完事」。2026 年的务实问题是:哪些链路该本地、哪些该留云端、硬件要买到什么程度、和现有 RAG/Agent 怎么接。

本篇给你决策树、运行时选型、模型推荐、混合路由和硬件参考。

你将学到

  • 什么场景值得私有化,什么场景别硬上
  • Ollama / vLLM / llama.cpp 怎么选
  • Qwen / DeepSeek / Llama 系本地模型推荐
  • 本地 RAG + Agent 最小方案
  • 与云端模型的混合路由
  • 硬件与性能预期

一、先结论:私有化是路由问题,不是信仰问题

适合本地 / 私有化

场景原因
L3/L4 机密数据进 Prompt合规、客户合同
高频、低延迟、可接受 7B~14B 质量降本、内网 SLA
离线环境(工厂、政务专网)无外网
开发调试、CI 门禁、代码补全成本可控
敏感 Agent 工具链(读本地 DB)减少出域面

先别硬上本地

场景更合适的做法
要强推理、长规划的多步 Agent云端旗舰 + 本地只做预处理
团队无人运维 GPU托管 API 或云 GPU
要最新多模态(图/视频)云端,本地滞后
只有 CPU、又要 32K+ 长上下文体验可能不可接受

一句话:本地模型解决「数据与成本」,云端模型解决「能力上限」。 混合路由才是常态。

二、运行时选型:Ollama / vLLM / llama.cpp

对比

运行时定位优点缺点
Ollama开箱即用、桌面到服务器安装简单、模型库全、OpenAI 兼容 API高并发吞吐不如 vLLM
vLLM生产级推理服务高吞吐、PagedAttention、多卡运维门槛高
llama.cpp极致轻量、CPU/Apple Silicon低资源、量化成熟功能偏底层,要自己拼服务

怎么选

  • 个人 / 小团队验证 → Ollama
  • 线上多租户、QPS 高 → vLLM(或 TGI、SGLang 同类)
  • 笔记本、NAS、无 GPU → llama.cpp + Q4/Q5 量化
  • 已有 K8s GPU 池 → vLLM + 统一网关

Ollama 本地起服务后,很多框架可直接当 OpenAI 兼容端点:

curl http://localhost:11434/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{"model":"qwen2.5:14b","messages":[{"role":"user","content":"你好"}]}'

三、模型选择:Qwen / DeepSeek / Llama

2026 本地常用梯队(按场景,非榜单)

规模推荐方向适合
3B~8BQwen2.5、Llama 3.x、Gemma分类、抽取、简单 RAG
14B~32BQwen2.5、DeepSeek、Llama主力对话、中等 Agent
70B+Qwen、Llama、DeepSeek 量化版强推理,需多卡或大显存

选型四问

  1. 中文占比高吗? → Qwen / DeepSeek 通常更省心
  2. 要 Tool Calling 吗? → 选官方标注支持 function calling 的版本
  3. 上下文要多长? → 看模型原生窗口,别只靠外推
  4. 量化能接受多少精度损失? → Q4 省显存,Q8 更稳

和云端的关系

本地 14B 不必和 GPT-4 级比「谁更聪明」,要比:

  • 这条链路是否必须本地
  • 质量是否够交付(用评测集测,别凭感觉)
  • 延迟和成本是否更优

四、本地 RAG + Agent 最小方案

架构

用户
 → 网关(鉴权 / 路由)
 → 本地 Embedding(bge-m3 等)
 → 向量库(PGVector / Milvus / sqlite-vec)
 → 本地 LLM(Ollama)
 → (可选)本地 Tool:SQL / 文件 / 内网 API

组件建议

组件本地常见选择
Embeddingbge-m3、multilingual-e5
向量库PGVector(省事)、Milvus(规模大)
编排LangChain / LlamaIndex / 自研
Agent同一 OpenAI 兼容端点 + Tool schema

注意点

  • Embedding 和 LLM 可以不同进程,Embedding 常更轻
  • 检索仍要做权限过滤(见第 3、8 篇)
  • 本地 Agent 工具权限更要收紧——内网不等于安全

五、混合路由:本地与云端怎么分工

典型路由策略

请求
 → 敏感检测(PII / 机密标签)
   → 命中 → 本地模型
 → 任务分类(简单 / 复杂 / 需工具)
   → 简单 FAQ → 本地 8B
   → 复杂推理 / 长文档总结 → 云端旗舰
 → 失败降级
   → 云端超时 → 本地小模型 + 「能力降级」提示

路由信号

信号路由倾向
数据分级 L3+本地
Token 预估 > 8K 且要高质量云端
要调仅内网 Tool本地 Agent 环
用户显式选「增强模式」云端

统一抽象

应用层只认 LLMProvider,后面挂:

  • ollama://qwen2.5:14b
  • openai://gpt-4.x
  • anthropic://claude-...

便于 A/B、熔断、成本统计(第 7 篇)。

六、硬件与性能预期

显存粗算(推理,非训练)

模型规模FP16 约需Q4 量化约需
7B~14 GB~5 GB
14B~28 GB~9 GB
32B~64 GB~20 GB
70B多卡单卡 48GB+ 量化可跑

硬件档位

配置能做什么
M 系 Mac 24GB+ 统一内存8B~14B 日常开发、轻 RAG
单卡 RTX 4090 24GB14B 舒适,32B 量化
双卡 / A100 40GB32B~70B 生产推理
纯 CPU 32GB 内存7B Q4,延迟高,仅离线兜底

7B Q4 常见 10~40 tok/s;Agent 场景还要看 Tool 往返次数,别只盯 tok/s。

踩坑清单

  1. 一上来就上 70B:验证阶段用 7B/14B 足够,先证明链路再冲参数。
  2. Ollama 当生产唯一推理层:并发与队列起来后应评估 vLLM / 专用 serving。
  3. 本地了就不管权限:私有化不免除 RAG 过滤与审计。
  4. 只比 tok/s:Agent 瓶颈常在工具往返与检索,不在生成速度。
  5. 全切本地、切断云端:混合路由通常更稳——本地兜底,云端冲高。

小结

本地大模型不是替代云端,而是补全 合规、成本、离线 三块短板:

  1. 场景先决——机密、高频、离线才优先本地
  2. Ollama 验证,vLLM 生产——按规模升级
  3. Qwen/DeepSeek 偏中文,Llama 偏生态——用评测选,别迷信参数
  4. RAG + Agent 能全本地——但权限与审计不能省
  5. 混合路由是终态——本地兜底,云端冲高

下一篇,我们把 Demo 和生产的差距一次讲透,给 30 天演进路线和 20 项上线清单。


下篇预告:《大模型实战》第 10/10 篇
从 Demo 到生产:Agent 上线清单与 30 天演进。

系列导航
第 1 篇:2026 大模型格局一张图 · 第 2 篇:Prompt 到 Agent 四层架构 · 第 3 篇:RAG 还值不值得做 · 第 4 篇:MCP 协议实战 · 第 5 篇:Tool Calling 工程化 · 第 6 篇:多 Agent 协作 · 第 7 篇:大模型成本治理 · 第 8 篇:Agent 安全 · 第 9 篇:本地大模型 + Ollama(本篇) · 第 10 篇:从 Demo 到生产

更多推荐