大模型成本治理:Token 预算、缓存、模型路由
《大模型实战》第 7/10 篇
上篇:多 Agent 协作
下篇预告:Agent 安全
很多团队的大模型账单,不是第一天爆的,而是 Agent 上线第三周 才突然失控:重试多了、上下文长了、多 Agent 串起来了、小功能默认用了旗舰模型。
成本治理不是「换便宜模型」,而是「让每 1k token 花在该花的地方」。
本篇拆成本构成,讲模型路由、缓存与压缩、摘要窗口、预算告警,并给一张月成本估算表模板。
你将学到
- 成本构成:输入 / 输出 / 工具 / 重试
- 模型路由:小模型分流、复杂任务升级
- Prompt 缓存与上下文压缩
- 会话摘要与滑动窗口
- 预算告警与熔断
- 月成本估算表(可直接填)
一、成本构成:别只盯「每 1M token 单价」
一次用户请求的真实成本:
总成本 ≈ 输入 token × 输入单价
+ 输出 token × 输出单价
+ 工具侧成本(检索、API、沙箱)
+ 重试 / 多 Agent 放大系数
+ 人工审核时间(常被忽略)
典型放大器
| 放大器 | 现象 | 量级 |
|---|---|---|
| 长 system + 多 tool 定义 | 每轮固定前缀很大 | +20%~+40% 输入 |
| RAG TopK 过大 | 检索块占满窗口 | +30%~+100% 输入 |
| Agent 重试 | 同一任务跑 3 次 | ×3 |
| 多 Agent Handoff | 重复背景 | ×1.5~×4 |
| 输出过长 | 用户没读但已计费 | 输出侧翻倍 |
先度量分布,再优化。 不知道 P95 输入长度,就别急着换模型。
二、模型路由:默认便宜,难例升级
路由策略
请求进入
→ 分类器(规则 / 小模型 / embedding 相似度)
→ 简单:小模型直接答
→ 中等:中档模型
→ 复杂 / 代码 / 多步:旗舰模型
→ 失败或低置信:升级一档(仅一次)
分类信号(可组合)
| 信号 | 路由倾向 |
|---|---|
| 字符短、FAQ 命中 | 小模型 |
| 含代码块 / 多文件 | 代码向模型 |
| 需 tool / Agent | 工具调用稳的档 |
| 用户 tier = VIP | 可默认升一档 |
| 上一档 confidence 低 | 升级 |
反模式
- 全站一个最贵模型 → Demo 快,账单更快
- 分类器本身用旗舰 → 路由比回答还贵;用规则 + 小模型
- 无限升级 → 必须
max_escalations = 1
三、Prompt 缓存与上下文压缩
Prompt 缓存(Provider Cache)
适用:固定 system、工具 Schema、长期不变的规章前缀。
| 做法 | 效果 |
|---|---|
| 稳定 system 放最前 | 提高 cache hit |
| 少改 tool 定义顺序 | 避免 cache 失效 |
| 租户级共享模板 | 多用户摊薄 |
注意:各云厂商缓存规则不同,以账单里的 cached token 行准。
上下文压缩
| 手段 | 场景 |
|---|---|
| RAG 只送 Top 5~8 + Rerank | 知识问答 |
| tool 结果摘要后再回灌 | 大 JSON 返回 |
| 去掉陈旧 tool 中间态 | 长 Agent 会话 |
| 结构化 memory 替代全文 | 个人助手 |
压缩不是越狠越好:压掉引用来源,忠实度会掉。 生产要 A/B 或抽检。
四、会话摘要与滑动窗口
长对话:滑动窗口 + 周期性小模型摘要 + 关键事实结构化存储。摘要比原文还长就是负优化。
五、预算告警与熔断
分级预算
| 级别 | 对象 | 动作 |
|---|---|---|
| 用户 | 日 token 上限 | 降级模型 / 限流 |
| 功能 | Agent 任务预算 | 拒绝长链路 |
| 租户 | 月预算 80% | 告警 |
| 租户 | 月预算 100% | 熔断只读 / 排队 |
告警指标
- 日 / 周 token 环比 >30%
- 单功能 P95 输入 > 阈值
- cached token 占比骤降(可能改坏了 prompt)
- 重试率上升
熔断原则
对用户透明:说明「系统繁忙,已切换简化模式」,而不是 silent 降智到胡编。
六、月成本估算表(模板)
假设:中型 B2B 助手,日活 500,人均 8 轮对话,30 天。
| 项 | 假设 | 计算 | 月 token / 费用 |
|---|---|---|---|
| 输入/轮 | 3k token | 500×8×30×3k | ≈ 360M input |
| 输出/轮 | 800 token | 500×8×30×800 | ≈ 96M output |
| 路由后均价 | 输入 $0.5/M,输出 $2/M | 混合 | input ≈ $180 |
| output ≈ $192 | |||
| RAG 额外 | +25% input | +$45 | |
| Agent 重试 | +15% 总 | +$62 | |
| 工具/API | 固定 | 检索+通知 | +$80 |
| 合计 | ≈ $559 / 月 |
换参数:全旗舰 ×3~×5;多 Agent 无限 Handoff ×2~×4;缓存 + 小模型分流 ×0.4~×0.7。请用自家日志替换假设。
七、和其他篇的联动
| 来源 | 成本点 | 本篇手段 |
|---|---|---|
| 第 3 篇 RAG | TopK、Rerank | 限 K、缓存检索 |
| 第 5 篇 Tool | 大结果、重试 | 摘要、retry cap |
| 第 6 篇 多 Agent | Handoff、多 system | 结构化传递、小模型摘要 |
| 第 8 篇 安全 | 审计日志 | 日志采样,别全量存 prompt |
落地顺序:① 打 tag 看账单 → ② 路由 + 限长 + 80% 告警 → ③ 缓存 + 摘要 + 重试上限。
踩坑清单
- 只优化输出 token → 输入往往才是大头
- 摘要丢失关键约束 → Reviewer 反复改稿,更贵
- 缓存命中率不监控 → 改 system 一行,账单静默涨
- 把降本等于降质量 → 应对简单流量降,难例保留旗舰通道
- Agent 无 per-task budget → 一个死循环拖垮月预算
- 估算不带重试与 RAG → 立项数永远偏低
成本 / 风险提示
| 风险 | 说明 |
|---|---|
| _vendor 涨价 | 保留第二模型 + 抽象层 |
| 限流 | 路由到备用 region / 模型 |
| 过度熔断 | 影响付费用户体验;VIP 白名单 |
| 压缩过度 | 合规场景需保留原文审计 |
| 本地模型 | 省 token 费,增 GPU 与运维(见第 9 篇) |
系列导航
| 篇 | 主题 |
|---|---|
| 第 6 篇 | 多 Agent 协作 |
| 第 7 篇 | 大模型成本治理(本篇) |
| 第 8 篇 | Agent 安全 |
| 第 9 篇 | 本地大模型 + Ollama |
跨系列内链:《AI 前端实战》第 8 篇——首 Token 延迟、限流、熔断(体验侧与成本侧一体)。
小结
度量先于优化;默认小模型难例升级;输入比输出更值得砍;缓存+摘要+限长;预算要在账单爆炸前响。 下篇谈安全与审计。
下篇预告:《大模型实战》第 8/10 篇
Agent 安全:沙箱、权限、Prompt 注入与审计。
更多推荐


所有评论(0)