《大模型实战》第 7/10 篇
上篇:多 Agent 协作
下篇预告:Agent 安全

很多团队的大模型账单,不是第一天爆的,而是 Agent 上线第三周 才突然失控:重试多了、上下文长了、多 Agent 串起来了、小功能默认用了旗舰模型。

成本治理不是「换便宜模型」,而是「让每 1k token 花在该花的地方」。

本篇拆成本构成,讲模型路由、缓存与压缩、摘要窗口、预算告警,并给一张月成本估算表模板。

你将学到

  • 成本构成:输入 / 输出 / 工具 / 重试
  • 模型路由:小模型分流、复杂任务升级
  • Prompt 缓存与上下文压缩
  • 会话摘要与滑动窗口
  • 预算告警与熔断
  • 月成本估算表(可直接填)

一、成本构成:别只盯「每 1M token 单价」

一次用户请求的真实成本:

总成本 ≈ 输入 token × 输入单价
       + 输出 token × 输出单价
       + 工具侧成本(检索、API、沙箱)
       + 重试 / 多 Agent 放大系数
       + 人工审核时间(常被忽略)

典型放大器

放大器现象量级
长 system + 多 tool 定义每轮固定前缀很大+20%~+40% 输入
RAG TopK 过大检索块占满窗口+30%~+100% 输入
Agent 重试同一任务跑 3 次×3
多 Agent Handoff重复背景×1.5~×4
输出过长用户没读但已计费输出侧翻倍

先度量分布,再优化。 不知道 P95 输入长度,就别急着换模型。

二、模型路由:默认便宜,难例升级

路由策略

请求进入
 → 分类器(规则 / 小模型 / embedding 相似度)
 → 简单:小模型直接答
 → 中等:中档模型
 → 复杂 / 代码 / 多步:旗舰模型
 → 失败或低置信:升级一档(仅一次)

分类信号(可组合)

信号路由倾向
字符短、FAQ 命中小模型
含代码块 / 多文件代码向模型
需 tool / Agent工具调用稳的档
用户 tier = VIP可默认升一档
上一档 confidence 低升级

反模式

  • 全站一个最贵模型 → Demo 快,账单更快
  • 分类器本身用旗舰 → 路由比回答还贵;用规则 + 小模型
  • 无限升级 → 必须 max_escalations = 1

三、Prompt 缓存与上下文压缩

Prompt 缓存(Provider Cache)

适用:固定 system、工具 Schema、长期不变的规章前缀。

做法效果
稳定 system 放最前提高 cache hit
少改 tool 定义顺序避免 cache 失效
租户级共享模板多用户摊薄

注意:各云厂商缓存规则不同,以账单里的 cached token 行准

上下文压缩

手段场景
RAG 只送 Top 5~8 + Rerank知识问答
tool 结果摘要后再回灌大 JSON 返回
去掉陈旧 tool 中间态长 Agent 会话
结构化 memory 替代全文个人助手

压缩不是越狠越好:压掉引用来源,忠实度会掉。 生产要 A/B 或抽检。

四、会话摘要与滑动窗口

长对话:滑动窗口 + 周期性小模型摘要 + 关键事实结构化存储。摘要比原文还长就是负优化。

五、预算告警与熔断

分级预算

级别对象动作
用户日 token 上限降级模型 / 限流
功能Agent 任务预算拒绝长链路
租户月预算 80%告警
租户月预算 100%熔断只读 / 排队

告警指标

  • 日 / 周 token 环比 >30%
  • 单功能 P95 输入 > 阈值
  • cached token 占比骤降(可能改坏了 prompt)
  • 重试率上升

熔断原则

对用户透明:说明「系统繁忙,已切换简化模式」,而不是 silent 降智到胡编。

六、月成本估算表(模板)

假设:中型 B2B 助手,日活 500,人均 8 轮对话,30 天。

假设计算月 token / 费用
输入/轮3k token500×8×30×3k≈ 360M input
输出/轮800 token500×8×30×800≈ 96M output
路由后均价输入 $0.5/M,输出 $2/M混合input ≈ $180
output ≈ $192
RAG 额外+25% input+$45
Agent 重试+15% 总+$62
工具/API固定检索+通知+$80
合计≈ $559 / 月

换参数:全旗舰 ×3~×5;多 Agent 无限 Handoff ×2~×4;缓存 + 小模型分流 ×0.4~×0.7。请用自家日志替换假设。

七、和其他篇的联动

来源成本点本篇手段
第 3 篇 RAGTopK、Rerank限 K、缓存检索
第 5 篇 Tool大结果、重试摘要、retry cap
第 6 篇 多 AgentHandoff、多 system结构化传递、小模型摘要
第 8 篇 安全审计日志日志采样,别全量存 prompt

落地顺序:① 打 tag 看账单 → ② 路由 + 限长 + 80% 告警 → ③ 缓存 + 摘要 + 重试上限

踩坑清单

  1. 只优化输出 token → 输入往往才是大头
  2. 摘要丢失关键约束 → Reviewer 反复改稿,更贵
  3. 缓存命中率不监控 → 改 system 一行,账单静默涨
  4. 把降本等于降质量 → 应对简单流量降,难例保留旗舰通道
  5. Agent 无 per-task budget → 一个死循环拖垮月预算
  6. 估算不带重试与 RAG → 立项数永远偏低

成本 / 风险提示

风险说明
_vendor 涨价保留第二模型 + 抽象层
限流路由到备用 region / 模型
过度熔断影响付费用户体验;VIP 白名单
压缩过度合规场景需保留原文审计
本地模型省 token 费,增 GPU 与运维(见第 9 篇)

系列导航

主题
第 6 篇多 Agent 协作
第 7 篇大模型成本治理(本篇)
第 8 篇Agent 安全
第 9 篇本地大模型 + Ollama

跨系列内链:《AI 前端实战》第 8 篇——首 Token 延迟、限流、熔断(体验侧与成本侧一体)。

小结

度量先于优化;默认小模型难例升级;输入比输出更值得砍;缓存+摘要+限长;预算要在账单爆炸前响。 下篇谈安全与审计。


下篇预告:《大模型实战》第 8/10 篇
Agent 安全:沙箱、权限、Prompt 注入与审计。

更多推荐