真把 GPT / Claude / 通义 / DeepSeek / Doubao 同一个企业 Agent 任务丢进去,看哪家在响应速度、JSON 合规率、长上下文召回率、单次调用成本上真有差距。
800 次真实压测、5 个企业场景、单次调用成本相差 18 倍、JSON 合规率相差 32%,所有原始数据全部摊开。## 一、为什么要做这次横评接的是一家做企业 SaaS 的 ToB 公司,他们的 Agent 编排平台已经上线了 6 个月,核心痛点 3 条:1. 成本不透明:OpenAI 一家撑着,月账单 38 万,老板觉得贵2. 响应慢:复杂 Agent 链 8-12 秒,客户嫌"卡",转化率掉3. JSON 经常不合规:Function Call 偶尔出来个非法 JSON,整条 Workflow 断老板原话:“我不要你换模型,我要你告诉我换哪个、什么场景换、能省多少、稳不稳。“这就是这次横评的起点——不是看官方 benchmark,是真把企业场景丢进去打。## 二、横评 5 个真实场景不挑边,把企业 Agent 高频任务全部抽出来:| 场景 | 描述 | 上下文长度 || ----------- | ----------------------------------------------- | ---------- || 工单分类 | 客户工单 → 18 类标签 + 紧急度 + 情绪 | 短(<2k) || 合同抽取 | 12 页 PDF → 关键条款 JSON(20 字段) | 长(8-12k) || 知识库 RAG | 用户问题 + 6 段 chunk → 准确答案 + 引用 | 中(4-6k) || 多步 Agent | 客户请求 → 路由 → 工具选择 → 参数生成 → 调用 → 总结 | 中(3-5k) || 代码生成 | 自然语言 → SQL/Python/JS,要求 100% 可执行 | 短(<2k) |每个场景跑 160 次,每个模型 800 次,总样本 4000 次。打分维度:- 平均响应时延(秒)- JSON / 格式合规率(%)- 业务正确率(人工审 + LLM 评)- 单次调用平均成本(¥)- 百万 tokens 成本(¥)- 长上下文召回率(中-长场景)## 三、5 个模型横评结果汇总直接上表,数字都是 800 次实测均值:| 模型 | 时延 | JSON 合规 | 业务正确 | 单次成本 | 百万 token 成本 || ---------------- | ----- | --------- | -------- | -------- | --------------- || GPT-5 | 5.4s | 99.1% | 92.3% | ¥0.082 | ¥230 || Claude Sonnet 4.6 | 4.8s | 99.4% | 93.1% | ¥0.078 | ¥218 || 通义 3-Max | 3.2s | 97.6% | 88.9% | ¥0.014 | ¥38 || DeepSeek V3.5 | 3.7s | 98.2% | 87.6% | ¥0.0058 | ¥16 || Doubao 1.6-Pro | 2.9s | 96.4% | 86.1% | ¥0.0046 | ¥13 |跨度大到我自己都没想到:最贵和最便宜的模型,单次调用差 18 倍。## 四、按场景拆开看### 4.1 工单分类(短上下文 + 高频)| 模型 | 时延 | JSON 合规 | 业务正确 | 单次成本 || --------- | ----- | --------- | -------- | -------- || GPT-5 | 4.1s | 100% | 94.3% | ¥0.041 || Claude | 3.6s | 100% | 95.1% | ¥0.038 || 通义 3-Max | 2.4s | 100% | 93.6% | ¥0.0078 || DeepSeek | 2.8s | 99.4% | 92.8% | ¥0.0029 || Doubao | 2.1s | 99.4% | 91.8% | ¥0.0023 |结论:工单分类是国产模型的主场。Doubao 单次 ¥0.0023,准确率 91.8%,跟 GPT-5 差 2.5 个点,但成本是它的 1/18。### 4.2 合同抽取(长上下文 + 复杂 JSON)| 模型 | 时延 | JSON 合规 | 业务正确 | 单次成本 || --------- | ----- | --------- | -------- | -------- |
| GPT-5 | 8.3s | 98.9% | 91.4% | ¥0.21 || Claude | 7.6s | 99.4% | 93.6% | ¥0.19 || 通义 3-Max | 4.8s | 96.1% | 87.2% | ¥0.034 || DeepSeek | 5.4s | 96.8% | 86.4% | ¥0.014 || Doubao | 4.2s | 94.6% | 84.1% | ¥0.011 |结论:Claude Sonnet 4.6 是合同抽取的王。长上下文 + 复杂 JSON 这块,Claude 的 JSON 合规率 99.4%,业务正确 93.6%,都是榜首。但贵 5 倍。能不能省?后面会说。### 4.3 知识库 RAG| 模型 | 时延 | 召回率 | 业务正确 | 单次成本 || --------- | ----- | ------ | -------- | -------- || GPT-5 | 4.8s | 89.3% | 93.2% | ¥0.067 || Claude | 4.3s | 91.2% | 94.1% | ¥0.064 || 通义 3-Max | 3.1s | 87.4% | 91.6% | ¥0.013 || DeepSeek | 3.5s | 88.2% | 90.4% | ¥0.0052 || Doubao | 2.7s | 84.6% | 88.1% | ¥0.0041 |结论:RAG 场景下 Claude 召回率最高(91.2%),但通义 3-Max 性价比拉满——召回 87.4%,成本是 Claude 的 1/5,响应快 1.2 秒。### 4.4 多步 Agent 编排| 模型 | 时延 | JSON 合规 | 业务正确 | 单次成本 || --------- | ----- | --------- | -------- | -------- || GPT-5 | 7.2s | 98.6% | 91.7% | ¥0.094 || Claude | 6.4s | 99.1% | 93.4% | ¥0.089 || 通义 3-Max | 4.5s | 96.4% | 88.1% | ¥0.018 || DeepSeek | 5.1s | 97.2% | 86.6% | ¥0.0072 || Doubao | 3.8s | 95.1% | 84.3% | ¥0.0056 |结论:多步 Agent 是 Claude 的另一个主场——Tool Call 调用 + 参数生成 + 总结这种长链路,Claude 的稳定性比其他模型高 2-3 个点。### 4.5 代码生成| 模型 | 时延 | 可执行率 | 业务正确 | 单次成本 || --------- | ----- | -------- | -------- | -------- || GPT-5 | 5.2s | 96.4% | 89.6% | ¥0.058 || Claude | 4.8s | 97.1% | 91.2% | ¥0.053 || 通义 3-Max | 3.4s | 93.6% | 85.1% | ¥0.013 || DeepSeek | 3.9s | 95.4% | 88.3% | ¥0.0062 || Doubao | 3.1s | 92.1% | 82.4% | ¥0.0048 |结论:DeepSeek V3.5 是代码场景性价比之王——可执行率 95.4%,业务正确 88.3%,比 GPT-5 差 1 个点但成本 1/9。## 五、多模型路由策略:同一条 Workflow 该接谁横评的结论不是"选谁”,而是**“按场景路由”。我们最后给客户落地了一套多模型路由器,规则:[Workflow 入口] ├── 工单分类 ────────── Doubao 1.6-Pro (省钱场景) ├── 知识库 RAG ──────── 通义 3-Max (性价比场景) ├── 代码生成 ────────── DeepSeek V3.5 (代码场景) ├── 合同抽取 ────────── Claude Sonnet 4.6 (高难度场景) ├── 多步 Agent ─────── Claude Sonnet 4.6 (高难度场景) └── 兜底 / 重试 ────── GPT-5 (兜底)路由器还做了 3 件事:- 同场景双模型 AB 跑:5% 流量打到对照模型,持续监控质量是否漂移- 失败自动降级:Claude 502 / 超时,自动 fallback 通义 3-Max- 预算硬阈值:每月 25 万,超了自动切到最便宜模型## 六、上线 30 天真实成本对比落地后这家 SaaS 公司的真实账单:
| 模型策略 | 月调用总量 | 月度成本 | 平均时延 | 业务正确 || -------------------- | ---------- | -------- | -------- | -------- || v0:全 GPT-5 | 4,800 万 | ¥38 万 | 5.6s | 92.1% || v1:全 Claude | 4,800 万 | ¥34 万 | 4.9s | 93.4% || v2:按场景路由 | 4,800 万 | ¥9.6 万 | 3.5s | 91.8% || v3:路由 + 缓存 + 蒸馏 | 4,800 万 | ¥4.2 万 | 2.8s | 91.6% |v2 vs v0:成本砍 75%,业务正确率只掉 0.3 个点。这是企业 Agent 平台值得投的工程优化。v3 又额外做了 2 件事:- 语义缓存:用 embedding 找历史相似请求,28% 命中,直接复用- 小模型蒸馏:把 Claude 的合同抽取微调成一个 7B 自有模型,部分场景 100% 替换最终成本砍到 v0 的 1/9。## 七、画布 DAG 编排:怎么让"换模型"变成 0 改代码横评数据再好,落地工程也得跟上。我们的做法是把 Agent 编排做成画布 DAG:- 每个节点是一个
任务**(LLM 调用 / 工具 / 子 Workflow)- 节点的"模型"是配置,不是代码- 配置改了,DAG 不用重发,运行时热加载实测:从横评结论到全平台落地,工程改造只用了 3 天,核心代码改动 < 200 行。3 个画布 DAG 工程要点:1. 节点输入 / 输出强类型化:每个节点声明 input schema + output schema,换模型不破坏下游2. 失败重试 = 节点级,不是 Workflow 级:单节点 fallback 比整 Workflow 重跑成本低 10 倍3. 每条执行链都带 traceId:从 DAG 入口到出口,所有节点的 input / output / 模型 / 时延都落库## 八、踩过的 7 个具体坑(直接抄)1. 不要拿 official benchmark 决策——MMLU / GPQA 跟你的企业场景没关系2. JSON 合规率是头号筛选指标——业务正确率再高,JSON 一坏整条链断3. 长上下文场景必须实测召回率——4k 之后所有模型都"看起来还行”,但召回率掉得很猛4. 国产模型在短上下文是真的好用——别因为"国产"就觉得差5. 代码场景 DeepSeek 是隐藏冠军——可执行率 95%+,成本 1/96. 路由器要内置 AB 跑 + 自动降级——只配规则不监控,3 个月后必崩7. 路由 + 缓存 + 蒸馏 三件套——这才是真正把成本砍 90% 的组合,单纯换模型只能砍 70%## 九、给不同人的选型建议如果你是:- 企业 SaaS 的 CTO:照着做路由 + 画布 DAG + 缓存三件套,月度成本立刻砍 75%- AI 中台开发者:重点投画布 DAG + 强类型化 + traceId,这是企业平台的护城河- AI 创业者:别再"GPT-5 + 默认参数"了,横评 + 路由就是你的差异化- 个人开发者:工单分类用 Doubao,代码用 DeepSeek,合同 / 长上下文用 Claude结论:2026 的企业 Agent 不是"用哪个模型"的问题,是"怎么把 5 个模型协同起来"的问题。模型今年换 GPT-5 明年换 Claude 5,画布 DAG + 路由策略 + 缓存 + traceId才是真正不会被替代的资产。—v2 路线图(已立项):- 自动路由学习(强化学习挑选模型,而不是规则)- 多模型并行投票(高难度场景同时调 2 个模型,投票挑最优)- 蒸馏自动化(每周把 Claude 的高频任务自动蒸馏成 7B 自有模型)留个钩子:有兴趣对接的,评论区扣个 “多模型路由 SOP”,我把完整 5 个场景的 prompt + 路由器代码思路 + 画布 DAG 节点定义整理一份单独发。> 写在最后:做 AI 中台 6 个月能复盘一次就赚,CTO 真不在意你用谁家模型,在意的是"我的月度账单能不能砍一半,业务正确率能不能不掉"。能砍能稳的中台,才是企业愿意续费的中台。

更多推荐