一文读懂:为什么大模型定价从「按 token」变成「按时段」

2026-08-19 · 体系 A · 技术解读版
适配平台:掘金 / CSDN / 51CTO / 博客园 / 思否 / 知乎 / InfoQ 写作社区 / 公众号
预计字数:3200


一、一周内,AI 圈发生的两件反常事

先看一组反常数据:

  • 8 月 17 日,某国产头部模型 V4-Pro 涨价 4.5 倍——官方:高峰时段资源紧张、必须保护高端体验。
  • 8 月 18 日,海外头部厂商发布新模型 Luna,入门档直接 降价 80%——官方:让更多开发者用上顶级能力。

同一天,一边涨 4.5 倍、一边降 80%,看起来神经错乱。但只要你看完过去 6 个月的 Agent 工程化数据,就会明白——这不是错乱,是Agent 时代对 token 计费体系的反噬

同一战场两种策略:DeepSeek V4-Pro涨价保高端,OpenAI Luna降价抢高频

今天这篇文章,就想和你聊清楚三件事:

  1. 为什么「按 token 计价」会在 Agent 时代失灵?
  2. 涨价方和降价方各自在想什么?
  3. 下一阶段的计费方式,会怎样长出来?

我们用一个一线工程师的视角,把它讲透。


二、复盘:按 token 计价,是怎么走到今天的?

token 计价是 2020 年 GPT-3 时代的遗产。它的成功有历史必然:

阶段 时间 主流产品 计价逻辑
LLM 启蒙期 2020-2022 GPT-3 / Codex / 早期开源 按 token 线性计费,简单透明
推理红利期 2023-2024 GPT-4 / Claude 3 / Gemini 1.5 仍按 token,但引入缓存、批处理、长上下文加价
Agent 爆发期 2025-2026 Claude Code / Codex / Harness / Luna 调用次数 ×10~100,单价模式被打穿

在「单轮对话」+「单次补全」的范式下,token 计价非常合理:

  • 输入成本和输出成本可分;
  • 长上下文明确加价;
  • 计费可预测、易对账;
  • 开发者按需用,避免浪费。

这个模型撑过了 2023 年价格战的洗礼,挺过了 2024 年长上下文升级,挺到了 2025 年。

然后,Agent 来了


三、Agent 时代,token 计价为什么失灵?

3.1 一次 Agent 任务 = 几十次 LLM 调用

先看一份典型 Agent 任务的真实调用栈:

用户输入:"帮我把这个 PDF 转成小红书爆款笔记"
        │
        ▼
┌─ Step 1: 意图识别(便宜模型)──────────────── 1 次
│   └─ "判断是 PDF 处理 + 内容生成"
├─ Step 2: 文档解析 & 章节切分(便宜模型)───── 2 次
│   └─ 输出大纲
├─ Step 3: 标题生成 ×5 候选(中等模型)────── 5 次
│   └─ 取最高分
├─ Step 4: 正文撰写(高端模型)────────────── 1 次
├─ Step 5: 配图 prompt 生成(中等模型)───── 5 次
├─ Step 6: 合规检查 / 违禁词过滤(便宜模型)── 2 次
└─ Step 7: 终稿润色(高端模型)────────────── 1 次
────────────────────────────────────────
合计:17 次 LLM 调用

一次用户提问,开发者付了17次账:典型Agent任务调用栈

一次用户提问,开发者付出了 17 次 token 计费。

而这还只是「单 Agent」任务。在多智能体协作(multi-agent orchestration)场景下,单次用户任务动辄 100~1000 次模型调用,是常见情况。

3.2 token 计价的三个结构性矛盾

矛盾 描述
滥用高端模型 用户拿最强的 Pro 跑意图识别和"是否包含违规词"判断,单次 token 贵 10 倍
压榨低端模型 用最便宜的 Flash 模型跑复杂推理,开发者本质是"薅羊毛"
结算不可控 一份 Agent 任务跑下来成本波动 5-10 倍,无法预测毛利率

结果就是:

  • 高端模型被滥用,厂商成本爆表 → 必须涨价保护
  • 低端模型被压榨,利润见底 → 必须涨不动就改收费模式
  • 开发者不知道账要付多少 → 预算失控

按 token 计价这套游戏规则,已经装不下 Agent 这个新物种了


四、两派动作:涨价方与降价方到底在博弈什么?

回到开头那两个看似"神经错乱"的官方动作,本质上是在同一战场上的两种应对策略。

4.1 涨价方:把"价值"还回去

代表厂商:DeepSeek V4-Pro + Harness 生态。

官方说法是「高端资源在 Agent 框架下被低价值任务挤占,必须提价保体验」。

翻译过来:

让真正需要高端推理的人(深度规划、复杂代码、长链条任务)付得起、用得稳;
让只用 Pro 跑"是否包含违规词"的滥用成本回归正常。

配套动作是开源 Harness(6 天 15w+ Star):让 Agent 工作流标准化,把低价值任务路由到便宜模型,把稀缺的高端推理资源留给高价值场景。

这是一种价值回归型策略:高端溢价 = 高端体验保证。

DeepSeek官方API文档:峰谷定价已生效,V4-Pro高峰输出27元/百万tokens

IT之家:DeepSeek API峰谷定价方案今日生效,高峰时段价格翻倍

4.2 降价方:抢 Agent 高频调用

代表厂商:OpenAI Luna(入门档)降价 80%。

官方说法是"让更多开发者把 AI 用起来"。

翻译过来:

Agent 工作流的绝大多数调用是低复杂度(路由、解析、过滤、初稿);
把这一层的价格打下来,把"绝对调用次数"做上去;
高端档(GPT-5 系)反而稳价甚至涨价来分担成本。

这是一种流量入口型策略:用便宜换高频,用高频养生态。

4.3 一张图看懂博弈

                    ┌─────────────────────────────┐
                    │       用户真实任务            │
                    └──────────────┬──────────────┘
                                   ▼
                ┌──────────────────────────────────────┐
                │       Agent 框架(路由层)            │
                └──────┬────────────────────┬─────────┘
                       ▼                    ▼
        ┌─────────────────────┐   ┌────────────────────────┐
        │ 低复杂度 / 高频调用  │   │ 高复杂度 / 高价值推理   │
        │ 80% 调用量          │   │ 20% 调用量             │
        │ 走便宜模型          │   │ 走高端模型             │
        └──────────┬──────────┘   └──────────┬─────────────┘
                   ▼                         ▼
        ┌─────────────────────┐   ┌────────────────────────┐
        │ OpenAI Luna 类      │   │ DeepSeek V4-Pro 类     │
        │ 入门档 降价 80%     │   │ 高端档 涨价 4.5 倍     │
        └─────────────────────┘   └────────────────────────┘

博弈的本质是:Agent 框架成为新的"模型路由器",把不同价值的调用分到不同价位。


五、未来 12 个月:三种新的计费方式正在长出来

token 计价不会马上消失,但已经在被三个新模式侵蚀。

未来12个月三种新计费:按时段按席位、按任务按结果、按生态贡献

5.1 按时段 / 按席位:把模型当成"云主机"

代表:Anthropic 内部已大量使用"按席位"模式分配 Claude Code 资源。

适用:

  • 长链条 Agent(数小时 - 数十小时)
  • 连续交互(Harness、Droid、Codex)
  • 内部工具(IDE 插件、客服机器人)

优点:

  • 单价可预测
  • 鼓励深度使用而非"薅羊毛"
  • 厂商毛利率可控

缺点:

  • 对"轻度调用"用户不友好
  • 需要配套监控防滥用

5.2 按任务 / 按结果:把模型当成"外包"

代表:部分新模型已试点"按任务(task)"或"按完成度"计费。

适用:

  • 数据清洗
  • 内容批量生成
  • 多步研究任务

优点:

  • 模型质量直接挂钩收入,激励厂商做效果
  • 开发者按结果付费,风险共担

缺点:

  • 需要客观可验证的"完成"标准
  • 复杂任务难标准化

5.3 按生态贡献:把模型当成"广告位"

代表:少数平台开始用模型"曝光券"做分发——开发者用平台模型越多,越容易在分发侧获得流量。

适用:

  • 平台型产品
  • 创作者经济(红果、小红书、抖音)

优点:

  • 把模型成本转嫁到广告 / 分发收入

缺点:

  • 模型能力被分发目标扭曲
  • 不透明、易引发争议

可以预判:未来 12 个月,大多数 Agent 框架会同时支持这三种模式,按场景路由。


六、给一线开发者的实操建议

最后给写代码的你几条具体建议,免得在"涨价 4.5 倍 / 降价 80%"之间选错。

6.1 三类项目的成本估算

项目类型 推荐模型档 估算单价 / 千次调用 注意事项
内部 IDE 插件 中端 Sonnet 系 / V4-Flash 系 ¥20-50 严格路由,避免误用 Pro
ToC 内容生成 低端 Flash 系 + 中端 Sonnet 系 蒸馏 ¥5-15 多 Agent、严格路由
复杂多步研究 高端 Pro + 时段包 ¥200-500 / 小时 按席位计费

6.2 5 条具体行动

  1. Agent 工作流必须显式路由——意图识别、违规词、初稿一律走便宜模型,让高端模型只做"推理"
  2. 缓存 + 批处理是 2026 年的省钱救命稻草——别再用即时、零缓存打法。
  3. 多模型 hybrid 是标配——单模型策略在 Agent 时代最贵。
  4. 预算系统要做"按任务成本"管理——而不是按 token。
  5. 关注国产开源生态(Harness 系的开源版)——能省掉一大半昂贵闭源推理。

七、写在最后

按 token 计费这件事,本质上是 GPT-3 时代给单轮对话定制的一双"鞋"。Agent 的脚长大了,这双鞋就不合脚了。

涨价方和降价方看似在博弈,本质都是在抢 Agent 框架这个新"路由器"的位置。

而开发者真正要做的,不是看哪家便宜哪家贵,而是:

在自己的 Agent 工作流里,把模型调用变成"路由问题"而不是"模型问题"。

这才是 2026 年 AI 工程化最关键的认知升级。


一线开发者视角,每周三更新深度解读。
如果本文对你有帮助,欢迎点赞、收藏、转发~

更多推荐