一文读懂:为什么大模型定价从「按 token」变成「按时段」
一文读懂:为什么大模型定价从「按 token」变成「按时段」
2026-08-19 · 体系 A · 技术解读版
适配平台:掘金 / CSDN / 51CTO / 博客园 / 思否 / 知乎 / InfoQ 写作社区 / 公众号
预计字数:3200
一、一周内,AI 圈发生的两件反常事
先看一组反常数据:
- 8 月 17 日,某国产头部模型 V4-Pro 涨价 4.5 倍——官方:高峰时段资源紧张、必须保护高端体验。
- 8 月 18 日,海外头部厂商发布新模型 Luna,入门档直接 降价 80%——官方:让更多开发者用上顶级能力。
同一天,一边涨 4.5 倍、一边降 80%,看起来神经错乱。但只要你看完过去 6 个月的 Agent 工程化数据,就会明白——这不是错乱,是Agent 时代对 token 计费体系的反噬。

今天这篇文章,就想和你聊清楚三件事:
- 为什么「按 token 计价」会在 Agent 时代失灵?
- 涨价方和降价方各自在想什么?
- 下一阶段的计费方式,会怎样长出来?
我们用一个一线工程师的视角,把它讲透。
二、复盘:按 token 计价,是怎么走到今天的?
token 计价是 2020 年 GPT-3 时代的遗产。它的成功有历史必然:
| 阶段 | 时间 | 主流产品 | 计价逻辑 |
|---|---|---|---|
| LLM 启蒙期 | 2020-2022 | GPT-3 / Codex / 早期开源 | 按 token 线性计费,简单透明 |
| 推理红利期 | 2023-2024 | GPT-4 / Claude 3 / Gemini 1.5 | 仍按 token,但引入缓存、批处理、长上下文加价 |
| Agent 爆发期 | 2025-2026 | Claude Code / Codex / Harness / Luna | 调用次数 ×10~100,单价模式被打穿 |
在「单轮对话」+「单次补全」的范式下,token 计价非常合理:
- 输入成本和输出成本可分;
- 长上下文明确加价;
- 计费可预测、易对账;
- 开发者按需用,避免浪费。
这个模型撑过了 2023 年价格战的洗礼,挺过了 2024 年长上下文升级,挺到了 2025 年。
然后,Agent 来了。
三、Agent 时代,token 计价为什么失灵?
3.1 一次 Agent 任务 = 几十次 LLM 调用
先看一份典型 Agent 任务的真实调用栈:
用户输入:"帮我把这个 PDF 转成小红书爆款笔记"
│
▼
┌─ Step 1: 意图识别(便宜模型)──────────────── 1 次
│ └─ "判断是 PDF 处理 + 内容生成"
├─ Step 2: 文档解析 & 章节切分(便宜模型)───── 2 次
│ └─ 输出大纲
├─ Step 3: 标题生成 ×5 候选(中等模型)────── 5 次
│ └─ 取最高分
├─ Step 4: 正文撰写(高端模型)────────────── 1 次
├─ Step 5: 配图 prompt 生成(中等模型)───── 5 次
├─ Step 6: 合规检查 / 违禁词过滤(便宜模型)── 2 次
└─ Step 7: 终稿润色(高端模型)────────────── 1 次
────────────────────────────────────────
合计:17 次 LLM 调用

一次用户提问,开发者付出了 17 次 token 计费。
而这还只是「单 Agent」任务。在多智能体协作(multi-agent orchestration)场景下,单次用户任务动辄 100~1000 次模型调用,是常见情况。
3.2 token 计价的三个结构性矛盾
| 矛盾 | 描述 |
|---|---|
| 滥用高端模型 | 用户拿最强的 Pro 跑意图识别和"是否包含违规词"判断,单次 token 贵 10 倍 |
| 压榨低端模型 | 用最便宜的 Flash 模型跑复杂推理,开发者本质是"薅羊毛" |
| 结算不可控 | 一份 Agent 任务跑下来成本波动 5-10 倍,无法预测毛利率 |
结果就是:
- 高端模型被滥用,厂商成本爆表 → 必须涨价保护
- 低端模型被压榨,利润见底 → 必须涨不动就改收费模式
- 开发者不知道账要付多少 → 预算失控
按 token 计价这套游戏规则,已经装不下 Agent 这个新物种了。
四、两派动作:涨价方与降价方到底在博弈什么?
回到开头那两个看似"神经错乱"的官方动作,本质上是在同一战场上的两种应对策略。
4.1 涨价方:把"价值"还回去
代表厂商:DeepSeek V4-Pro + Harness 生态。
官方说法是「高端资源在 Agent 框架下被低价值任务挤占,必须提价保体验」。
翻译过来:
让真正需要高端推理的人(深度规划、复杂代码、长链条任务)付得起、用得稳;
让只用 Pro 跑"是否包含违规词"的滥用成本回归正常。
配套动作是开源 Harness(6 天 15w+ Star):让 Agent 工作流标准化,把低价值任务路由到便宜模型,把稀缺的高端推理资源留给高价值场景。
这是一种价值回归型策略:高端溢价 = 高端体验保证。


4.2 降价方:抢 Agent 高频调用
代表厂商:OpenAI Luna(入门档)降价 80%。
官方说法是"让更多开发者把 AI 用起来"。
翻译过来:
Agent 工作流的绝大多数调用是低复杂度(路由、解析、过滤、初稿);
把这一层的价格打下来,把"绝对调用次数"做上去;
高端档(GPT-5 系)反而稳价甚至涨价来分担成本。
这是一种流量入口型策略:用便宜换高频,用高频养生态。
4.3 一张图看懂博弈
┌─────────────────────────────┐
│ 用户真实任务 │
└──────────────┬──────────────┘
▼
┌──────────────────────────────────────┐
│ Agent 框架(路由层) │
└──────┬────────────────────┬─────────┘
▼ ▼
┌─────────────────────┐ ┌────────────────────────┐
│ 低复杂度 / 高频调用 │ │ 高复杂度 / 高价值推理 │
│ 80% 调用量 │ │ 20% 调用量 │
│ 走便宜模型 │ │ 走高端模型 │
└──────────┬──────────┘ └──────────┬─────────────┘
▼ ▼
┌─────────────────────┐ ┌────────────────────────┐
│ OpenAI Luna 类 │ │ DeepSeek V4-Pro 类 │
│ 入门档 降价 80% │ │ 高端档 涨价 4.5 倍 │
└─────────────────────┘ └────────────────────────┘
博弈的本质是:Agent 框架成为新的"模型路由器",把不同价值的调用分到不同价位。
五、未来 12 个月:三种新的计费方式正在长出来
token 计价不会马上消失,但已经在被三个新模式侵蚀。

5.1 按时段 / 按席位:把模型当成"云主机"
代表:Anthropic 内部已大量使用"按席位"模式分配 Claude Code 资源。
适用:
- 长链条 Agent(数小时 - 数十小时)
- 连续交互(Harness、Droid、Codex)
- 内部工具(IDE 插件、客服机器人)
优点:
- 单价可预测
- 鼓励深度使用而非"薅羊毛"
- 厂商毛利率可控
缺点:
- 对"轻度调用"用户不友好
- 需要配套监控防滥用
5.2 按任务 / 按结果:把模型当成"外包"
代表:部分新模型已试点"按任务(task)"或"按完成度"计费。
适用:
- 数据清洗
- 内容批量生成
- 多步研究任务
优点:
- 模型质量直接挂钩收入,激励厂商做效果
- 开发者按结果付费,风险共担
缺点:
- 需要客观可验证的"完成"标准
- 复杂任务难标准化
5.3 按生态贡献:把模型当成"广告位"
代表:少数平台开始用模型"曝光券"做分发——开发者用平台模型越多,越容易在分发侧获得流量。
适用:
- 平台型产品
- 创作者经济(红果、小红书、抖音)
优点:
- 把模型成本转嫁到广告 / 分发收入
缺点:
- 模型能力被分发目标扭曲
- 不透明、易引发争议
可以预判:未来 12 个月,大多数 Agent 框架会同时支持这三种模式,按场景路由。
六、给一线开发者的实操建议
最后给写代码的你几条具体建议,免得在"涨价 4.5 倍 / 降价 80%"之间选错。
6.1 三类项目的成本估算
| 项目类型 | 推荐模型档 | 估算单价 / 千次调用 | 注意事项 |
|---|---|---|---|
| 内部 IDE 插件 | 中端 Sonnet 系 / V4-Flash 系 | ¥20-50 | 严格路由,避免误用 Pro |
| ToC 内容生成 | 低端 Flash 系 + 中端 Sonnet 系 蒸馏 | ¥5-15 | 多 Agent、严格路由 |
| 复杂多步研究 | 高端 Pro + 时段包 | ¥200-500 / 小时 | 按席位计费 |
6.2 5 条具体行动
- Agent 工作流必须显式路由——意图识别、违规词、初稿一律走便宜模型,让高端模型只做"推理"。
- 缓存 + 批处理是 2026 年的省钱救命稻草——别再用即时、零缓存打法。
- 多模型 hybrid 是标配——单模型策略在 Agent 时代最贵。
- 预算系统要做"按任务成本"管理——而不是按 token。
- 关注国产开源生态(Harness 系的开源版)——能省掉一大半昂贵闭源推理。
七、写在最后
按 token 计费这件事,本质上是 GPT-3 时代给单轮对话定制的一双"鞋"。Agent 的脚长大了,这双鞋就不合脚了。
涨价方和降价方看似在博弈,本质都是在抢 Agent 框架这个新"路由器"的位置。
而开发者真正要做的,不是看哪家便宜哪家贵,而是:
在自己的 Agent 工作流里,把模型调用变成"路由问题"而不是"模型问题"。
这才是 2026 年 AI 工程化最关键的认知升级。
一线开发者视角,每周三更新深度解读。
如果本文对你有帮助,欢迎点赞、收藏、转发~
更多推荐

所有评论(0)