一天,8 万亿 Token!

8 月 3 日,据 news.conpera.ai 援引 OpenCode 公开信息,DeepSeek V4 Flash 正式版在 8 月 1 日通过 OpenCode 平台处理了 8 万亿 Token。其中,5 万亿来自免费使用,另外 3 万亿来自付费套餐 OpenCode Go。

这个数字并不是 DeepSeek 全网调用量,也不是经第三方审计的行业统计,而是 OpenCode 对自家平台一天流量的公开披露。即便如此,8 万亿 Token 仍足以成为一个值得观察的信号:AI 编程工具和 Agent 工作流正在把模型调用从“一问一答”推向长时间、多步骤、反复执行的新阶段。

OpenCode 公开的 8T Token 数据

*图 1:OpenCode 称,DeepSeek V4 Flash 在 8 月 1 日处理 8 万亿 Token,其中 5 万亿来自免费使用、3 万亿来自 OpenCode Go。该数字为平台自报,未见第三方审计。图源:OpenCode/X。*

这次事件最值得讨论的并不是“哪款模型登顶”,而是模型的评价单位正在变化。聊天机器人时代,用户更关心一次回答是否准确;Agent 时代,团队还要追问:一项任务要调用多少轮、失败几次、运行多久,最后一共花了多少钱。

一、8 万亿 Token 究竟是什么规模

Token 是模型读取和生成文本时使用的基本计量单位,但 Token 数量不能直接换算成用户数、请求数、收入或有效完成的工作量。同样是 100 万 Token,可能来自大量短请求,也可能来自少数长上下文任务;可能对应成功交付,也可能主要消耗在重试、错误恢复和重复读取上。

OpenRouter 在官网披露,其平台每月处理 200 万亿以上 Token、接入 400 多款模型。若只做算术平均,200 万亿 Token 相当于每天约 6.7 万亿。因此,OpenCode 披露的 8 万亿单日数据,至少在数值量级上已经接近甚至超过一个大型聚合平台的月均日处理量。

但这里必须保留一个重要限制:OpenCode 与 OpenRouter 是否采用相同的输入、输出、推理、缓存和内部流量统计规则,目前没有公开证据。两组数字可以帮助读者感受规模,不能据此制作严格的平台排名,更不能写成一场同口径的“胜负”。

OpenRouter 周榜快照

*图 2:OpenRouter 周榜快照中,DeepSeek V4 Flash 以 7.22T Token 位列当周第一。榜单会随时间变化,也不代表模型能力排名。图源:OpenRouter。*

从 OpenRouter 自己公开的长期数据看,低成本模型与 Agent 流量之间确实存在明显联系。OpenRouter 6 月发布的一份分析称,V4 发布后,DeepSeek 在其平台的 Token 份额明显增长,Agent 类工作负载是主要增量来源之一。该平台还特别说明,Token 份额统计的是输入和输出总量,不等于消费金额;对低价模型来说,用量占比和收入占比可能相差很大。

因此,8 万亿首先说明“被调用得很多”,却不能单独证明“质量最好”“用户最多”或者“商业收入最高”。免费额度、产品入口、活动窗口和平台推荐都可能放大短期用量。把这些变量分开,才不会把采用规模误读成能力证书。

二、V4 Flash 在 7 月 31 日更新了什么

DeepSeek 官方更新日志显示,V4 Flash 正式版于 7 月 31 日进入公开测试,调用时仍使用 deepseek-v4-flash。官方明确写道,0731 版本保持 Preview 版的模型架构和规模,主要变化是重新进行后训练,并重点增强 Agent 能力。

这次更新还补上了两个直接面向开发工具的接口变化:V4 Flash 原生支持 Responses API,并针对 Codex 做了适配。对开发者来说,这类适配并不等于模型底层能力突然改变,但它会影响工具调用格式、连续推理、状态传递和接入成本,进而影响 Agent 能否顺利跑完整条任务链。

预训练与后训练说明图

*图 3:预训练与后训练的简化说明。该图用于帮助理解“架构不变、重新后训练”,不代表完整训练流程。制图:APPSO。*

官方公布的 Terminal Bench 2.1 成绩为 82.7,另外还列出了 NL2Repo、Cybergym、DeepSWE、Toolathlon Verified 等 Agent 或代码任务结果。不过,DeepSeek 同时给出了关键测试条件:公开代码 Agent 基准采用尚待发布的 DeepSeek Harness 极简模式,推理档位为 maxtop_p=0.95temperature=1.0;DSBench-FullStack 和 DSBench-Hard 则是内部测试集。

这意味着 82.7 可以说明 DeepSeek 的优化方向和官方环境中的上限表现,但不能直接当作普通 IDE、CLI 或团队流水线中的可复现成绩。框架、提示词、工具权限、最大步数和失败恢复策略,都会改变 Agent 的最终完成率。

三、Agent 为什么会迅速放大 Token 消耗

传统聊天任务通常有清晰边界:用户输入一个问题,模型生成一段答案,对话可能就此结束。Agent 任务的边界完全不同。以一次代码库升级为例,模型可能先扫描目录和依赖文件,再定位调用关系、提出修改计划、编辑多个文件、执行测试、读取报错、回到代码继续修正,最后还要检查差异并总结结果。

在这个过程中,真正交付给用户的可能只是几个改动文件,但模型需要反复读取上下文。每一次工具返回、终端日志、测试报告和代码片段都会进入后续请求;如果任务失败,新的尝试还会携带此前历史。一个看似简单的目标,因而可能展开成几十个模型回合。

Agent 还会引入三类在单轮聊天中不明显的额外消耗。

第一类是“环境理解成本”。模型要先弄清仓库结构、约束和当前状态,尚未开始修改就已经产生大量输入 Token。

第二类是“行动验证成本”。模型执行命令后必须读取结果,判断成功或失败,再决定下一步。验证越充分,调用链通常越长。

第三类是“失败恢复成本”。选错工具、参数格式错误、测试超时或上下文遗漏,都可能让模型重新规划。高单轮得分并不必然带来最低总成本,因为一次昂贵的失败可能抵消多次低价调用的节省;反过来,单价很低但反复重试,也可能拖慢交付。

这正是 8 万亿 Token 的现实背景。最终产物的字数或代码行数并没有同步增长,模型在“观察、行动、检查、再行动”中的中间计算却显著增加。Agent 经济性讨论的核心,也从为一段输出计费,变成为一条能够走到终点的执行链计费。

四、每百万输出 Token 约 2 元,改变了什么

DeepSeek 8 月 3 日官方价目表显示,V4 Flash 每百万输入 Token 的缓存命中价为 0.0028 美元、缓存未命中价为 0.14 美元,每百万输出 Token 为 0.28 美元,约合人民币 2 元。官方页面同时提醒价格可能调整,并预告未来将采用峰谷计价;具体生效时间仍以官方公告为准。

主流 Agent 模型公开 API 价格整理

*图 4:截至 2026 年 8 月 3 日的主流 Agent 模型标准公开 API 价格整理。不同模型的汇率、缓存规则和 Tokenizer 不同,图中单价不能直接等同实际任务成本。制图:APPSO,数据源见图。*

低单价的直接影响,是一些过去需要严格限制调用次数的流程,可以容纳更多探索和校验。例如,大批量整理文档、迁移重复代码、执行静态检查或为多个候选方案生成原型,都可能从“只在少量样本上试运行”转向“覆盖完整数据集”。

但只看输出单价仍然不够。一项 Agent 任务的总账单,至少由输入量、缓存命中率、推理与输出量、重试次数、并行 Agent 数量和任务持续时间共同决定。模型如果输出更长、计划更绕,或者经常在同一个错误上反复尝试,实际成本可能高于价目表带来的第一印象。

更完整的计算方式应当是:先定义相同任务和验收标准,再记录每个模型的成功率、人工接管次数、端到端时间与总 Token,最后比较“成功完成一次任务”的平均成本。只有这样,单价优势才会转化成可用于工程决策的证据。

五、低价不只是一张价目表,背后还有架构效率

DeepSeek 4 月公开的 V4 技术报告显示,V4 系列采用混合专家架构,并通过 Compressed Sparse Attention(CSA)与 Heavily Compressed Attention(HCA)的混合注意力设计提高长上下文效率。报告给出的 V4 Flash Preview 规模为 2840 亿总参数、每个 Token 激活 130 亿参数,并支持 100 万 Token 上下文。

其中,CSA 会先压缩 KV 条目,再选择更相关的部分参与注意力计算,同时保留滑动窗口中的局部信息。它试图解决的不是“让模型少记一点”,而是在超长上下文里减少每一步都遍历全部历史所带来的计算和缓存压力。

DeepSeek CSA 核心架构

*图 5:CSA 核心架构示意:压缩 KV 条目后进行 Top-k 选择,并保留滑动窗口条目以维持局部依赖。图源:DeepSeek V4 技术报告 Figure 3。*

不过,架构效率、服务成本和 API 定价是三个不同层面。模型一次推理需要多少计算,取决于激活参数、精度、上下文长度、缓存与硬件利用率;厂商还要承担训练、后训练、评测、安全、基础设施和闲置容量;最终对外价格还会受到市场策略和规模目标影响。

因此,不能从 2 元的输出价反推出 DeepSeek 的真实成本或利润,也不能认为其他模型更贵就只是架构落后。高价服务可能包含更稳定的吞吐、企业支持、合规能力和特定难题上的更高成功率。真正有意义的比较,仍应落到同一工作流的完成质量和总支出。

六、榜单差距和账单差距,需要分开看

8 月 2 日的 Arena 前端编码榜单快照把 V4 Flash high 列入前排,但页面同时标注了 Preliminary。这类众测榜单能够反映特定时间段的用户偏好,却会受到投票样本、对手分布、提示词和模式设置影响,排名也可能继续变化。

Arena 前端编码榜单快照

*图 6:Arena 前端编码榜单 2026 年 8 月 2 日快照,V4 Flash high 当时暂列第 8,结果仍标注 Preliminary。图源:Arena。*

Artificial Analysis 的 8 月 3 日快照提供了另一个观察角度。在其 Intelligence Index v4.1 中,DeepSeek V4 Flash 0731 Max 得分为 50,跑完整套评测产生的调用费用为 72.02 美元;同一图中的 Claude Opus 4.8 Max 得分为 56,对应费用为 3752.55 美元。

Artificial Analysis 能力与评测成本图

*图 7:Artificial Analysis 的能力—整套评测调用成本快照。V4 Flash 位于约 50 分、较低成本区间;不同点位受模型版本、推理档位、价格和评测配置影响。图源:Artificial Analysis。*

这个对比很醒目,但它的适用范围也很明确。72.02 美元和 3752.55 美元是运行 Artificial Analysis 指定评测集时的总调用费,不是所有生产任务的固定价格;50 分与 56 分是复合指数,不代表任意单项任务只差 6 个百分点。Artificial Analysis 还将 Opus 4.8 页面标记为已被更新型号替代,部分数据不再持续更新。

换言之,这张图证明的是“在一套具体评测中出现了显著的能力—成本差异”,而不是“V4 Flash 已经全面超过所有旗舰模型”。对于高失败代价、强安全要求或极难推理任务,能力上几分差距可能依然很重要;对于允许重试的批处理和探索性任务,低价则可能拥有更大权重。

七、开放权重降低了部署门槛,但没有消除硬件门槛

DeepSeek 已在 Hugging Face 发布 V4 Flash 0731 权重,仓库标注 MIT License,并给出 vLLM、SGLang 与本地运行指引。模型开放权重意味着团队可以检查、部署和适配模型,也为第三方推理服务与量化版本提供了基础。

DeepSeek Hugging Face 模型仓库

*图 8:DeepSeek V4 Flash 0731 的 Hugging Face 仓库页面快照,展示模型文件与仓库信息。开放权重不等于普通个人电脑可以无损运行官方配置。图源:Hugging Face/DeepSeek。*

但“每个 Token 只激活一部分参数”和“整套权重可以轻松放进消费级设备”不是同一件事。完整权重仍需存储、加载和调度,官方模型卡给出的 vLLM 示例使用一台配备 4 张 GB300 的节点。社区量化可以降低内存要求,却可能改变代码、长上下文和工具调用表现,不能直接把量化版本的本地体验等同于官方 API 成绩。

对大多数开发团队来说,开放权重带来的现实价值未必是立即自建,而是增加部署和供应选择:可以先使用官方 API 验证工作流,再根据数据边界、调用规模、延迟和运维能力决定是否迁移到第三方托管或自有基础设施。

八、模型选型的单位正在从“回答”变成“任务”

8 万亿 Token 更像一份需求侧报告。它显示,低价格、免费入口和 Agent 工具结合后,可以迅速释放巨大的模型调用量;同时也提醒开发者,调用量本身不是最终目标。真正需要优化的,是单位预算内完成并通过验收的工作。

对于重复、可验证、允许重试的任务,低价模型可以承担第一轮探索、批量处理和自动检查;对于难度高、错误代价大或需要严格一致性的任务,团队可能仍会选择更昂贵的模型,或者设计“低价模型先处理、困难样本再升级”的分层策略。

一份更适合 Agent 时代的模型评估表,至少应同时记录五项指标:任务完成率、平均重试次数、端到端耗时、人工接管次数和成功任务总成本。如果只记录单次回答分数,就会漏掉长任务里最昂贵的失败;如果只记录 Token 单价,又会忽略低质量重试造成的时间和费用。

DeepSeek V4 Flash 这次引发关注,不是因为 8 万亿 Token 已经证明它是“最强模型”,而是因为它把一个过去容易被忽略的问题推到了台前:当模型开始连续工作几个小时,团队最终衡量的不是某一次漂亮回答,而是完成整项任务的能力。

未来模型竞争仍然需要能力榜单,但榜单之外会多出一张工程账单。谁能在可接受的时间和失败率内,用更低的总成本稳定交付结果,谁才更有机会成为 Agent 工作流中的默认选择。

来源说明

本文依据以下公开资料独立整理,数据均为 2026 年 8 月 3 日前后的页面或榜单快照:

  • news.conpera.ai:援引公开资料整理
  • DeepSeek 官方 API Docs:Change Log、Models & Pricing
  • DeepSeek-AI:《DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence》技术报告
  • DeepSeek Hugging Face:DeepSeek-V4-Flash-0731 模型仓库
  • OpenRouter:平台公开规模数据、DeepSeek V4 Agent 流量分析
  • Artificial Analysis:DeepSeek V4 Flash 0731 Max、Claude Opus 4.8 Max 模型页面

平台用量、模型价格和榜单排名会持续变化。文中跨平台数字仅用于量级观察,不应视为同口径审计结论。

更多推荐