周一早上打开开发者后台,DeepSeek 的弹窗公告还挂在那里:「计划近期整体上调 API 服务定价,预计涨幅较大」。群里有人连夜写起了多模型路由,有人把 V4-Pro 的调用量降到了零。我盯着自己上个月的账单——一个月 4000 万 token 的调用量,全压在 DeepSeek 上,这一涨,我的 SaaS 成本结构要重新算一遍。

涨多少?按照 5 月 25 日「永久降价」的 1/4 定价(3 元/6 元)反推,如果恢复到原价(12 元/24 元),那就是 300% 的涨幅。知乎上 276 个回答、158 万浏览,最高赞的说法是:V4-Flash 性价比太炸,7 月 31 日正式版上线后全球调用量把服务器「蹬冒烟了」,峰谷定价根本削不动 agent 的负载——因为 coding agent 没有上下班时间,跨时区 24 小时都在跑。

于是问题变成:DeepSeek 涨价后,我该换谁?

我把这个问题做成了一次实测:拿 5 款国产模型的官方定价页 + 第三方评测数据,算了三笔账——同样的活,各家收多少钱;同样的钱,各家干多少活;以及换过去要改多少代码。

先看总表:5 款模型一张表看清格局

先说清楚,以下价格全部来自各家官方定价页(2026 年 8 月 7 日逐条核对),单位是元/百万 token,DeepSeek 取平峰价(工作日高峰 9:00-12:00、14:00-18:00 翻倍):

模型 输入(缓存未命中) 输入(缓存命中) 输出 相对 V4-Flash 输出价倍数
DeepSeek V4-Flash 1 0.02 2 1x
DeepSeek V4-Pro 3 0.025 6(高峰 12) 3x(高峰 6x)
Kimi K3 20 2 100 50x
Qwen3.7-Max 12 36 18x
GLM-5.2 10 31 15.5x

看完这张表你大概明白知乎那 276 个回答在吵什么了——V4-Flash 的输出价是 K3 的五十分之一。注意,K3 是 7 月 16 日刚开源的 2.8 万亿参数「全球最大开源模型」,GLM-5.2 是智谱的旗舰,Qwen3.7-Max 是阿里的旗舰,它们都不是杂牌。差距不是「贵一点」,是数量级。

但这只是牌价。真正决定账单的还有三件事:缓存折扣、峰谷定价、以及模型到底能不能干你的活。下面逐个拆。

维度一:单价拆解——输出价决定生死

先算第一笔账:纯输出成本。对 coding agent 来说,输出 token 是账单的大头——一次代码生成任务,输出可能占 60% 以上。

同样的 100 万输出 token:

模型 花费 备注
DeepSeek V4-Flash 2 元 平峰;高峰 4 元
DeepSeek V4-Pro 6 元(高峰 12 元) 平峰是 Flash 的 3 倍
GLM-5.2 31 元 Flash 的 15.5 倍
Qwen3.7-Max 36 元 Flash 的 18 倍
Kimi K3 100 元 Flash 的 50 倍

我一个月的 agent 调用量大约 4000 万 token,其中输出约 1500 万。全用 V4-Flash:300 元/月;全用 K3:15000 元/月。这个差价不是「优化一下」能抹平的。

有人会反驳:K3 开源、能本地部署,不能这么比。对,但本地部署 2.8 万亿参数模型需要的显存,比绝大多数小团队的月 API 账单贵两个数量级——这个话题我在 K3 踩坑实录里算过,这里不展开。

维度二:能力拆解——便宜的不只是「够用」,是「更好用」

价格差 50 倍,如果便宜的那个是残废,那贵得有道理。但 2026 年 8 月的诡异之处在于:最便宜的 V4-Flash 正式版,能力反而超过了自家 Pro 预览版

看三组第三方数据:

Artificial Analysis 智能指数(独立第三方,统一测试集,2026-07-31 发布当天入榜):

模型 智能指数 备注
Kimi K3 57 开源榜第一
GLM-5.2 51
GPT-5.6 Luna 51 OpenAI 最便宜款
DeepSeek V4-Flash (0731) 50 比自家 V4-Pro 预览版高 6 分
DeepSeek V4-Pro 预览版 44

Terminal Bench 2.1(真实终端环境实操:改配置、跑脚本、修 bug):V4-Flash 正式版 82.7 分,官方称「远超 V4-Pro 预览版」。

OpenCode 平台 8 月 5 日调用数据:单日 7.5T token,V4-Flash 独占 6.3T,占比 84%。开发者用脚投票的结果是:便宜 + 能力在线 = 断档领先。

更有意思的是技术细节:V4-Flash 正式版和预览版结构、尺寸一模一样(284B 总参/13B 激活),只重做了后训练,就把 Agent 能力拉到了 Pro 之上。同一个发动机,重新调校变速箱,加速直接快一档。这说明 Flash 之前压根没摸到自己的上限。

但 Flash 有明确短板,实测中我发现两点:一是不支持视觉输入;二是世界知识「稍逊一筹」——API 文档、库行为这类事实性问题,官方自己都建议人工复核。我的用法是:跑量任务全给 Flash,卡壳的难题切旗舰。

维度三:缓存折扣——agent 时代真正的省钱密码

这是最容易被忽略、但对 agent 负载影响最大的一格。

agent 每次调用都要重发整个代码库、系统提示词、历史轨迹——重复输入在 agent 场景占比能到 80% 以上。所以「缓存命中价」才是 agent 账单的主战场。

模型 未命中输入 命中输入 命中价/未命中价
GPT-5.6 Sol $5 $0.5 10%
Claude Opus 5 $5 $0.5 10%
Gemini 3.1 Pro $2 $0.2 10%
DeepSeek V4-Flash 1 元 0.02 元 2%
DeepSeek V4-Pro 3 元 0.025 元 0.83%

美国三家厂商的缓存折扣整齐划一都是「一折」,DeepSeek 打到 0.83 折。原因在架构:别人的 prompt cache 放在显存里(每 GB 几十美元的 HBM),DeepSeek 把压缩后的注意力条目直接落盘(每 GB 几毛钱)。同样是 100 万 token 重复上下文,Claude Opus 5 收 $0.5,V4-Pro 收 0.025 元——差 138 倍。

这一格对 agent 开发者意味着什么?意味着换模型的迁移收益,缓存命中价才是大头。我自己测过:一个 50 万 token 系统提示词的 agent,切到 DeepSeek 后账单掉了两个数量级,主要就掉在这一格。

维度四:峰谷定价与迁移成本——「换谁」的最后两块拼图

峰谷定价:DeepSeek 工作日 9:00-12:00、14:00-18:00 翻倍。知乎高赞说得对——削峰对网页/App 有用,对 coding agent 基本没用,因为 agent 可以批式、异步、跨时区跑。但对国内团队有个实际影响:把重任务挪到非高峰时段,成本直接减半。我现在的做法是给 agent 加一个调度层:

# 简单的高峰规避:高峰时段走 Flash 平峰缓存,非高峰才放行 Pro
from datetime import datetime

def is_peak_hour(dt: datetime) -> bool:
    """DeepSeek 高峰时段: 工作日 9-12, 14-18 (北京时间)"""
    if dt.weekday() >= 5:  # 周末
        return False
    return (9 <= dt.hour < 12) or (14 <= dt.hour < 18)

def route(model: str) -> str:
    if model == "deepseek-v4-pro" and is_peak_hour(datetime.now()):
        return "deepseek-v4-flash"  # 高峰降级到 Flash,成本减半
    return model

迁移成本:这是「换谁」决策里经常被高估的一环。实测发现,国产模型几乎都兼容 OpenAI 格式,切换通常是改一个 model 参数的事:

# 从 DeepSeek 切到 Qwen3.7-Max:只改 base_url + model
from openai import OpenAI

client = OpenAI(
    api_key="你的key",
    base_url="https://dashscope.aliyuncs.com/compatible-mode/v1",  # 阿里云百炼
)
resp = client.chat.completions.create(
    model="qwen3.7-max",  # 原来是 deepseek-v4-pro
    messages=[{"role": "user", "content": "帮我 review 这段代码"}],
)

DeepSeek 官方还原生支持 OpenAI 的 Responses API 格式,并且针对性适配了 Codex——不用改 Base URL 就能切模型。也就是说,如果只是想在 DeepSeek 涨价期保留一个备胎,切换成本几乎为零,完全可以做多模型路由:便宜任务走 Flash,难题走旗舰,哪家便宜切哪家。

选型建议:按场景对号入座

跑量型 agent(代码生成、批量任务、RAG 管道)→ DeepSeek V4-Flash
输出 2 元/百万 token + 缓存命中 0.02 元,这个价位没有对手。V4-Flash 正式版的 Agent 能力(Terminal Bench 82.7、AA 指数 50)已经证明它不是「廉价替代品」而是「性价比主力」。我的 SaaS 已经 90% 流量切到 Flash,账单降了 60%+。

复杂推理 / 高难度任务 → V4-Pro 平峰 + 高峰规避
V4-Pro 平峰输出 6 元,比 K3(100 元)、Qwen3.7-Max(36 元)、GLM-5.2(31 元)都便宜,配合上面的高峰规避调度,成本可控。等 V4-Pro 正式版发布(官方已预告「尽快」),能力还会有一波提升。

需要视觉 / 多模态 → 别选 Flash,看 GLM-5.2 或 Qwen3.7-Max
Flash 不支持视觉输入是硬伤。多模态场景 GLM-5.2(AA 指数 51)和 Qwen3.7-Max 是更合适的选择,价格虽然贵 15-18 倍,但这类任务量通常不大。

有合规/数据隔离要求 → Kimi K3 本地部署
K3 是唯一「全面开源可自部署」的旗舰,输出 100 元/百万 token 的 API 价其实是在劝你自己部署。适合数据不能出内网的企业场景,成本模型完全不同(显存一次性投入换长期边际成本)。

趋势观察:涨价不是 DeepSeek 一家的事

最后说三个趋势,比「换谁」更重要:

  1. 国产模型的「白菜价」时代正在收尾。 腾讯云一个月内两次涨价,智谱多次提价,现在轮到 DeepSeek。8 月 6 日的公告本质上是整个行业从「低价抢市场」转向「合理定价」的信号。开发者要习惯 API 价格是波动的,而不是只降不升。

  2. 便宜的模型越来越能打,旗舰的护城河在变窄。 V4-Flash 用 13B 激活参数反超自家 Pro 预览版,K3 开源登顶调用榜——「参数越大越强」的直觉在 2026 年已经失效,后训练和架构的效率才是分水岭。

  3. 缓存命中价将成为下一轮竞争焦点。 agent 时代 80%+ 的输入是重复的,谁把重复输入的边际成本打到最低,谁就拿到 agent 开发者的长期账单。DeepSeek 的磁盘 KV 缓存已经把这一格打到 0.83 折,这个技术路线值得关注——下半年昇腾 950 超节点上市后,Pro 价格还有下调空间(官方定价页已明示)。

我的结论是:先别急着「换」,先学会「路由」。 把 Flash 当主力、Pro 当攻坚、高峰规避当默认配置,这个组合在涨价落地前仍然是最优解。真到涨到不能忍的那天,切换成本已经提前铺好了。

延伸阅读:AI编程工具从狂欢到清醒:Cursor和Claude Code混用3个月烧了多少GPT-5.6 降价 80% 后踩坑实录:Fast 模式 2 倍价Claude Opus 5 半价实测:3 个真实任务追平 Fable 5?

📌 系列文章

测了 5 款工具才发现差距这么大。关注我 👆 第一时间获取更多 AI 工具深度横评。

更多推荐