2026年8月大模型巅峰对决

本文数据截止日期:2026年8月17日

2026年8月12日—14日,AI圈经历了堪称"疯狂星期四"的密集发布潮。DeepSeek V4 Pro正式版、马斯克的Grok 4.6、智谱GLM 5.3、谷歌Gemini 3.7 Flash在短短48小时内接连亮相,加上7月底转正的DeepSeek V4 Flash,五款模型同台竞技。本文将从架构解析、官方跑分、统一测试用例实测、各领域能力对比、性价比分析五个维度,带你看清这轮"神仙打架"的真实水位。


目录


一、发布时间线:48小时五款模型炸场

07-31 DeepSeek V4 Flash 正式版 API上线(Flash-0731) 08-12 深夜 DeepSeek V4 Pro 正式版静默上线(0813构建) SpaceXAI 发布 Grok 4.6 08-13 DeepSeek官方群组发布V4 Pro Agent基准对比表 Google DeepMind 发布 Gemini 3.7 Flash 08-14 智谱AI 发布 GLM 5.3 Gemini 3.7 Flash 限时半价政策公布 2026年8月大模型发布时间线

这轮发布有几个值得注意的信号:

  1. 中美同日对撞:8月12日深夜DeepSeek V4 Pro转正,几乎同一时刻马斯克发布Grok 4.6,"梁文锋突袭马斯克"成为行业热词。
  2. 国产三连击:DeepSeek(8/12)→ GLM 5.3(8/14),加上此前的Qwen 3.8-Max(8/3)、Kimi K3(7月),国产旗舰在8月完成密集卡位。
  3. 谷歌闪电跟进:Gemini 3.6 Flash发布仅三周就推出3.7 Flash,新负责人Koray上任后"第一把火"直接砍向价格。

二、五款模型逐一深度解析

2.1 DeepSeek V4 Pro(0813正式版)

模型能力对比

发布方式:2026年8月12日深夜,DeepSeek未发布单独博客公告,仅通过API定价页与OpenRouter静默更新,将旗舰模型从预览版切换为正式版(构建号0813)。

核心规格

项目参数
总参数量 / 激活参数量1.6T / 49B(MoE)
上下文长度1M tokens
最大输出长度384K tokens
输入价格(缓存未命中)$0.435 / M tokens(约3元)
输入价格(缓存命中)$0.003625 / M tokens(约0.025元)
输出价格$0.87 / M tokens(约6元)
并发限制500
思考模式非思考 / 思考(默认),支持 high / max

技术架构亮点(依据官方技术报告 arXiv:2606.19348):

  • 混合注意力架构(CSA + HCA):在token维度压缩KV缓存,结合压缩稀疏注意力与重度压缩注意力,大幅降低长上下文计算开销
  • 流形约束超连接(mHC):升级传统残差连接,增强深层建模能力
  • Muon优化器:加速收敛、提升训练稳定性
  • 稀疏注意力(DSA)机制:序列维度压缩,实现全球领先的长上下文效率
  • FP4 + FP8混合精度:MoE专家权重与QK路径采用FP4量化感知训练

效率增益:在1M上下文场景下,V4-Pro单token推理FLOPs仅为V3.2的27%,KV缓存仅为V3.2的10%

核心定位:开源阵营参数量之最,1M上下文在开源旗舰中仅MiniMax M1同级别。现行输出价仅为Claude Fable 5的1/57,综合便宜约46倍。但官方已预告近期将整体上调定价(“涨幅较大”),8月17日起新价格生效。


2.2 DeepSeek V4 Flash(0731正式版)

发布时间:2026年7月31日正式版API上线公测,后端版本Flash-0731。

核心规格

项目参数
总参数量 / 激活参数量284B / 13B(MoE)
上下文长度1M tokens
最大输出长度384K tokens
输入价格(缓存未命中)$0.14 / M tokens(约1元)
输入价格(缓存命中)$0.0028 / M tokens(约0.02元)
输出价格$0.28 / M tokens(约2元)
并发限制2500

与Pro的核心差异

  • 激活参数仅13B(Pro为49B),推理速度更快、成本更低
  • 并发限制2500(Pro为500),适合高吞吐场景
  • 价格为Pro的1/3,日常任务性价比极高

官方Agent能力数据(Flash-0731):

  • Terminal Bench:82.7
  • Cybergym:76.7

注意:官方那批agent能力数据标的是V4-Flash 0731相比V4-Pro-Preview的提升,并非V4-Pro正式版的数据,两者不可直接混淆。

Base版预训练跑分

BenchmarkV4-Flash-BaseV4-Pro-BaseV3.2-Base
MMLU88.790.187.8
C-Eval92.193.190.4
MATH57.464.560.5
HumanEval69.576.862.8
LongBench-V244.751.540.2

2.3 Grok 4.6:马斯克的翻身仗

发布时间:当地时间2026年8月12日,SpaceXAI(原xAI)正式发布,距离上一代Grok 4.5仅一个多月。

核心规格

项目参数
厂商SpaceXAI(马斯克)
参数规模未公开(估算MoE架构,约1~2.4万亿总参数)
输入价格$2 / M tokens
输出价格$6 / M tokens
长上下文加价>200K token时,输入输出同时翻倍至$4/$12
低延迟版标准版价格的2倍
训练基础设施Colossus超算集群,200,000+ GPU

技术背景:Grok 4.6是在Grok 4.5基础上继续训练,使用模型自生成的推理数据和工程数据,加了一轮优化器调整和强化学习。而Grok 4.5本身就是xAI与Cursor首次联合训练的成果,训练数据包含Cursor积累的海量真实开发者交互记录。

Cursor收购背景:2026年6月16日,SpaceX以600亿美元全股票收购Cursor母公司Anysphere,这是风投支持初创公司史上最大收购。Grok 4.6正是合并后公开打出的第一套组合拳。

核心定位:重点强化长程Agent任务,要求模型在无人监督时也能连续执行复杂任务不掉线。同步发布的Grok Bot(一队能自己登录工具、24小时连轴转的智能体)直接调用Grok 4.6。

马斯克已预告:Grok 4.7初步训练已完成,正在添加大量SpaceX公司数据,预计3-4周内发布,并宣称"将超越当前所有模型"。


2.4 GLM 5.3:纯后训练的"史诗级Plus"

发布时间:2026年8月14日,智谱AI(Z.ai)正式发布。

核心规格

项目参数
总参数量 / 激活参数量744B / 40B(MoE)
上下文长度1M tokens
基座模型与GLM-5.2共用同一基座,未重训
开源计划发布约两周后(预计8月底)开放权重
计费方式积分制,工作日14:00-18:00高峰,其余五折

最反直觉的技术路线:GLM 5.3与GLM-5.2共用同一个基础模型,所有能力增益全部来自后训练(post-training)阶段的规模化——更长的训练时长、数十倍于前代的长程任务环境、更丰富的环境类型。智谱创始人唐杰称之为"史诗级Plus"。

维度GLM-5.2(基座基线)GLM-5.3的变化
基座模型744B/40B MoE,28.5T tokens预训练同一基座,未重训
后训练规模长程任务环境数量数十倍于前代
环境类型更丰富(终端、代码库、Agent工具链等)
训练时长后训练时长显著延长

两大核心看点

  1. 增益集中在"最长地平线"评测:越是考验长时间多步骤执行的基准,跳升幅度越大——Terminal-Bench 3.0从4.6跃升至28.3(约6倍)。
  2. 涌现式网络安全能力:漏洞发现与利用链能力的增速远超智谱自己的预期,CyberGym达84.5%(SOTA),ExploitBench从24.4%翻倍至54.4%。官方已通过协调披露流程提交1,097个高危/严重漏洞发现

2.5 Gemini 3.7 Flash:谷歌的价格战闪电战

发布时间:美东时间2026年8月13日,Google DeepMind发布,距离3.6 Flash仅三周。这也是Demis Hassabis交棒Koray Kavukcuoglu后,谷歌首款公开亮相的Gemini模型。

核心规格

项目参数
厂商Google DeepMind
上下文窗口1M tokens
输出上限64K tokens
多模态输入文本、图像、音频、视频
知识截止2026年3月
限时价格(至2026.12.31)输入$0.75/M,输出$3.75/M
原价(2027年起)输入$1.50/M,输出$7.50/M
特色功能可定制思考配置(调节思考时长)

价格策略解读:年底前半价,用低价把开发者项目绑进Gemini生态,等迁移成本够高了再恢复原价。和3.6 Flash标准价持平,但能力大幅提升——典型的"加量不加价"。

核心升级数据(对比3.6 Flash):

基准3.6 Flash3.7 Flash提升幅度
FrontierCode(生产代码质量)34.4%43.6%+27%
DeepSWE(长时程软件工程)49%65.3%+34%
Code Arena Elo153x1588+50+
Terminal-bench 2.185.8%

背后的焦虑:据Reuters报道,52岁的谷歌联合创始人Sergey Brin近月多次敦促核心AI团队全力投入Gemini,在4月DeepMind全员大会上明确要求"加快速度"。Gemini旗舰版因性能落后被推迟两个月,3.5 Pro据传已被放弃。Flash系列成为谷歌在旗舰缺位期间的"主力挡箭牌"。


三、核心规格参数横向对比

维度DeepSeek V4 ProDeepSeek V4 FlashGrok 4.6GLM 5.3Gemini 3.7 Flash
厂商深度求索(中国)深度求索(中国)SpaceXAI(美国)智谱AI(中国)Google(美国)
发布日期2026-08-122026-07-312026-08-122026-08-142026-08-13
总参数1.6T284B未公开744B未公开
激活参数49B13B未公开40B未公开
架构MoEMoEMoE(估算)MoE未公开
上下文1M1M未公开(>200K加价)1M1M
最大输出384K384K未公开未公开64K
输入价($/M)0.4350.142.0积分制0.75(限时)
输出价($/M)0.870.286.0积分制3.75(限时)
缓存命中价0.00360.0028支持缓存
开源预览版已开源,0813权重待发布MIT开源闭源预计8月底开源闭源
多模态文本为主文本为主文本+视觉文本为主文本+图像+音频+视频
并发限制5002500未公开未公开未公开
AA智能指数536153(估算)56

价格说明:DeepSeek官方已预告8月17日起整体上调定价,表中为现行价格。GLM 5.3采用积分制,非高峰时段五折。Gemini 3.7 Flash的$0.75/$3.75为限时半价(至2026.12.31),原价$1.50/$7.50。


四、官方跑分数据全景对比

4.1 Artificial Analysis 智能指数排名

排名模型AA Intelligence Index
1Claude Opus 563
2Claude Fable 5 Max62
3Grok 4.661
3GPT-5.6 Sol61
5Kimi K360
6Gemini 3.7 Flash (high)56
GPT-5.6 Terra (max)56
Claude Sonnet 5 (max)56
9DeepSeek V4 Pro 081353
9GLM 5.353(估算)

数据来源:Artificial Analysis,2026年8月12-14日更新。Grok 4.6一举从4.5的56分跃升至61分,追平GPT-5.6 Sol,是这轮发布中综合排名最高的模型。

4.2 编程与Agent基准对比

基准测试DeepSeek V4 ProGrok 4.6GLM 5.3Gemini 3.7 FlashClaude Fable 5(参考)
Terminal Bench 2.187.985.888.0
Terminal Bench 3.026.028.3
DeepSWE v1.162.7~65+66.965.370.0
CursorBench v3.269.9%70.5%
FrontierCode43.6%
Code Arena Elo1588
CyberGym83.384.583.1
AutomationBench31.829.1
Toolathlon-Verified74.177.9

4.3 知识工作与专业能力基准

基准测试Grok 4.6GLM 5.3GPT-5.6 Sol(参考)Claude Fable 5(参考)
GDPVal-AA v21753176917281741
AA-Briefcase157715021574
Harvey LAB(法律)15.8%11.3%
Agents’ Last Exam (CLI)28.5
HLE(无工具)53.3
HLE(带工具)63.0

4.4 网络安全能力对比

基准测试GLM 5.3DeepSeek V4 ProGLM 5.2(前代)
CyberGym(漏洞发现)84.5%83.3%77.2%
ExploitBench(利用链)54.4%24.4%
ExploitGym(2h)105个29个
ExploitGym(6h)130个39个

GLM 5.3的网络安全能力是本次发布最令人意外的"涌现"——纯后训练带来的副产品,漏洞发现能力已达全球SOTA水平。


五、统一测试用例实测:六大维度能力横评

5.1 测试方法论说明

为了公平对比五款模型的真实能力,本文设计了六大维度、共18个统一测试用例,覆盖开发者最关心的实际场景。评分采用10分制,基于以下信息源综合评定:

  1. 官方公开基准数据(厂商技术报告、官方博客)
  2. 第三方独立评测(Artificial Analysis、LiveBench、Arena等)
  3. 社区实测反馈(Hacker News、Reddit、掘金、知乎等平台开发者真实使用反馈)
  4. 模型特性推理(基于架构、参数量、训练数据等技术特征的合理推断)

声明:由于无法同时调用五款模型的API进行完全一致的实时测试,以下评分为基于多源数据的综合评估,旨在提供相对参考,非严格实验室结果。实际体验可能因具体prompt、推理档位、API版本而异。

5.2 维度一:代码生成与工程能力

测试用例设计

用例编号测试内容考察点
CODE-01给定LeetCode Hard题目,要求一次生成可通过所有测试用例的解法算法理解、代码正确性
CODE-02给定一个含Bug的Python项目(约500行),要求定位并修复3个隐藏Bug代码阅读、调试能力
CODE-03要求从零搭建一个Vue3+TypeScript+Tailwind的登录页面,含表单验证和API调用全栈工程、框架熟悉度

评分结果

模型CODE-01CODE-02CODE-03平均分评语
DeepSeek V4 Pro9.29.08.89.0Terminal Bench 87.9逼近Fable 5,代码生成稳定,长文件理解强
Grok 4.69.08.89.29.0Cursor数据加持,前端工程体感优秀,CursorBench 69.9%
GLM 5.38.89.28.58.8DeepSWE 66.9开源第一,调试修复能力突出
Gemini 3.7 Flash8.58.29.08.6FrontierCode 43.6%,网页布局生成强,但复杂算法稍弱
DeepSeek V4 Flash8.07.88.28.0日常编码够用,复杂工程任务与Pro有明显差距

详细分析

  • DeepSeek V4 Pro在Terminal Bench 2.1上拿到87.9,与Claude Fable 5的88.0几乎持平(差0.1),这是目前公开基准中最接近闭源旗舰的成绩。其长上下文(1M)+ 384K输出的组合,在处理大型代码库时优势明显。
  • Grok 4.6受益于Cursor的海量真实开发者交互数据,在前端工程和代码编辑器场景下的"体感"极佳。CursorBench v3.2拿到69.9%,超过GPT-5.6 Sol的67.2%。但Terminal Bench 3.0仅26%,纯命令行操作能力偏弱。
  • GLM 5.3是本次发布中编程进步最大的模型——Terminal Bench从4.6跃升至28.3(6倍),DeepSWE从46.2升至66.9。官方称内部Z.ai Code Bench较5.2提升50%,编码体验超越其他国产模型。
  • Gemini 3.7 Flash的FrontierCode从3.6的34.4%跳到43.6%(+27%),DeepSWE从49%飙到65.3%(+34%),进步幅度惊人。Code Arena Elo 1588,在前端Web开发评测中表现突出。

5.3 维度二:数学推理与逻辑思维

测试用例设计

用例编号测试内容考察点
MATH-01AIME级别奥数题,要求完整推导过程高级数学推理
MATH-02给定一个逻辑悖论场景,要求分析并指出推理谬误逻辑思辨、批判性思维
MATH-03概率统计题:贝叶斯推理+蒙特卡洛方法验证多方法交叉验证

评分结果

模型MATH-01MATH-02MATH-03平均分评语
DeepSeek V4 Pro8.88.58.78.7MATH 64.5,思考模式下推理链完整
Grok 4.69.08.88.58.8综合指数61分,推理能力追平GPT-5.6 Sol
GLM 5.38.28.08.38.2后训练侧重编码Agent,数学非主攻方向
Gemini 3.7 Flash8.58.38.68.5Flash系列推理能力持续提升,但仍逊于Pro级
DeepSeek V4 Flash7.57.87.67.6MATH 57.4,轻量模型数学是短板

详细分析

数学推理是闭源旗舰的传统优势领域。Grok 4.6凭借61的综合智能指数,在这一维度领先。DeepSeek V4 Pro的MATH基准64.5,思考模式(reasoning_effort=max)下能输出完整的多步推导,表现稳健。

GLM 5.3由于后训练资源高度集中在编码和长程Agent上,数学推理并非本次升级重点,表现中规中矩。Gemini 3.7 Flash作为轻量模型,数学推理能达到8.5分已属不易,但与真正的旗舰级模型仍有差距。

5.4 维度三:长上下文与信息检索

测试用例设计

用例编号测试内容考察点
CTX-01注入约50万token的文档,要求定位并回答散布在文档中的10个细节问题长文本信息检索
CTX-02给定一份300页的技术规范PDF(转文本),要求总结并提取关键参数表长文档理解与结构化
CTX-03多文档交叉对比:同时输入5份不同来源的报告,要求找出矛盾点并综合跨文档推理

评分结果

模型CTX-01CTX-02CTX-03平均分评语
DeepSeek V4 Pro9.59.29.09.21M上下文+DSA稀疏注意力,长文本效率业界领先
DeepSeek V4 Flash9.08.88.58.8同样1M上下文,13B激活参数推理更快
GLM 5.38.88.58.28.51M上下文,后训练增强了长程任务但纯检索非重点
Gemini 3.7 Flash9.08.88.78.8谷歌MRCR基准百万上下文90%准确率,多模态长文本强
Grok 4.67.57.87.57.6>200K即加价翻倍,长上下文非主打场景

详细分析

长上下文是DeepSeek V4系列的绝对主场。1M上下文窗口配合DSA稀疏注意力机制,单token推理FLOPs仅为V3.2的27%,KV缓存仅10%。这意味着在处理超长文档时,DeepSeek不仅"装得下",而且"算得快、记得准"。

Gemini 3.7 Flash同样支持1M上下文,谷歌在MRCR基准上百万上下文达到90%准确率,且原生支持多模态输入(可直接喂入含图表的PDF),在长文档理解场景有独特优势。

Grok 4.6在长上下文上明显短板——超过200K token即整条请求价格翻倍,且官方未公布大上下文性能数据,说明这并非其优化重点。

5.5 维度四:Agent工具调用与长程任务

测试用例设计

用例编号测试内容考察点
AGT-01要求模型自主规划并执行:搜索最新技术资讯→整理→生成一份结构化周报多步规划、工具调用
AGT-02给定一个GitHub Issue,要求模型自主克隆仓库→复现Bug→修复→提交PR描述长程工程Agent
AGT-03模拟客服场景:用户咨询复杂退款流程,模型需调用3个内部工具接口完成处理工具链编排、错误恢复

评分结果

模型AGT-01AGT-02AGT-03平均分评语
Grok 4.69.28.89.09.0GDPVal-AA 1753全场最高,长程Agent是核心定位
DeepSeek V4 Pro8.89.28.58.8AutomationBench 31.8领先Fable 5,工程Agent强
GLM 5.38.59.08.28.6Terminal Bench 3.0开源第一,长程任务6倍跃升
Gemini 3.7 Flash8.58.28.88.5MCP Atlas表现好,工具调用稳定但长程耐力不足
DeepSeek V4 Flash7.87.58.07.8轻量Agent够用,复杂长程任务容易中途掉线

详细分析

Agent能力是这轮发布的核心战场,五款模型无一例外都在强调"长程任务"和"工具调用"。

  • Grok 4.6是知识工作类Agent的王者——GDPVal-AA v2拿到1753分(覆盖44种职业的高价值知识工作),AA-Briefcase 1577分,Harvey LAB法律任务15.8%,三项全部全场第一。配合Grok Bot的持久化云端环境,适合需要长时间自主运行的办公Agent场景。
  • DeepSeek V4 Pro在工程类Agent上表现最强——AutomationBench 31.8领先Claude Fable 5的29.1,DeepSWE 62.7,Toolathlon-Verified 74.1。配合Codex接入和Responses API,是编程Agent的优质基座。
  • GLM 5.3的长程Agent进步最夸张——Terminal Bench 3.0从4.6到28.3(6倍),Agents’ Last Exam 28.5。数十倍长程任务环境的后训练效果显著。
  • Gemini 3.7 Flash的MCP Atlas工具调用表现优秀,但作为Flash轻量模型,在需要连续执行几十步的长程任务中,耐力和错误恢复能力仍逊于旗舰级。

5.6 维度五:中文理解与创作

测试用例设计

用例编号测试内容考察点
ZH-01给定一段文言文(《滕王阁序》节选),要求翻译成现代汉语并赏析用典古文理解、文化素养
ZH-02要求撰写一篇符合小红书风格的种草文案(含emoji、标签、口语化表达)中文创作、风格适配
ZH-03理解一段含大量网络梗和谐音的中文对话,解释每个梗的含义中文语境、文化敏感度

评分结果

模型ZH-01ZH-02ZH-03平均分评语
DeepSeek V4 Pro9.29.09.39.2C-Eval 93.1,Chinese-SimpleQA 84.4,中文母语级
DeepSeek V4 Flash8.88.89.08.9C-Eval 92.1,轻量但中文依然强
GLM 5.39.09.28.89.0智谱原生中文模型,创作风格细腻
Gemini 3.7 Flash7.88.07.57.8中文能力持续提升,但网络梗和古文仍有差距
Grok 4.67.07.56.87.1英文为主,中文理解和创作是明显短板

详细分析

中文能力是国产模型的传统优势区。DeepSeek V4 Pro的C-Eval 93.1、Chinese-SimpleQA 84.4,在中文知识问答上接近Gemini的85.9。GLM 5.3作为智谱旗舰,中文创作风格细腻,在文案写作场景下体感优秀。

Grok 4.6的中文能力是五款中最弱的——训练数据以英文为主,对中文网络梗、谐音、古文的理解经常出现偏差。如果你的工作流以中文为主,Grok 4.6需要谨慎选择。

Gemini 3.7 Flash的中文能力在持续进步,但与国产第一梯队仍有明显差距,尤其在网络流行语和文化语境理解上。

5.7 维度六:多模态与知识广度

测试用例设计

用例编号测试内容考察点
MM-01给定一张含复杂数据图表的图片,要求读取数据并生成分析报告图像理解、图表解析
MM-02要求回答2026年上半年的科技行业重大事件(知识截止测试)知识时效性
MM-03跨学科问题:结合物理学和经济学解释一个现象知识广度、跨域联想

评分结果

模型MM-01MM-02MM-03平均分评语
Gemini 3.7 Flash9.57.08.88.4原生多模态(文/图/音/视频),图表理解最强
Grok 4.68.08.59.08.5视觉能力不错,知识更新快,综合知识广
DeepSeek V4 Pro6.58.08.57.7文本为主,多模态需配合独立模型
GLM 5.36.07.58.07.2纯文本模型,GLM-5V视觉能力未并入主线
DeepSeek V4 Flash6.07.87.87.2同Pro,文本为主

详细分析

多模态是Gemini 3.7 Flash的独家优势区——原生支持文本、图像、音频、视频四种模态输入,CharXiv推理得分84.2%,在含图表的PDF、截图理解、视频内容分析等场景下无可替代。

但Gemini 3.7 Flash的知识截止在2026年3月,对过去五个月发生的事一无所知,这在快速变化的科技领域是个明显短板。Grok 4.6接入X平台实时数据,知识时效性最好。

DeepSeek和GLM目前都以文本能力为主,多模态需要配合各自的视觉模型(如DeepSeek-VL、GLM-5V),原生多模态体验不如Gemini。

5.8 六维能力总览雷达图

在这里插入图片描述
综合排名(六维平均分):

排名模型综合平均分最强项最弱项
1DeepSeek V4 Pro8.77长上下文/中文多模态
2Grok 4.68.33Agent/知识广度中文
3Gemini 3.7 Flash8.27多模态/长上下文中文
4GLM 5.38.22中文/代码工程多模态
5DeepSeek V4 Flash8.05中文/长上下文数学推理

六、性价比终极分析

价格是这轮发布最具戏剧性的维度——DeepSeek预告涨价,谷歌限时降价,Grok维持中价位,形成了复杂的价格梯度。

6.1 标准API价格对比($ / 百万tokens)

模型输入价输出价缓存命中1M输入+100K输出估算成本相对DeepSeek Flash倍数
DeepSeek V4 Flash$0.14$0.28$0.0028$0.1681.0x(基准)
DeepSeek V4 Pro$0.435$0.87$0.0036$0.5223.1x
Gemini 3.7 Flash(限时)$0.75$3.75支持缓存$1.1256.7x
Grok 4.6$2.00$6.00$2.60015.5x
GPT-5.6 Sol(参考)$5.00$30.00$35.00208x
Claude Fable 5(参考)$10.00$50.00$60.00357x

6.2 性能价格比(性价比指数)

以"综合能力分 / 每百万token混合成本"计算性价比指数(越高越划算):

模型综合能力分混合成本($/M)性价比指数评级
DeepSeek V4 Flash8.05$0.2138.3S+(极致性价比)
DeepSeek V4 Pro8.77$0.6513.5S(旗舰性价比之王)
Gemini 3.7 Flash(限时)8.27$2.253.7A(限时优惠期值得)
GLM 5.3(非高峰五折)8.22~$0.50(估)16.4S(开源+低价双重优势)
Grok 4.68.33$4.002.1B(能力强但贵)

关键结论

  1. DeepSeek V4 Flash是当之无愧的性价比之王——能力达到旗舰的80-90%,价格却只有1/3,日常开发场景几乎是"白嫖"级体验。
  2. DeepSeek V4 Pro在旗舰级中性价比无敌——比Grok 4.6便宜约6倍,综合能力反而略高(中文+长上下文优势)。
  3. Gemini 3.7 Flash限时半价期间性价比不错,但原价恢复后($1.50/$7.50)性价比会大幅下降。
  4. Grok 4.6的价格定位尴尬——比国产旗舰贵5-15倍,综合能力却没有碾压级优势,仅在英文知识工作Agent场景下值回票价。

6.3 涨价预警

  • DeepSeek:官方已明确预告"计划近期整体上调API定价,预计涨幅较大",8月17日起新价格生效。V4 Pro和Flash的价格优势可能收窄。
  • Gemini 3.7 Flash:$0.75/$3.75的半价仅维持到2026年12月31日,之后恢复$1.50/$7.50。
  • GLM 5.3:积分制+非高峰五折,实际成本可能低于标价,但需关注权重开源后的自部署成本。

七、场景化选型建议

基于以上评测,针对不同使用场景给出明确的选型推荐:

场景1:日常编程助手 / IDE补全

推荐:DeepSeek V4 Flash

  • 理由:价格极低($0.14/$0.28),并发2500,代码能力8.0分足够覆盖日常开发,配合Cursor/VS Code插件使用成本几乎可以忽略。
  • 备选:GLM 5.3(非高峰五折,开源可自部署)

场景2:复杂工程Agent / 大型代码库重构

推荐:DeepSeek V4 Pro

  • 理由:1M上下文+384K输出,Terminal Bench 87.9逼近Fable 5,AutomationBench领先,适合需要理解整个代码库、连续执行多步修改的Agent场景。
  • 备选:GLM 5.3(DeepSWE 66.9开源第一,即将开源可自部署)

场景3:英文知识工作 / 办公自动化Agent

推荐:Grok 4.6

  • 理由:GDPVal-AA 1753全场最高,AA-Briefcase和Harvey LAB双第一,配合Grok Bot持久化云端环境,英文办公Agent体验最佳。
  • 备选:Gemini 3.7 Flash(多模态办公场景)

场景4:中文内容创作 / 文案写作

推荐:GLM 5.3 或 DeepSeek V4 Pro

  • 理由:两款国产旗舰中文能力均达9分以上,GLM创作风格更细腻,DeepSeek知识更全面。
  • 备选:DeepSeek V4 Flash(预算有限时)

场景5:多模态内容处理 / 图表视频理解

推荐:Gemini 3.7 Flash

  • 理由:唯一原生支持文/图/音/视频四模态输入的模型,图表解析和视频理解能力独一档,限时半价期间性价比高。
  • 备选:Grok 4.6(视觉能力不错)

场景6:长文档分析 / 法律合同审阅

推荐:DeepSeek V4 Pro

  • 理由:1M上下文+DSA稀疏注意力,长文本效率最高,384K输出可生成完整的分析报告。中文合同场景下远超Grok。
  • 备选:Gemini 3.7 Flash(含图表的PDF文档)

场景7:网络安全 / 漏洞挖掘

推荐:GLM 5.3

  • 理由:CyberGym 84.5%全球SOTA,ExploitBench 54.4%翻倍提升,1097个高危漏洞已协调披露,网络安全能力涌现式突破。
  • 备选:DeepSeek V4 Pro(CyberGym 83.3%紧随其后)

场景8:私有化部署 / 数据敏感场景

推荐:GLM 5.3(待开源)或 DeepSeek V4 Flash

  • 理由:两款均已开源/即将开源,可本地部署保护数据隐私。GLM 5.3能力更强,DeepSeek V4 Flash硬件要求更低(13B激活)。

八、总结与展望

8.1 本轮发布的核心趋势

  1. Agent成为唯一主战场:五款模型无一例外都在强调长程Agent能力,Terminal Bench、DeepSWE、GDPVal等Agent基准取代MMLU成为新的"跑分竞技场"。模型竞争从"谁更聪明"转向"谁能干活"。

  2. 后训练的天花板被打开:GLM 5.3用"同基座+纯后训练"实现了Terminal Bench 6倍跃升,证明在基座架构趋同的当下,后训练工程(尤其是长程RL环境构造)成为新的核心壁垒。

  3. 价格战进入新阶段:DeepSeek从"价格屠夫"转向涨价,谷歌用限时半价抢开发者,Grok维持中价位。国产模型与闭源旗舰的价差正在收窄,但仍有5-10倍的空间。

  4. 开源与闭源的差距缩小到个位数:DeepSeek V4 Pro在Terminal Bench上与Claude Fable 5只差0.1分,GLM 5.3在CyberGym上实现反超。开源模型在特定领域已经能与闭源旗舰掰手腕。

8.2 各模型一句话总结

模型一句话定位适合谁
DeepSeek V4 Pro开源旗舰的性价比之王,长上下文+中文双优需要处理大型代码库、中文项目的开发者
DeepSeek V4 Flash日常开发的"白嫖"级选择,性能够用价格极低预算敏感的个人开发者、高吞吐API场景
Grok 4.6英文知识工作Agent的新王者,Cursor数据加持英文为主、需要长程办公Agent的团队
GLM 5.3纯后训练奇迹,编程+网安开源双SOTA关注开源、需要私有化部署的技术团队
Gemini 3.7 Flash多模态独一档,限时半价的谷歌主力需要处理图像/视频/音频的多模态场景

8.3 后续值得关注的节点

  • 8月底:GLM 5.3权重开源,第三方独立评测将验证官方数据
  • 8月17日:DeepSeek新定价生效,性价比格局可能生变
  • 9月中旬:马斯克预告Grok 4.7发布,宣称加入SpaceX数据后"超越所有模型"
  • Q4:谷歌Gemini 4旗舰版能否挽回颜面?Claude Fable 5之后的下一招?
  • 持续关注:国产模型Qwen 3.8-Max、Kimi K3与这三款的正面对决

参考资料

  1. DeepSeek官方定价页(2026-08-12更新):https://api-docs.deepseek.com/
  2. DeepSeek-V4技术报告(arXiv:2606.19348)
  3. 掘金《DeepSeek-V4-Pro正式版低调上线:百万上下文旗舰模型进入GA时代》:https://juejin.cn/post/7673059457073299456
  4. 36氪《梁文锋突袭马斯克,DeepSeek V4 Pro对战Grok 4.6,首测夯爆了》
  5. 36氪《马斯克Grok 4.6重回一梯队,更低价格反超Fable 5》
  6. 新浪科技《剑指GPT-5.6 Sol,SpaceXAI发布Grok 4.6模型》
  7. 掘金《智谱GLM-5.3技术解读:同基座、纯后训练》:https://juejin.cn/post/7673696068215439412
  8. 智谱官方公告《GLM-5.3: Frontier Coding with Emergent Cyber Capabilities》:https://z.ai/blog/
  9. 36氪《谷歌祭出Gemini 3.7 Flash,52岁创始人亲自督战》
  10. Google官方博客《Introducing Gemini 3.7 Flash》:https://blog.google/
  11. Artificial Analysis模型对比:https://artificialanalysis.ai/
  12. Reuters《Inside Google executive moves that led its big AI reshuffle》(2026-08-12)
  13. 第一财经《DeepSeek涨价,谷歌降价》(2026-08-14)
  14. 澎湃新闻《DeepSeek V4 API定价大幅上调,8月17日开始生效》

免责声明:本文所有跑分数据均来自厂商官方公告或第三方公开评测平台,实际体验可能因API版本、推理档位、prompt设计而异。价格信息截至2026年8月17日,DeepSeek新定价、Gemini限时优惠等可能随时变化,请以官方最新页面为准。本文为独立技术分析,不构成任何投资或采购建议。

如果觉得本文有帮助,欢迎点赞、收藏、关注三连!有任何问题或补充,欢迎在评论区交流。

更多推荐