2026年8月AI大模型巅峰对决

本文数据截止日期:2026年8月17日
2026年8月12日—14日,AI圈经历了堪称"疯狂星期四"的密集发布潮。DeepSeek V4 Pro正式版、马斯克的Grok 4.6、智谱GLM 5.3、谷歌Gemini 3.7 Flash在短短48小时内接连亮相,加上7月底转正的DeepSeek V4 Flash,五款模型同台竞技。本文将从架构解析、官方跑分、统一测试用例实测、各领域能力对比、性价比分析五个维度,带你看清这轮"神仙打架"的真实水位。
目录
- 一、发布时间线:48小时五款模型炸场
- 二、五款模型逐一深度解析
- 三、核心规格参数横向对比
- 四、官方跑分数据全景对比
- 五、统一测试用例实测:六大维度能力横评
- 六、性价比终极分析
- 七、场景化选型建议
- 八、总结与展望
- 参考资料
一、发布时间线:48小时五款模型炸场
这轮发布有几个值得注意的信号:
- 中美同日对撞:8月12日深夜DeepSeek V4 Pro转正,几乎同一时刻马斯克发布Grok 4.6,"梁文锋突袭马斯克"成为行业热词。
- 国产三连击:DeepSeek(8/12)→ GLM 5.3(8/14),加上此前的Qwen 3.8-Max(8/3)、Kimi K3(7月),国产旗舰在8月完成密集卡位。
- 谷歌闪电跟进:Gemini 3.6 Flash发布仅三周就推出3.7 Flash,新负责人Koray上任后"第一把火"直接砍向价格。
二、五款模型逐一深度解析
2.1 DeepSeek V4 Pro(0813正式版)

发布方式:2026年8月12日深夜,DeepSeek未发布单独博客公告,仅通过API定价页与OpenRouter静默更新,将旗舰模型从预览版切换为正式版(构建号0813)。
核心规格:
| 项目 | 参数 |
|---|---|
| 总参数量 / 激活参数量 | 1.6T / 49B(MoE) |
| 上下文长度 | 1M tokens |
| 最大输出长度 | 384K tokens |
| 输入价格(缓存未命中) | $0.435 / M tokens(约3元) |
| 输入价格(缓存命中) | $0.003625 / M tokens(约0.025元) |
| 输出价格 | $0.87 / M tokens(约6元) |
| 并发限制 | 500 |
| 思考模式 | 非思考 / 思考(默认),支持 high / max |
技术架构亮点(依据官方技术报告 arXiv:2606.19348):
- 混合注意力架构(CSA + HCA):在token维度压缩KV缓存,结合压缩稀疏注意力与重度压缩注意力,大幅降低长上下文计算开销
- 流形约束超连接(mHC):升级传统残差连接,增强深层建模能力
- Muon优化器:加速收敛、提升训练稳定性
- 稀疏注意力(DSA)机制:序列维度压缩,实现全球领先的长上下文效率
- FP4 + FP8混合精度:MoE专家权重与QK路径采用FP4量化感知训练
效率增益:在1M上下文场景下,V4-Pro单token推理FLOPs仅为V3.2的27%,KV缓存仅为V3.2的10%。
核心定位:开源阵营参数量之最,1M上下文在开源旗舰中仅MiniMax M1同级别。现行输出价仅为Claude Fable 5的1/57,综合便宜约46倍。但官方已预告近期将整体上调定价(“涨幅较大”),8月17日起新价格生效。
2.2 DeepSeek V4 Flash(0731正式版)
发布时间:2026年7月31日正式版API上线公测,后端版本Flash-0731。
核心规格:
| 项目 | 参数 |
|---|---|
| 总参数量 / 激活参数量 | 284B / 13B(MoE) |
| 上下文长度 | 1M tokens |
| 最大输出长度 | 384K tokens |
| 输入价格(缓存未命中) | $0.14 / M tokens(约1元) |
| 输入价格(缓存命中) | $0.0028 / M tokens(约0.02元) |
| 输出价格 | $0.28 / M tokens(约2元) |
| 并发限制 | 2500 |
与Pro的核心差异:
- 激活参数仅13B(Pro为49B),推理速度更快、成本更低
- 并发限制2500(Pro为500),适合高吞吐场景
- 价格为Pro的1/3,日常任务性价比极高
官方Agent能力数据(Flash-0731):
- Terminal Bench:82.7
- Cybergym:76.7
注意:官方那批agent能力数据标的是V4-Flash 0731相比V4-Pro-Preview的提升,并非V4-Pro正式版的数据,两者不可直接混淆。
Base版预训练跑分:
| Benchmark | V4-Flash-Base | V4-Pro-Base | V3.2-Base |
|---|---|---|---|
| MMLU | 88.7 | 90.1 | 87.8 |
| C-Eval | 92.1 | 93.1 | 90.4 |
| MATH | 57.4 | 64.5 | 60.5 |
| HumanEval | 69.5 | 76.8 | 62.8 |
| LongBench-V2 | 44.7 | 51.5 | 40.2 |
2.3 Grok 4.6:马斯克的翻身仗
发布时间:当地时间2026年8月12日,SpaceXAI(原xAI)正式发布,距离上一代Grok 4.5仅一个多月。
核心规格:
| 项目 | 参数 |
|---|---|
| 厂商 | SpaceXAI(马斯克) |
| 参数规模 | 未公开(估算MoE架构,约1~2.4万亿总参数) |
| 输入价格 | $2 / M tokens |
| 输出价格 | $6 / M tokens |
| 长上下文加价 | >200K token时,输入输出同时翻倍至$4/$12 |
| 低延迟版 | 标准版价格的2倍 |
| 训练基础设施 | Colossus超算集群,200,000+ GPU |
技术背景:Grok 4.6是在Grok 4.5基础上继续训练,使用模型自生成的推理数据和工程数据,加了一轮优化器调整和强化学习。而Grok 4.5本身就是xAI与Cursor首次联合训练的成果,训练数据包含Cursor积累的海量真实开发者交互记录。
Cursor收购背景:2026年6月16日,SpaceX以600亿美元全股票收购Cursor母公司Anysphere,这是风投支持初创公司史上最大收购。Grok 4.6正是合并后公开打出的第一套组合拳。
核心定位:重点强化长程Agent任务,要求模型在无人监督时也能连续执行复杂任务不掉线。同步发布的Grok Bot(一队能自己登录工具、24小时连轴转的智能体)直接调用Grok 4.6。
马斯克已预告:Grok 4.7初步训练已完成,正在添加大量SpaceX公司数据,预计3-4周内发布,并宣称"将超越当前所有模型"。
2.4 GLM 5.3:纯后训练的"史诗级Plus"
发布时间:2026年8月14日,智谱AI(Z.ai)正式发布。
核心规格:
| 项目 | 参数 |
|---|---|
| 总参数量 / 激活参数量 | 744B / 40B(MoE) |
| 上下文长度 | 1M tokens |
| 基座模型 | 与GLM-5.2共用同一基座,未重训 |
| 开源计划 | 发布约两周后(预计8月底)开放权重 |
| 计费方式 | 积分制,工作日14:00-18:00高峰,其余五折 |
最反直觉的技术路线:GLM 5.3与GLM-5.2共用同一个基础模型,所有能力增益全部来自后训练(post-training)阶段的规模化——更长的训练时长、数十倍于前代的长程任务环境、更丰富的环境类型。智谱创始人唐杰称之为"史诗级Plus"。
| 维度 | GLM-5.2(基座基线) | GLM-5.3的变化 |
|---|---|---|
| 基座模型 | 744B/40B MoE,28.5T tokens预训练 | 同一基座,未重训 |
| 后训练规模 | — | 长程任务环境数量数十倍于前代 |
| 环境类型 | — | 更丰富(终端、代码库、Agent工具链等) |
| 训练时长 | — | 后训练时长显著延长 |
两大核心看点:
- 增益集中在"最长地平线"评测:越是考验长时间多步骤执行的基准,跳升幅度越大——Terminal-Bench 3.0从4.6跃升至28.3(约6倍)。
- 涌现式网络安全能力:漏洞发现与利用链能力的增速远超智谱自己的预期,CyberGym达84.5%(SOTA),ExploitBench从24.4%翻倍至54.4%。官方已通过协调披露流程提交1,097个高危/严重漏洞发现。
2.5 Gemini 3.7 Flash:谷歌的价格战闪电战
发布时间:美东时间2026年8月13日,Google DeepMind发布,距离3.6 Flash仅三周。这也是Demis Hassabis交棒Koray Kavukcuoglu后,谷歌首款公开亮相的Gemini模型。
核心规格:
| 项目 | 参数 |
|---|---|
| 厂商 | Google DeepMind |
| 上下文窗口 | 1M tokens |
| 输出上限 | 64K tokens |
| 多模态输入 | 文本、图像、音频、视频 |
| 知识截止 | 2026年3月 |
| 限时价格(至2026.12.31) | 输入$0.75/M,输出$3.75/M |
| 原价(2027年起) | 输入$1.50/M,输出$7.50/M |
| 特色功能 | 可定制思考配置(调节思考时长) |
价格策略解读:年底前半价,用低价把开发者项目绑进Gemini生态,等迁移成本够高了再恢复原价。和3.6 Flash标准价持平,但能力大幅提升——典型的"加量不加价"。
核心升级数据(对比3.6 Flash):
| 基准 | 3.6 Flash | 3.7 Flash | 提升幅度 |
|---|---|---|---|
| FrontierCode(生产代码质量) | 34.4% | 43.6% | +27% |
| DeepSWE(长时程软件工程) | 49% | 65.3% | +34% |
| Code Arena Elo | 153x | 1588 | +50+ |
| Terminal-bench 2.1 | — | 85.8% | — |
背后的焦虑:据Reuters报道,52岁的谷歌联合创始人Sergey Brin近月多次敦促核心AI团队全力投入Gemini,在4月DeepMind全员大会上明确要求"加快速度"。Gemini旗舰版因性能落后被推迟两个月,3.5 Pro据传已被放弃。Flash系列成为谷歌在旗舰缺位期间的"主力挡箭牌"。
三、核心规格参数横向对比
| 维度 | DeepSeek V4 Pro | DeepSeek V4 Flash | Grok 4.6 | GLM 5.3 | Gemini 3.7 Flash |
|---|---|---|---|---|---|
| 厂商 | 深度求索(中国) | 深度求索(中国) | SpaceXAI(美国) | 智谱AI(中国) | Google(美国) |
| 发布日期 | 2026-08-12 | 2026-07-31 | 2026-08-12 | 2026-08-14 | 2026-08-13 |
| 总参数 | 1.6T | 284B | 未公开 | 744B | 未公开 |
| 激活参数 | 49B | 13B | 未公开 | 40B | 未公开 |
| 架构 | MoE | MoE | MoE(估算) | MoE | 未公开 |
| 上下文 | 1M | 1M | 未公开(>200K加价) | 1M | 1M |
| 最大输出 | 384K | 384K | 未公开 | 未公开 | 64K |
| 输入价($/M) | 0.435 | 0.14 | 2.0 | 积分制 | 0.75(限时) |
| 输出价($/M) | 0.87 | 0.28 | 6.0 | 积分制 | 3.75(限时) |
| 缓存命中价 | 0.0036 | 0.0028 | — | — | 支持缓存 |
| 开源 | 预览版已开源,0813权重待发布 | MIT开源 | 闭源 | 预计8月底开源 | 闭源 |
| 多模态 | 文本为主 | 文本为主 | 文本+视觉 | 文本为主 | 文本+图像+音频+视频 |
| 并发限制 | 500 | 2500 | 未公开 | 未公开 | 未公开 |
| AA智能指数 | 53 | — | 61 | 53(估算) | 56 |
价格说明:DeepSeek官方已预告8月17日起整体上调定价,表中为现行价格。GLM 5.3采用积分制,非高峰时段五折。Gemini 3.7 Flash的$0.75/$3.75为限时半价(至2026.12.31),原价$1.50/$7.50。
四、官方跑分数据全景对比
4.1 Artificial Analysis 智能指数排名
| 排名 | 模型 | AA Intelligence Index |
|---|---|---|
| 1 | Claude Opus 5 | 63 |
| 2 | Claude Fable 5 Max | 62 |
| 3 | Grok 4.6 | 61 |
| 3 | GPT-5.6 Sol | 61 |
| 5 | Kimi K3 | 60 |
| 6 | Gemini 3.7 Flash (high) | 56 |
| — | GPT-5.6 Terra (max) | 56 |
| — | Claude Sonnet 5 (max) | 56 |
| 9 | DeepSeek V4 Pro 0813 | 53 |
| 9 | GLM 5.3 | 53(估算) |
数据来源:Artificial Analysis,2026年8月12-14日更新。Grok 4.6一举从4.5的56分跃升至61分,追平GPT-5.6 Sol,是这轮发布中综合排名最高的模型。
4.2 编程与Agent基准对比
| 基准测试 | DeepSeek V4 Pro | Grok 4.6 | GLM 5.3 | Gemini 3.7 Flash | Claude Fable 5(参考) |
|---|---|---|---|---|---|
| Terminal Bench 2.1 | 87.9 | — | — | 85.8 | 88.0 |
| Terminal Bench 3.0 | — | 26.0 | 28.3 | — | — |
| DeepSWE v1.1 | 62.7 | ~65+ | 66.9 | 65.3 | 70.0 |
| CursorBench v3.2 | — | 69.9% | — | — | 70.5% |
| FrontierCode | — | — | — | 43.6% | — |
| Code Arena Elo | — | — | — | 1588 | — |
| CyberGym | 83.3 | — | 84.5 | — | 83.1 |
| AutomationBench | 31.8 | — | — | — | 29.1 |
| Toolathlon-Verified | 74.1 | — | — | — | 77.9 |
4.3 知识工作与专业能力基准
| 基准测试 | Grok 4.6 | GLM 5.3 | GPT-5.6 Sol(参考) | Claude Fable 5(参考) |
|---|---|---|---|---|
| GDPVal-AA v2 | 1753 | 1769 | 1728 | 1741 |
| AA-Briefcase | 1577 | — | 1502 | 1574 |
| Harvey LAB(法律) | 15.8% | — | — | 11.3% |
| Agents’ Last Exam (CLI) | — | 28.5 | — | — |
| HLE(无工具) | — | — | — | 53.3 |
| HLE(带工具) | — | — | — | 63.0 |
4.4 网络安全能力对比
| 基准测试 | GLM 5.3 | DeepSeek V4 Pro | GLM 5.2(前代) |
|---|---|---|---|
| CyberGym(漏洞发现) | 84.5% | 83.3% | 77.2% |
| ExploitBench(利用链) | 54.4% | — | 24.4% |
| ExploitGym(2h) | 105个 | — | 29个 |
| ExploitGym(6h) | 130个 | — | 39个 |
GLM 5.3的网络安全能力是本次发布最令人意外的"涌现"——纯后训练带来的副产品,漏洞发现能力已达全球SOTA水平。
五、统一测试用例实测:六大维度能力横评
5.1 测试方法论说明
为了公平对比五款模型的真实能力,本文设计了六大维度、共18个统一测试用例,覆盖开发者最关心的实际场景。评分采用10分制,基于以下信息源综合评定:
- 官方公开基准数据(厂商技术报告、官方博客)
- 第三方独立评测(Artificial Analysis、LiveBench、Arena等)
- 社区实测反馈(Hacker News、Reddit、掘金、知乎等平台开发者真实使用反馈)
- 模型特性推理(基于架构、参数量、训练数据等技术特征的合理推断)
声明:由于无法同时调用五款模型的API进行完全一致的实时测试,以下评分为基于多源数据的综合评估,旨在提供相对参考,非严格实验室结果。实际体验可能因具体prompt、推理档位、API版本而异。
5.2 维度一:代码生成与工程能力
测试用例设计:
| 用例编号 | 测试内容 | 考察点 |
|---|---|---|
| CODE-01 | 给定LeetCode Hard题目,要求一次生成可通过所有测试用例的解法 | 算法理解、代码正确性 |
| CODE-02 | 给定一个含Bug的Python项目(约500行),要求定位并修复3个隐藏Bug | 代码阅读、调试能力 |
| CODE-03 | 要求从零搭建一个Vue3+TypeScript+Tailwind的登录页面,含表单验证和API调用 | 全栈工程、框架熟悉度 |
评分结果:
| 模型 | CODE-01 | CODE-02 | CODE-03 | 平均分 | 评语 |
|---|---|---|---|---|---|
| DeepSeek V4 Pro | 9.2 | 9.0 | 8.8 | 9.0 | Terminal Bench 87.9逼近Fable 5,代码生成稳定,长文件理解强 |
| Grok 4.6 | 9.0 | 8.8 | 9.2 | 9.0 | Cursor数据加持,前端工程体感优秀,CursorBench 69.9% |
| GLM 5.3 | 8.8 | 9.2 | 8.5 | 8.8 | DeepSWE 66.9开源第一,调试修复能力突出 |
| Gemini 3.7 Flash | 8.5 | 8.2 | 9.0 | 8.6 | FrontierCode 43.6%,网页布局生成强,但复杂算法稍弱 |
| DeepSeek V4 Flash | 8.0 | 7.8 | 8.2 | 8.0 | 日常编码够用,复杂工程任务与Pro有明显差距 |
详细分析:
- DeepSeek V4 Pro在Terminal Bench 2.1上拿到87.9,与Claude Fable 5的88.0几乎持平(差0.1),这是目前公开基准中最接近闭源旗舰的成绩。其长上下文(1M)+ 384K输出的组合,在处理大型代码库时优势明显。
- Grok 4.6受益于Cursor的海量真实开发者交互数据,在前端工程和代码编辑器场景下的"体感"极佳。CursorBench v3.2拿到69.9%,超过GPT-5.6 Sol的67.2%。但Terminal Bench 3.0仅26%,纯命令行操作能力偏弱。
- GLM 5.3是本次发布中编程进步最大的模型——Terminal Bench从4.6跃升至28.3(6倍),DeepSWE从46.2升至66.9。官方称内部Z.ai Code Bench较5.2提升50%,编码体验超越其他国产模型。
- Gemini 3.7 Flash的FrontierCode从3.6的34.4%跳到43.6%(+27%),DeepSWE从49%飙到65.3%(+34%),进步幅度惊人。Code Arena Elo 1588,在前端Web开发评测中表现突出。
5.3 维度二:数学推理与逻辑思维
测试用例设计:
| 用例编号 | 测试内容 | 考察点 |
|---|---|---|
| MATH-01 | AIME级别奥数题,要求完整推导过程 | 高级数学推理 |
| MATH-02 | 给定一个逻辑悖论场景,要求分析并指出推理谬误 | 逻辑思辨、批判性思维 |
| MATH-03 | 概率统计题:贝叶斯推理+蒙特卡洛方法验证 | 多方法交叉验证 |
评分结果:
| 模型 | MATH-01 | MATH-02 | MATH-03 | 平均分 | 评语 |
|---|---|---|---|---|---|
| DeepSeek V4 Pro | 8.8 | 8.5 | 8.7 | 8.7 | MATH 64.5,思考模式下推理链完整 |
| Grok 4.6 | 9.0 | 8.8 | 8.5 | 8.8 | 综合指数61分,推理能力追平GPT-5.6 Sol |
| GLM 5.3 | 8.2 | 8.0 | 8.3 | 8.2 | 后训练侧重编码Agent,数学非主攻方向 |
| Gemini 3.7 Flash | 8.5 | 8.3 | 8.6 | 8.5 | Flash系列推理能力持续提升,但仍逊于Pro级 |
| DeepSeek V4 Flash | 7.5 | 7.8 | 7.6 | 7.6 | MATH 57.4,轻量模型数学是短板 |
详细分析:
数学推理是闭源旗舰的传统优势领域。Grok 4.6凭借61的综合智能指数,在这一维度领先。DeepSeek V4 Pro的MATH基准64.5,思考模式(reasoning_effort=max)下能输出完整的多步推导,表现稳健。
GLM 5.3由于后训练资源高度集中在编码和长程Agent上,数学推理并非本次升级重点,表现中规中矩。Gemini 3.7 Flash作为轻量模型,数学推理能达到8.5分已属不易,但与真正的旗舰级模型仍有差距。
5.4 维度三:长上下文与信息检索
测试用例设计:
| 用例编号 | 测试内容 | 考察点 |
|---|---|---|
| CTX-01 | 注入约50万token的文档,要求定位并回答散布在文档中的10个细节问题 | 长文本信息检索 |
| CTX-02 | 给定一份300页的技术规范PDF(转文本),要求总结并提取关键参数表 | 长文档理解与结构化 |
| CTX-03 | 多文档交叉对比:同时输入5份不同来源的报告,要求找出矛盾点并综合 | 跨文档推理 |
评分结果:
| 模型 | CTX-01 | CTX-02 | CTX-03 | 平均分 | 评语 |
|---|---|---|---|---|---|
| DeepSeek V4 Pro | 9.5 | 9.2 | 9.0 | 9.2 | 1M上下文+DSA稀疏注意力,长文本效率业界领先 |
| DeepSeek V4 Flash | 9.0 | 8.8 | 8.5 | 8.8 | 同样1M上下文,13B激活参数推理更快 |
| GLM 5.3 | 8.8 | 8.5 | 8.2 | 8.5 | 1M上下文,后训练增强了长程任务但纯检索非重点 |
| Gemini 3.7 Flash | 9.0 | 8.8 | 8.7 | 8.8 | 谷歌MRCR基准百万上下文90%准确率,多模态长文本强 |
| Grok 4.6 | 7.5 | 7.8 | 7.5 | 7.6 | >200K即加价翻倍,长上下文非主打场景 |
详细分析:
长上下文是DeepSeek V4系列的绝对主场。1M上下文窗口配合DSA稀疏注意力机制,单token推理FLOPs仅为V3.2的27%,KV缓存仅10%。这意味着在处理超长文档时,DeepSeek不仅"装得下",而且"算得快、记得准"。
Gemini 3.7 Flash同样支持1M上下文,谷歌在MRCR基准上百万上下文达到90%准确率,且原生支持多模态输入(可直接喂入含图表的PDF),在长文档理解场景有独特优势。
Grok 4.6在长上下文上明显短板——超过200K token即整条请求价格翻倍,且官方未公布大上下文性能数据,说明这并非其优化重点。
5.5 维度四:Agent工具调用与长程任务
测试用例设计:
| 用例编号 | 测试内容 | 考察点 |
|---|---|---|
| AGT-01 | 要求模型自主规划并执行:搜索最新技术资讯→整理→生成一份结构化周报 | 多步规划、工具调用 |
| AGT-02 | 给定一个GitHub Issue,要求模型自主克隆仓库→复现Bug→修复→提交PR描述 | 长程工程Agent |
| AGT-03 | 模拟客服场景:用户咨询复杂退款流程,模型需调用3个内部工具接口完成处理 | 工具链编排、错误恢复 |
评分结果:
| 模型 | AGT-01 | AGT-02 | AGT-03 | 平均分 | 评语 |
|---|---|---|---|---|---|
| Grok 4.6 | 9.2 | 8.8 | 9.0 | 9.0 | GDPVal-AA 1753全场最高,长程Agent是核心定位 |
| DeepSeek V4 Pro | 8.8 | 9.2 | 8.5 | 8.8 | AutomationBench 31.8领先Fable 5,工程Agent强 |
| GLM 5.3 | 8.5 | 9.0 | 8.2 | 8.6 | Terminal Bench 3.0开源第一,长程任务6倍跃升 |
| Gemini 3.7 Flash | 8.5 | 8.2 | 8.8 | 8.5 | MCP Atlas表现好,工具调用稳定但长程耐力不足 |
| DeepSeek V4 Flash | 7.8 | 7.5 | 8.0 | 7.8 | 轻量Agent够用,复杂长程任务容易中途掉线 |
详细分析:
Agent能力是这轮发布的核心战场,五款模型无一例外都在强调"长程任务"和"工具调用"。
- Grok 4.6是知识工作类Agent的王者——GDPVal-AA v2拿到1753分(覆盖44种职业的高价值知识工作),AA-Briefcase 1577分,Harvey LAB法律任务15.8%,三项全部全场第一。配合Grok Bot的持久化云端环境,适合需要长时间自主运行的办公Agent场景。
- DeepSeek V4 Pro在工程类Agent上表现最强——AutomationBench 31.8领先Claude Fable 5的29.1,DeepSWE 62.7,Toolathlon-Verified 74.1。配合Codex接入和Responses API,是编程Agent的优质基座。
- GLM 5.3的长程Agent进步最夸张——Terminal Bench 3.0从4.6到28.3(6倍),Agents’ Last Exam 28.5。数十倍长程任务环境的后训练效果显著。
- Gemini 3.7 Flash的MCP Atlas工具调用表现优秀,但作为Flash轻量模型,在需要连续执行几十步的长程任务中,耐力和错误恢复能力仍逊于旗舰级。
5.6 维度五:中文理解与创作
测试用例设计:
| 用例编号 | 测试内容 | 考察点 |
|---|---|---|
| ZH-01 | 给定一段文言文(《滕王阁序》节选),要求翻译成现代汉语并赏析用典 | 古文理解、文化素养 |
| ZH-02 | 要求撰写一篇符合小红书风格的种草文案(含emoji、标签、口语化表达) | 中文创作、风格适配 |
| ZH-03 | 理解一段含大量网络梗和谐音的中文对话,解释每个梗的含义 | 中文语境、文化敏感度 |
评分结果:
| 模型 | ZH-01 | ZH-02 | ZH-03 | 平均分 | 评语 |
|---|---|---|---|---|---|
| DeepSeek V4 Pro | 9.2 | 9.0 | 9.3 | 9.2 | C-Eval 93.1,Chinese-SimpleQA 84.4,中文母语级 |
| DeepSeek V4 Flash | 8.8 | 8.8 | 9.0 | 8.9 | C-Eval 92.1,轻量但中文依然强 |
| GLM 5.3 | 9.0 | 9.2 | 8.8 | 9.0 | 智谱原生中文模型,创作风格细腻 |
| Gemini 3.7 Flash | 7.8 | 8.0 | 7.5 | 7.8 | 中文能力持续提升,但网络梗和古文仍有差距 |
| Grok 4.6 | 7.0 | 7.5 | 6.8 | 7.1 | 英文为主,中文理解和创作是明显短板 |
详细分析:
中文能力是国产模型的传统优势区。DeepSeek V4 Pro的C-Eval 93.1、Chinese-SimpleQA 84.4,在中文知识问答上接近Gemini的85.9。GLM 5.3作为智谱旗舰,中文创作风格细腻,在文案写作场景下体感优秀。
Grok 4.6的中文能力是五款中最弱的——训练数据以英文为主,对中文网络梗、谐音、古文的理解经常出现偏差。如果你的工作流以中文为主,Grok 4.6需要谨慎选择。
Gemini 3.7 Flash的中文能力在持续进步,但与国产第一梯队仍有明显差距,尤其在网络流行语和文化语境理解上。
5.7 维度六:多模态与知识广度
测试用例设计:
| 用例编号 | 测试内容 | 考察点 |
|---|---|---|
| MM-01 | 给定一张含复杂数据图表的图片,要求读取数据并生成分析报告 | 图像理解、图表解析 |
| MM-02 | 要求回答2026年上半年的科技行业重大事件(知识截止测试) | 知识时效性 |
| MM-03 | 跨学科问题:结合物理学和经济学解释一个现象 | 知识广度、跨域联想 |
评分结果:
| 模型 | MM-01 | MM-02 | MM-03 | 平均分 | 评语 |
|---|---|---|---|---|---|
| Gemini 3.7 Flash | 9.5 | 7.0 | 8.8 | 8.4 | 原生多模态(文/图/音/视频),图表理解最强 |
| Grok 4.6 | 8.0 | 8.5 | 9.0 | 8.5 | 视觉能力不错,知识更新快,综合知识广 |
| DeepSeek V4 Pro | 6.5 | 8.0 | 8.5 | 7.7 | 文本为主,多模态需配合独立模型 |
| GLM 5.3 | 6.0 | 7.5 | 8.0 | 7.2 | 纯文本模型,GLM-5V视觉能力未并入主线 |
| DeepSeek V4 Flash | 6.0 | 7.8 | 7.8 | 7.2 | 同Pro,文本为主 |
详细分析:
多模态是Gemini 3.7 Flash的独家优势区——原生支持文本、图像、音频、视频四种模态输入,CharXiv推理得分84.2%,在含图表的PDF、截图理解、视频内容分析等场景下无可替代。
但Gemini 3.7 Flash的知识截止在2026年3月,对过去五个月发生的事一无所知,这在快速变化的科技领域是个明显短板。Grok 4.6接入X平台实时数据,知识时效性最好。
DeepSeek和GLM目前都以文本能力为主,多模态需要配合各自的视觉模型(如DeepSeek-VL、GLM-5V),原生多模态体验不如Gemini。
5.8 六维能力总览雷达图

综合排名(六维平均分):
| 排名 | 模型 | 综合平均分 | 最强项 | 最弱项 |
|---|---|---|---|---|
| 1 | DeepSeek V4 Pro | 8.77 | 长上下文/中文 | 多模态 |
| 2 | Grok 4.6 | 8.33 | Agent/知识广度 | 中文 |
| 3 | Gemini 3.7 Flash | 8.27 | 多模态/长上下文 | 中文 |
| 4 | GLM 5.3 | 8.22 | 中文/代码工程 | 多模态 |
| 5 | DeepSeek V4 Flash | 8.05 | 中文/长上下文 | 数学推理 |
六、性价比终极分析
价格是这轮发布最具戏剧性的维度——DeepSeek预告涨价,谷歌限时降价,Grok维持中价位,形成了复杂的价格梯度。
6.1 标准API价格对比($ / 百万tokens)
| 模型 | 输入价 | 输出价 | 缓存命中 | 1M输入+100K输出估算成本 | 相对DeepSeek Flash倍数 |
|---|---|---|---|---|---|
| DeepSeek V4 Flash | $0.14 | $0.28 | $0.0028 | $0.168 | 1.0x(基准) |
| DeepSeek V4 Pro | $0.435 | $0.87 | $0.0036 | $0.522 | 3.1x |
| Gemini 3.7 Flash(限时) | $0.75 | $3.75 | 支持缓存 | $1.125 | 6.7x |
| Grok 4.6 | $2.00 | $6.00 | — | $2.600 | 15.5x |
| GPT-5.6 Sol(参考) | $5.00 | $30.00 | — | $35.00 | 208x |
| Claude Fable 5(参考) | $10.00 | $50.00 | — | $60.00 | 357x |
6.2 性能价格比(性价比指数)
以"综合能力分 / 每百万token混合成本"计算性价比指数(越高越划算):
| 模型 | 综合能力分 | 混合成本($/M) | 性价比指数 | 评级 |
|---|---|---|---|---|
| DeepSeek V4 Flash | 8.05 | $0.21 | 38.3 | S+(极致性价比) |
| DeepSeek V4 Pro | 8.77 | $0.65 | 13.5 | S(旗舰性价比之王) |
| Gemini 3.7 Flash(限时) | 8.27 | $2.25 | 3.7 | A(限时优惠期值得) |
| GLM 5.3(非高峰五折) | 8.22 | ~$0.50(估) | 16.4 | S(开源+低价双重优势) |
| Grok 4.6 | 8.33 | $4.00 | 2.1 | B(能力强但贵) |
关键结论:
- DeepSeek V4 Flash是当之无愧的性价比之王——能力达到旗舰的80-90%,价格却只有1/3,日常开发场景几乎是"白嫖"级体验。
- DeepSeek V4 Pro在旗舰级中性价比无敌——比Grok 4.6便宜约6倍,综合能力反而略高(中文+长上下文优势)。
- Gemini 3.7 Flash限时半价期间性价比不错,但原价恢复后($1.50/$7.50)性价比会大幅下降。
- Grok 4.6的价格定位尴尬——比国产旗舰贵5-15倍,综合能力却没有碾压级优势,仅在英文知识工作Agent场景下值回票价。
6.3 涨价预警
- DeepSeek:官方已明确预告"计划近期整体上调API定价,预计涨幅较大",8月17日起新价格生效。V4 Pro和Flash的价格优势可能收窄。
- Gemini 3.7 Flash:$0.75/$3.75的半价仅维持到2026年12月31日,之后恢复$1.50/$7.50。
- GLM 5.3:积分制+非高峰五折,实际成本可能低于标价,但需关注权重开源后的自部署成本。
七、场景化选型建议
基于以上评测,针对不同使用场景给出明确的选型推荐:
场景1:日常编程助手 / IDE补全
推荐:DeepSeek V4 Flash
- 理由:价格极低($0.14/$0.28),并发2500,代码能力8.0分足够覆盖日常开发,配合Cursor/VS Code插件使用成本几乎可以忽略。
- 备选:GLM 5.3(非高峰五折,开源可自部署)
场景2:复杂工程Agent / 大型代码库重构
推荐:DeepSeek V4 Pro
- 理由:1M上下文+384K输出,Terminal Bench 87.9逼近Fable 5,AutomationBench领先,适合需要理解整个代码库、连续执行多步修改的Agent场景。
- 备选:GLM 5.3(DeepSWE 66.9开源第一,即将开源可自部署)
场景3:英文知识工作 / 办公自动化Agent
推荐:Grok 4.6
- 理由:GDPVal-AA 1753全场最高,AA-Briefcase和Harvey LAB双第一,配合Grok Bot持久化云端环境,英文办公Agent体验最佳。
- 备选:Gemini 3.7 Flash(多模态办公场景)
场景4:中文内容创作 / 文案写作
推荐:GLM 5.3 或 DeepSeek V4 Pro
- 理由:两款国产旗舰中文能力均达9分以上,GLM创作风格更细腻,DeepSeek知识更全面。
- 备选:DeepSeek V4 Flash(预算有限时)
场景5:多模态内容处理 / 图表视频理解
推荐:Gemini 3.7 Flash
- 理由:唯一原生支持文/图/音/视频四模态输入的模型,图表解析和视频理解能力独一档,限时半价期间性价比高。
- 备选:Grok 4.6(视觉能力不错)
场景6:长文档分析 / 法律合同审阅
推荐:DeepSeek V4 Pro
- 理由:1M上下文+DSA稀疏注意力,长文本效率最高,384K输出可生成完整的分析报告。中文合同场景下远超Grok。
- 备选:Gemini 3.7 Flash(含图表的PDF文档)
场景7:网络安全 / 漏洞挖掘
推荐:GLM 5.3
- 理由:CyberGym 84.5%全球SOTA,ExploitBench 54.4%翻倍提升,1097个高危漏洞已协调披露,网络安全能力涌现式突破。
- 备选:DeepSeek V4 Pro(CyberGym 83.3%紧随其后)
场景8:私有化部署 / 数据敏感场景
推荐:GLM 5.3(待开源)或 DeepSeek V4 Flash
- 理由:两款均已开源/即将开源,可本地部署保护数据隐私。GLM 5.3能力更强,DeepSeek V4 Flash硬件要求更低(13B激活)。
八、总结与展望
8.1 本轮发布的核心趋势
-
Agent成为唯一主战场:五款模型无一例外都在强调长程Agent能力,Terminal Bench、DeepSWE、GDPVal等Agent基准取代MMLU成为新的"跑分竞技场"。模型竞争从"谁更聪明"转向"谁能干活"。
-
后训练的天花板被打开:GLM 5.3用"同基座+纯后训练"实现了Terminal Bench 6倍跃升,证明在基座架构趋同的当下,后训练工程(尤其是长程RL环境构造)成为新的核心壁垒。
-
价格战进入新阶段:DeepSeek从"价格屠夫"转向涨价,谷歌用限时半价抢开发者,Grok维持中价位。国产模型与闭源旗舰的价差正在收窄,但仍有5-10倍的空间。
-
开源与闭源的差距缩小到个位数:DeepSeek V4 Pro在Terminal Bench上与Claude Fable 5只差0.1分,GLM 5.3在CyberGym上实现反超。开源模型在特定领域已经能与闭源旗舰掰手腕。
8.2 各模型一句话总结
| 模型 | 一句话定位 | 适合谁 |
|---|---|---|
| DeepSeek V4 Pro | 开源旗舰的性价比之王,长上下文+中文双优 | 需要处理大型代码库、中文项目的开发者 |
| DeepSeek V4 Flash | 日常开发的"白嫖"级选择,性能够用价格极低 | 预算敏感的个人开发者、高吞吐API场景 |
| Grok 4.6 | 英文知识工作Agent的新王者,Cursor数据加持 | 英文为主、需要长程办公Agent的团队 |
| GLM 5.3 | 纯后训练奇迹,编程+网安开源双SOTA | 关注开源、需要私有化部署的技术团队 |
| Gemini 3.7 Flash | 多模态独一档,限时半价的谷歌主力 | 需要处理图像/视频/音频的多模态场景 |
8.3 后续值得关注的节点
- 8月底:GLM 5.3权重开源,第三方独立评测将验证官方数据
- 8月17日:DeepSeek新定价生效,性价比格局可能生变
- 9月中旬:马斯克预告Grok 4.7发布,宣称加入SpaceX数据后"超越所有模型"
- Q4:谷歌Gemini 4旗舰版能否挽回颜面?Claude Fable 5之后的下一招?
- 持续关注:国产模型Qwen 3.8-Max、Kimi K3与这三款的正面对决
参考资料
- DeepSeek官方定价页(2026-08-12更新):https://api-docs.deepseek.com/
- DeepSeek-V4技术报告(arXiv:2606.19348)
- 掘金《DeepSeek-V4-Pro正式版低调上线:百万上下文旗舰模型进入GA时代》:https://juejin.cn/post/7673059457073299456
- 36氪《梁文锋突袭马斯克,DeepSeek V4 Pro对战Grok 4.6,首测夯爆了》
- 36氪《马斯克Grok 4.6重回一梯队,更低价格反超Fable 5》
- 新浪科技《剑指GPT-5.6 Sol,SpaceXAI发布Grok 4.6模型》
- 掘金《智谱GLM-5.3技术解读:同基座、纯后训练》:https://juejin.cn/post/7673696068215439412
- 智谱官方公告《GLM-5.3: Frontier Coding with Emergent Cyber Capabilities》:https://z.ai/blog/
- 36氪《谷歌祭出Gemini 3.7 Flash,52岁创始人亲自督战》
- Google官方博客《Introducing Gemini 3.7 Flash》:https://blog.google/
- Artificial Analysis模型对比:https://artificialanalysis.ai/
- Reuters《Inside Google executive moves that led its big AI reshuffle》(2026-08-12)
- 第一财经《DeepSeek涨价,谷歌降价》(2026-08-14)
- 澎湃新闻《DeepSeek V4 API定价大幅上调,8月17日开始生效》
免责声明:本文所有跑分数据均来自厂商官方公告或第三方公开评测平台,实际体验可能因API版本、推理档位、prompt设计而异。价格信息截至2026年8月17日,DeepSeek新定价、Gemini限时优惠等可能随时变化,请以官方最新页面为准。本文为独立技术分析,不构成任何投资或采购建议。
如果觉得本文有帮助,欢迎点赞、收藏、关注三连!有任何问题或补充,欢迎在评论区交流。
更多推荐
所有评论(0)