2026 年 8 月大模型性能全景:Claude 登顶文本、Kimi 称霸编码,多模态进入“全模态“时代
本文用 LMArena 匿名盲测、编码实测(Terminal-Bench / SWE-bench)、近一周多模态发布与 API 定价四组数据,盘点 2026 年 8 月的大模型格局,并给出按场景的开发者选型清单。所有数字标注来源,价格以官方实时为准。
关键字:大模型,LMArena,AI模型对比,多模态模型,API定价
2026 年 8 月的第一周,AI 圈有两件不大不小的事:谷歌 DeepMind 的 Jeff Dean 宣布离开,创办了名为 DiscoLoop AI 的新公司;同一周,阿里把 Wan3.0 视频模型挂上了公测,MiniMax 开源了能出 2K 视频加原生立体声的全模态模型 H3。
把这两件事放在一起看,结论其实很直白:巨头之间的"模型能力上限"之争已经进入下半场,竞争的主战场正在从"谁的文字更像人"切换到"谁的全模态更完整、谁的价格更敢打。
对于在 CSDN 上读这篇文章的你,不管是要给自己产品接一个模型,还是想搞清楚 2026 年该押注哪个技术方向,此刻最值得做的都不是追新闻,而是看清一张全景图:文本推理谁是榜首,编码能力谁真的能打,视频图像语音走到哪一步,以及这一切的公开价格是多少。
这篇文章用四组数据讲清楚这件事:LMArena 匿名盲测的文本排名、SWE-bench 与 Terminal-Bench 的编码实测、近一周多模态模型的密集发布、主流 API 的定价横评。所有数字都标注了来源,价格以官方实时为准,不吹不黑。
一、文本推理:LMArena 视角的巅峰对决
LMArena(原 LMSys Chatbot Arena,2024-25 年独立为 lmarena.ai)是现在被引用最多的"人类偏好"基准。玩法是匿名盲测:用户提一个问题,两个模型各自作答,用户只能凭答案质量投票,票数汇成 Elo 评分。它测的不是模型能否背出标准答案,而是真实用户更喜欢谁的输出,这正是采购方拿它当参考的原因。

以下是 2026 年 8 月初的文本榜头部快照(多来源交叉,Elo 会随投票滚动变化,以官网实时为准):
|
模型 |
组织 |
文本 Elo(快照) |
备注 |
|
Claude Opus 5 |
Anthropic |
~1522 |
7 月发布的新旗舰 |
|
Claude Fable 5 |
Anthropic |
~1509 |
头部轮换榜首之一 |
|
Claude Opus 4.8 Thinking |
Anthropic |
~1512 |
编码 / Agent 场景强项 |
|
GPT-5.5 Pro |
OpenAI |
~1488 |
推理档 |
|
Gemini 3.1 Pro Preview |
|
~1486 |
科学 / 多模态领先 |
|
Kimi K3(开源权重) |
Moonshot |
~1486 |
文本中游,编码见下节 |
|
DeepSeek V4 Pro(MIT) |
DeepSeek |
~1462 |
开源性价比标杆 |
|
Qwen 3.7 Max |
阿里 |
~1455 |
国产模型文本最高 |
(来源:LMArena 第三方快照 swfte.com / toolcenter.ai / datalearner.com,2026-07-21 ~ 08-05)
这张表值得注意的不是第一名,而是三件事:
第一,头部已经挤成一团。 榜首到第十名之间的 Elo 差距不到 30 分,而 LMArena 官方口径是:25 分以内的差距属于噪声。换句话说,Fable 5、Opus 4.8、GPT-5.5 Pro、Gemini 3.1 Pro 谁是"第一",基本取决于本周投票样本。"谁最聪明"这个问题的答案,已经不是一个可以回答的问题了。对选型者来说,真正该问的是场景、上下文、价格和生态,而不是那 10 分的排名差。
第二,榜首在 Anthropic 系内部轮换。 从 6 月的 Opus 4.6/4.7,到 7 月的 Fable 5 与 Opus 5,文本榜头把交椅大部分时间在 Anthropic 手里;OpenAI 的 GPT-5.5 Pro 与谷歌 Gemini 3.1 Pro 稳定咬在 1500 线附近。闭源三强的垄断地位没有变化,变化的是它们之间的差距在收敛。
第三,开源已经摸到头部边缘。 Kimi K3(~1486)、DeepSeek V4 Pro(~1462)、Qwen 3.7 Max(~1455)距离闭源头部只有 30–60 Elo,其中 DeepSeek 是 MIT 开源、Kimi 是开源权重。2026 年的开源与闭源差距,已经从"代差"缩小到"半步"。这个趋势在下一节的编码实测里会体现得更极端。
二、编码能力:开源第一次登顶的地方
如果说文本榜是"人类偏好"的缩影,编码则是"可验证智能"的试金石:模型说它行不行,拉出来跑真实代码任务就知道了。常用的编码实测有四类:SWE-bench Verified(真实 GitHub issue,模型要产出能通过项目测试的补丁)、Terminal-Bench(终端里的真实工程任务)、Program Bench(程序构建)、SWE Marathon(长程多步软件工程,模拟真实项目迭代)。
以下是 Moonshot 官方发布、并经独立来源交叉验证的 2026 年 7 月编码实测矩阵:

|
基准 |
Kimi K3 |
GPT-5.6 Sol |
Claude Fable 5 |
Claude Opus 4.8 |
|
Terminal-Bench 2.1 |
88.3 |
88.8 |
84.6 |
84.6 |
|
DeepSWE(仓库级修复) |
67.5 |
73.0 |
70.0 |
59.0 |
|
Program Bench |
77.8 |
77.6 |
76.8 |
71.9 |
|
SWE Marathon(长程) |
42.0 |
39.0 |
35.0 |
40.0 |
|
FrontierSWE |
81.2 |
71.3 |
86.6 |
66.7 |
(来源:Moonshot 官方发布 2026-07 + prompt1001.com / wan27.org 独立交叉验证。SWE-bench Verified 各家评测口径差异较大,未列入本表,以各厂商官方发布为准。)
再叠加一个人类偏好信号。LMArena 前端编码榜(Frontend Code Arena)上,Kimi K3 以约 1679 Elo 登顶第一,超过 Claude Fable 5(~1631)与 GPT-5.6 Sol(~1618),七个前端子领域里拿下六个,唯一输掉的是 Gaming(第一名是 Fable 5)。这是开源模型第一次在人类偏好的编码场景站上榜首。
这张矩阵读出来的信息量比"谁第一"大得多:
第一,Kimi K3 赢的是"长程耐力赛",输的是"单次深读"。 它在 Program Bench、SWE Marathon、前端编码这些需要多步推理、长上下文、持续迭代的任务上压过所有闭源对手;但在 DeepSWE(跨文件理解代码库)、FrontierSWE 这类"一次性深读大仓库"的任务上,Claude Fable 5(86.6)仍然领先它 5 个点。结论:如果你的场景是 agent 长循环、多文件改动、前端整页生成,K3 是当前性价比极高的选项;如果是单次深度代码审查,闭源头部更稳。
第二,"开源编码已可用"不再是口号。 2.8 万亿参数 MoE(每 token 只激活 16/896 个专家)的 K3 以约 3/15 的公开价格,跑出了与 GPT-5.6 Sol 几乎持平的 Terminal-Bench 分数(88.3 vs 88.8)。对预算敏感的团队,这会改写采购决策。
一周前 DeepSeek V4 Flash 正式版又把这条线压低了一档:284B 总参数只激活 13B,架构一点没动,只重做了一轮后训练,代码修复基准 DeepSWE 就从预览版的 7.3 跳到 54.4(六倍多),Terminal-Bench 2.1 拿到 82.7,和 Claude Opus 4.8 的 84.6 几乎打平。小参数、高激活效率、Agent 能力暴涨,这是"开源编码已可用"的最新注脚。
第三,但单项突破不等于全面领先。 在 Artificial Analysis 综合智能指数(10 项基准加权)上,Kimi K3 得 57 分,Claude Opus 5 为 61、GPT-5.6 Sol 为 59。开源追上了编码这个"最陡峭"的单项,综合维度仍差闭源头部 2–4 分。这提醒我们:看模型要看"任务画像",而不是被单一榜单的登顶新闻带走。
三、多模态全谱系:视频 / 图像 / 语音一周齐爆
如果说文本和编码是"存量竞争",多模态就是 2026 年增量最猛的方向。只统计 2026 年 8 月第一周,就有至少七款重量级多模态发布(来源:AI HOT 收录的官方渠道发布):

|
模型 / 产品 |
厂商 |
模态 |
开源 |
亮点 |
|
Wan3.0 |
阿里 |
视频生成 |
公测 |
千问 APP 全网首发公测 |
|
MiniMax H3 |
MiniMax |
文本+图像+视频+音频 |
✅ |
全模态生成,2K 视频 + 原生立体声 |
|
SeedRealtime |
字节 |
音视频全双工 |
— |
实时语音 + 视频双向交互大模型 |
|
Qwen-Image-3.0-Pro |
阿里 |
图像生成 |
— |
上线 Qwen Cloud |
|
SenseNova U1 |
商汤 |
推理 + 图像生成统一 |
✅ |
一个模型同时做推理与生图 |
|
Hy ASR 3.0 |
腾讯混元 |
语音识别 |
preview |
上下文感知的语音识别 |
|
FLUX 3 Video |
Black Forest Labs |
视频生成 |
— |
经 OpenRouter 统一多模态入口上线 |
这张表背后有几件事值得说:
第一,多模态正在从"能力点"变成"系统"。 MiniMax H3 是典型例子。它不是一个视频模型加一个音频模型,而是一个统一的全模态生成系统,文本、图像、视频、音频一套权重出,视频能到 2K 还带原生立体声。商汤 SenseNova U1 走的是另一条路:把"推理"和"图像生成"收进同一个模型。当多模态从"拼装"走向"原生",应用开发者的接入成本在下一次换档。
第二,实时交互成为新战场。 字节 SeedRealtime 做的是音视频全双工:模型在听的同时能说、能看到画面实时回应。这已经不是"生成一段视频"的范畴,而是把人机交互从"打字-回车"推向"说话-看着-回应"。对语音助手、客服、直播场景的开发者,这是下半年最值得盯的机会。
第三,多模态也在开源。 一周之内 MiniMax H3、SenseNova U1 两个重量级开源/开源权重发布,加上此前 Qwen 系的多模态开源生态,开源在多模态上复制了编码板块的剧本:先用开源权重拉平能力门槛,再靠生态抢占有率。
对开发者的实际含义就一句话:2026 年下半年接多模态,你已经不太需要"一个厂商接一个 SDK"了。模型在收敛到"全模态 + 统一接口",而选型维度反而变多了(视频质量、语音时延、开源可自托管、按次还是按量计费)。价格就成了最后一道分水岭,下一节来算这笔账。
四、价格与性价比:API 定价的残酷真相
模型再强,最终都要落到"每百万 token 多少钱"。下面是 2026 年 8 月主流 API 的公开定价快照($/1M tokens,输入/输出;公开渠道快照,以官方实时定价为准):

|
模型 |
输入 $/M |
输出 $/M |
档位 |
|
GPT-5.5 Pro |
30 |
180 |
旗舰·推理 |
|
Claude Opus 4.8 |
5 |
25 |
旗舰·编码/Agent |
|
Claude Fable 5 |
10 |
50 |
旗舰·知识工作 |
|
GPT-5.6 |
5 |
30 |
通用旗舰 |
|
Kimi K3(开源权重) |
3 |
15 |
开源旗舰·编码 |
|
DeepSeek V4 Pro(MIT 开源) |
~1.75 |
~3.5 |
开源·极致性价比 |
|
DeepSeek V4 Flash 正式版 |
~0.14 |
~0.28 |
开源·价格屠夫(新发布) |
|
GLM-5.2 |
— |
~3 |
国产性价比 |
|
Gemini 3 Flash 档 |
— |
~3 |
轻量性价比 |
(公开定价来源:LMArena 价格列 / swfte.com / metatext.io,2026-07 ~ 08 快照。个别模型不同渠道报价有出入,以官方实时定价为准。)
这其中有两个残酷真相:
第一个残酷真相:性能 Top 和价格 Top 几乎不重合。 文本榜 1500 Elo 梯队里,Kimi K3 输出价 15/M,GPT-5.5 Pro 输出价 180/M。性能差距 20 分以内,价格差 12 倍。对批量任务(日志分析、内容抽取、批量改写),用头部旗舰跑等于把利润烧在排行榜上;选对性价比档位,成本能降一个数量级。
刚发布的 DeepSeek V4 Flash 是这个逻辑的极端版本:Artificial Analysis 智能指数 50,贴着 GPT-5.6 Luna 的 51;输出价 $0.28/M,只有 Claude Fable 5 的约 1/90。媒体把这事叫"斩杀线"——比它便宜的没它强,比它强的贵出几个数量级。
第二个残酷真相:价格战已经打到"显性化"。 官方定价公开透明之后,聚合/网关渠道开始出现系统性折价。以我自己的持续监测数据为例(2026-08-06 快照,公开比价页实时更新):
- DeepSeek R1:官方混算价约
4/M,网关渠道约1.15/M(省约七成)
- GPT-5.6 Luna:官方约
0.45/M,网关渠道约0.225/M(五折)
- GLM-5.2:官方约
2.15/M,网关渠道约1.18/M(省约四成五)
(数据来源:公开比价数据 2026-08-06 快照,链接见文末;各家计价方式不同,仅作量级参考)
还有一个值得单说的信号:就在本文成稿前两天,DeepSeek 官方公告计划整体上调 API 定价(当前 V4 Pro 输入 3 元、输出 6 元/百万 token,具体涨幅待定)。连把性价比打到地板上的玩家都要调价,说明价格战正在从"卷低价"转向"动态调价",比价这件事只会越来越重要。
对开发者来说,2026 年的省钱方式已经不是"等降价",而是"选对渠道":同一套 OpenAI 兼容接口,base_url 指向不同网关,同样的活可能差一半以上的成本。这也是为什么"比价"正在从个人爱好变成工程刚需。
五、三个趋势判断
把前面四组数据放回时间轴上,2026 年下半年的版图可以压缩成三个判断。
判断一:开源围剿闭源,差距进入"季度级"收窄。 看数据:Kimi K3 拿下人类偏好的前端编码榜第一(约 1679 Elo),并在 Program Bench、SWE Marathon 两个长程任务登顶,"开源能在单项打赢闭源"已经从假设变成事实;同时 Artificial Analysis 综合指数显示开源旗舰(K3 57 分)与闭源头部(Opus 5 61、GPT-5.6 Sol 59)只剩 2–4 分。按这个收敛速度,综合维度差距有望在 6–12 个月内被抹平。对采购决策的影响是:"闭源一定更强"的假设,2026 年年底之前大概率失效。
判断二:全模态成为标配,单模态产品竞争力被稀释。 事实是:一周 7 款多模态发布(第三节),且 MiniMax H3、SenseNova U1 两个重量级都是开源/开源权重,多模态正在复制编码板块"开源拉平门槛"的剧本。当"一套模型同时出文本、图像、视频、音频"成为默认选项,仍然只提供文本能力的单模态产品,在预算争夺中会越来越被动。对开发者的含义:新项目立项时,默认按"多模态统一接口"设计,而不是先接文本再补模态。
判断三:价格战显性化,比价从爱好变成工程刚需。 依据:性能差 20 分以内、价格差 12 倍(K3 vs GPT-5.5 Pro);同一模型经不同渠道调用,成本可差 50%–70%(第四节的网关折价例证)。官方定价越来越透明,意味着信息差在消失,而渠道差在扩大。同样一个 OpenAI 兼容接口,base_url 选得对不对,就决定了成本结构。这就是为什么 2026 年的技术团队清单里,应该多一项"定期比价"。
六、开发者选型清单
最后,我们总结一下全文,基于我的观点,我们有下面的选择:
|
场景 |
首选 |
备选 |
理由 |
|
通用对话 / 知识工作 |
Claude Fable 5 |
GPT-5.6 |
人类偏好榜头部,但注意价格档位 |
|
编码 · 长程 Agent 循环 |
Kimi K3 |
GPT-5.6 Sol |
Program Bench / SWE Marathon 第一;开源权重可自托管 |
|
编码 · 单次深度审查 |
Claude Opus 4.8 |
Claude Fable 5 |
DeepSWE / FrontierSWE 深读能力领先 |
|
视频生成 |
Wan3.0 / MiniMax H3 |
FLUX 3 Video |
按质量、成本、是否需开源三选 |
|
语音 / 实时交互 |
SeedRealtime |
Hy ASR 3.0 |
音视频全双工 vs 上下文感知 ASR |
|
高性价比批量任务 |
DeepSeek V4 Flash / V4 Pro |
GLM-5.2 |
成本可较旗舰降一个数量级 |
|
多模型混合场景 |
统一 API 网关 |
— |
一个 key 一个计费,省多厂商 SDK 维护 |
如果你正处于"多模型混合场景"、想一步到位省掉多家 SDK 维护,Nova Nexus 星海智能国际站(
https://dolphin.token6688.com/)就是这类平台的一个代表:文本 / 视频 / 图像 / 语音多类模型一个 API key、OpenAI 兼容接口统一调用,正是上面说的"换 base_url 即切换"的典型实现。
三条使用原则:
- 按任务画像选型,不追单一榜单第一:文本、编码、多模态是三个不同的世界(第一、二、三节已经分别证明了)。
- 价格按量级估算,不是按官网页抄:批量场景优先跑性价比档 + 网关渠道,旗舰留给真正需要的 20% 任务。
- 多模型混用时,用统一接口而不是多家 SDK:2026 年几乎所有主流模型都兼容 OpenAI 协议,换 base_url 即可切换,维护成本下降一个量级。想自己动手比价和试接的,看文末。
附录
本文数据来源:LMArena 匿名盲测榜单(Elo 随投票滚动,快照时间 2026-07-21 ~ 08-05);Moonshot 官方发布的编码实测(2026-07);各厂商官方渠道发布(经 AI HOT 收录);主流 API 官方公开定价;公开比价数据快照(2026-08-06)。
免责声明:所有价格为公开渠道快照,以官方实时定价为准;榜单与价格都会随发布节奏变化。我写这篇文章时是 2026 年 8 月初,结论只在此时点成立,下个月可能又换一轮榜首。另个人查询资料恐有疏漏,如有错误请指出。
三个可以自取的资源(开发者向,开源维护,实时更新):
- Nova Nexus 星海智能国际站(面向开发者和企业的多模型统一调用平台,OpenAI 兼容,一个 API key 调用文本 / 视频 / 图像 / 语音多类模型):
https://dolphin.token6688.com/
- 多模型公开价格对比页(Nova Nexus 星海智能国际站 vs OpenRouter,仅对外价):
https://li589.github.io/nova-nexus/price/
- 项目仓库(品牌落地页 + OpenAI 兼容 API 接入指南 + 模型覆盖清单):
https://github.com/li589/nova-nexus
评论区聊一个话题:你生产环境现在用哪个模型?选它的理由是什么?数据会说话,但真实踩坑经验比数据更值钱。
更多推荐
所有评论(0)