本文用 LMArena 匿名盲测、编码实测(Terminal-Bench / SWE-bench)、近一周多模态发布与 API 定价四组数据,盘点 2026 年 8 月的大模型格局,并给出按场景的开发者选型清单。所有数字标注来源,价格以官方实时为准。

关键字:大模型,LMArena,AI模型对比,多模态模型,API定价


2026 年 8 月的第一周,AI 圈有两件不大不小的事:谷歌 DeepMind 的 Jeff Dean 宣布离开,创办了名为 DiscoLoop AI 的新公司;同一周,阿里把 Wan3.0 视频模型挂上了公测,MiniMax 开源了能出 2K 视频加原生立体声的全模态模型 H3。

把这两件事放在一起看,结论其实很直白:巨头之间的"模型能力上限"之争已经进入下半场,竞争的主战场正在从"谁的文字更像人"切换到"谁的全模态更完整、谁的价格更敢打。

对于在 CSDN 上读这篇文章的你,不管是要给自己产品接一个模型,还是想搞清楚 2026 年该押注哪个技术方向,此刻最值得做的都不是追新闻,而是看清一张全景图:文本推理谁是榜首,编码能力谁真的能打,视频图像语音走到哪一步,以及这一切的公开价格是多少。

这篇文章用四组数据讲清楚这件事:LMArena 匿名盲测的文本排名、SWE-bench 与 Terminal-Bench 的编码实测、近一周多模态模型的密集发布、主流 API 的定价横评。所有数字都标注了来源,价格以官方实时为准,不吹不黑。


一、文本推理:LMArena 视角的巅峰对决

LMArena(原 LMSys Chatbot Arena,2024-25 年独立为 lmarena.ai)是现在被引用最多的"人类偏好"基准。玩法是匿名盲测:用户提一个问题,两个模型各自作答,用户只能凭答案质量投票,票数汇成 Elo 评分。它测的不是模型能否背出标准答案,而是真实用户更喜欢谁的输出,这正是采购方拿它当参考的原因。

以下是 2026 年 8 月初的文本榜头部快照(多来源交叉,Elo 会随投票滚动变化,以官网实时为准):

模型

组织

文本 Elo(快照)

备注

Claude Opus 5

Anthropic

~1522

7 月发布的新旗舰

Claude Fable 5

Anthropic

~1509

头部轮换榜首之一

Claude Opus 4.8 Thinking

Anthropic

~1512

编码 / Agent 场景强项

GPT-5.5 Pro

OpenAI

~1488

推理档

Gemini 3.1 Pro Preview

Google

~1486

科学 / 多模态领先

Kimi K3(开源权重)

Moonshot

~1486

文本中游,编码见下节

DeepSeek V4 Pro(MIT)

DeepSeek

~1462

开源性价比标杆

Qwen 3.7 Max

阿里

~1455

国产模型文本最高

(来源:LMArena 第三方快照 swfte.com / toolcenter.ai / datalearner.com,2026-07-21 ~ 08-05)

这张表值得注意的不是第一名,而是三件事:

第一,头部已经挤成一团。 榜首到第十名之间的 Elo 差距不到 30 分,而 LMArena 官方口径是:25 分以内的差距属于噪声。换句话说,Fable 5、Opus 4.8、GPT-5.5 Pro、Gemini 3.1 Pro 谁是"第一",基本取决于本周投票样本。"谁最聪明"这个问题的答案,已经不是一个可以回答的问题了。对选型者来说,真正该问的是场景、上下文、价格和生态,而不是那 10 分的排名差。

第二,榜首在 Anthropic 系内部轮换。 从 6 月的 Opus 4.6/4.7,到 7 月的 Fable 5 与 Opus 5,文本榜头把交椅大部分时间在 Anthropic 手里;OpenAI 的 GPT-5.5 Pro 与谷歌 Gemini 3.1 Pro 稳定咬在 1500 线附近。闭源三强的垄断地位没有变化,变化的是它们之间的差距在收敛。

第三,开源已经摸到头部边缘。 Kimi K3(~1486)、DeepSeek V4 Pro(~1462)、Qwen 3.7 Max(~1455)距离闭源头部只有 30–60 Elo,其中 DeepSeek 是 MIT 开源、Kimi 是开源权重。2026 年的开源与闭源差距,已经从"代差"缩小到"半步"。这个趋势在下一节的编码实测里会体现得更极端。


二、编码能力:开源第一次登顶的地方

如果说文本榜是"人类偏好"的缩影,编码则是"可验证智能"的试金石:模型说它行不行,拉出来跑真实代码任务就知道了。常用的编码实测有四类:SWE-bench Verified(真实 GitHub issue,模型要产出能通过项目测试的补丁)、Terminal-Bench(终端里的真实工程任务)、Program Bench(程序构建)、SWE Marathon(长程多步软件工程,模拟真实项目迭代)。

以下是 Moonshot 官方发布、并经独立来源交叉验证的 2026 年 7 月编码实测矩阵:

基准

Kimi K3

GPT-5.6 Sol

Claude Fable 5

Claude Opus 4.8

Terminal-Bench 2.1

88.3

88.8

84.6

84.6

DeepSWE(仓库级修复)

67.5

73.0

70.0

59.0

Program Bench

77.8

77.6

76.8

71.9

SWE Marathon(长程)

42.0

39.0

35.0

40.0

FrontierSWE

81.2

71.3

86.6

66.7

(来源:Moonshot 官方发布 2026-07 + prompt1001.com / wan27.org 独立交叉验证。SWE-bench Verified 各家评测口径差异较大,未列入本表,以各厂商官方发布为准。)

再叠加一个人类偏好信号。LMArena 前端编码榜(Frontend Code Arena)上,Kimi K3 以约 1679 Elo 登顶第一,超过 Claude Fable 5(~1631)与 GPT-5.6 Sol(~1618),七个前端子领域里拿下六个,唯一输掉的是 Gaming(第一名是 Fable 5)。这是开源模型第一次在人类偏好的编码场景站上榜首。

这张矩阵读出来的信息量比"谁第一"大得多:

第一,Kimi K3 赢的是"长程耐力赛",输的是"单次深读"。 它在 Program Bench、SWE Marathon、前端编码这些需要多步推理、长上下文、持续迭代的任务上压过所有闭源对手;但在 DeepSWE(跨文件理解代码库)、FrontierSWE 这类"一次性深读大仓库"的任务上,Claude Fable 5(86.6)仍然领先它 5 个点。结论:如果你的场景是 agent 长循环、多文件改动、前端整页生成,K3 是当前性价比极高的选项;如果是单次深度代码审查,闭源头部更稳。

第二,"开源编码已可用"不再是口号。 2.8 万亿参数 MoE(每 token 只激活 16/896 个专家)的 K3 以约 3/15 的公开价格,跑出了与 GPT-5.6 Sol 几乎持平的 Terminal-Bench 分数(88.3 vs 88.8)。对预算敏感的团队,这会改写采购决策。

一周前 DeepSeek V4 Flash 正式版又把这条线压低了一档:284B 总参数只激活 13B,架构一点没动,只重做了一轮后训练,代码修复基准 DeepSWE 就从预览版的 7.3 跳到 54.4(六倍多),Terminal-Bench 2.1 拿到 82.7,和 Claude Opus 4.8 的 84.6 几乎打平。小参数、高激活效率、Agent 能力暴涨,这是"开源编码已可用"的最新注脚。

第三,但单项突破不等于全面领先。 在 Artificial Analysis 综合智能指数(10 项基准加权)上,Kimi K3 得 57 分,Claude Opus 5 为 61、GPT-5.6 Sol 为 59。开源追上了编码这个"最陡峭"的单项,综合维度仍差闭源头部 2–4 分。这提醒我们:看模型要看"任务画像",而不是被单一榜单的登顶新闻带走。


三、多模态全谱系:视频 / 图像 / 语音一周齐爆

如果说文本和编码是"存量竞争",多模态就是 2026 年增量最猛的方向。只统计 2026 年 8 月第一周,就有至少七款重量级多模态发布(来源:AI HOT 收录的官方渠道发布):

模型 / 产品

厂商

模态

开源

亮点

Wan3.0

阿里

视频生成

公测

千问 APP 全网首发公测

MiniMax H3

MiniMax

文本+图像+视频+音频

全模态生成,2K 视频 + 原生立体声

SeedRealtime

字节

音视频全双工

实时语音 + 视频双向交互大模型

Qwen-Image-3.0-Pro

阿里

图像生成

上线 Qwen Cloud

SenseNova U1

商汤

推理 + 图像生成统一

一个模型同时做推理与生图

Hy ASR 3.0

腾讯混元

语音识别

preview

上下文感知的语音识别

FLUX 3 Video

Black Forest Labs

视频生成

经 OpenRouter 统一多模态入口上线

这张表背后有几件事值得说:

第一,多模态正在从"能力点"变成"系统"。 MiniMax H3 是典型例子。它不是一个视频模型加一个音频模型,而是一个统一的全模态生成系统,文本、图像、视频、音频一套权重出,视频能到 2K 还带原生立体声。商汤 SenseNova U1 走的是另一条路:把"推理"和"图像生成"收进同一个模型。当多模态从"拼装"走向"原生",应用开发者的接入成本在下一次换档。

第二,实时交互成为新战场。 字节 SeedRealtime 做的是音视频全双工:模型在听的同时能说、能看到画面实时回应。这已经不是"生成一段视频"的范畴,而是把人机交互从"打字-回车"推向"说话-看着-回应"。对语音助手、客服、直播场景的开发者,这是下半年最值得盯的机会。

第三,多模态也在开源。 一周之内 MiniMax H3、SenseNova U1 两个重量级开源/开源权重发布,加上此前 Qwen 系的多模态开源生态,开源在多模态上复制了编码板块的剧本:先用开源权重拉平能力门槛,再靠生态抢占有率。

对开发者的实际含义就一句话:2026 年下半年接多模态,你已经不太需要"一个厂商接一个 SDK"了。模型在收敛到"全模态 + 统一接口",而选型维度反而变多了(视频质量、语音时延、开源可自托管、按次还是按量计费)。价格就成了最后一道分水岭,下一节来算这笔账。


四、价格与性价比:API 定价的残酷真相

模型再强,最终都要落到"每百万 token 多少钱"。下面是 2026 年 8 月主流 API 的公开定价快照($/1M tokens,输入/输出;公开渠道快照,以官方实时定价为准):

模型

输入 $/M

输出 $/M

档位

GPT-5.5 Pro

30

180

旗舰·推理

Claude Opus 4.8

5

25

旗舰·编码/Agent

Claude Fable 5

10

50

旗舰·知识工作

GPT-5.6

5

30

通用旗舰

Kimi K3(开源权重)

3

15

开源旗舰·编码

DeepSeek V4 Pro(MIT 开源)

~1.75

~3.5

开源·极致性价比

DeepSeek V4 Flash 正式版

~0.14

~0.28

开源·价格屠夫(新发布)

GLM-5.2

~3

国产性价比

Gemini 3 Flash 档

~3

轻量性价比

(公开定价来源:LMArena 价格列 / swfte.com / metatext.io,2026-07 ~ 08 快照。个别模型不同渠道报价有出入,以官方实时定价为准。)

这其中有两个残酷真相:

第一个残酷真相:性能 Top 和价格 Top 几乎不重合。 文本榜 1500 Elo 梯队里,Kimi K3 输出价 15/M,GPT-5.5 Pro 输出价 180/M。性能差距 20 分以内,价格差 12 倍。对批量任务(日志分析、内容抽取、批量改写),用头部旗舰跑等于把利润烧在排行榜上;选对性价比档位,成本能降一个数量级。

刚发布的 DeepSeek V4 Flash 是这个逻辑的极端版本:Artificial Analysis 智能指数 50,贴着 GPT-5.6 Luna 的 51;输出价 $0.28/M,只有 Claude Fable 5 的约 1/90。媒体把这事叫"斩杀线"——比它便宜的没它强,比它强的贵出几个数量级。

第二个残酷真相:价格战已经打到"显性化"。 官方定价公开透明之后,聚合/网关渠道开始出现系统性折价。以我自己的持续监测数据为例(2026-08-06 快照,公开比价页实时更新):

  • DeepSeek R1:官方混算价约 4/M,网关渠道约 1.15/M(省约七成)
  • GPT-5.6 Luna:官方约 0.45/M,网关渠道约 0.225/M(五折)
  • GLM-5.2:官方约 2.15/M,网关渠道约 1.18/M(省约四成五)

(数据来源:公开比价数据 2026-08-06 快照,链接见文末;各家计价方式不同,仅作量级参考)

还有一个值得单说的信号:就在本文成稿前两天,DeepSeek 官方公告计划整体上调 API 定价(当前 V4 Pro 输入 3 元、输出 6 元/百万 token,具体涨幅待定)。连把性价比打到地板上的玩家都要调价,说明价格战正在从"卷低价"转向"动态调价",比价这件事只会越来越重要。

对开发者来说,2026 年的省钱方式已经不是"等降价",而是"选对渠道":同一套 OpenAI 兼容接口,base_url 指向不同网关,同样的活可能差一半以上的成本。这也是为什么"比价"正在从个人爱好变成工程刚需。


五、三个趋势判断

把前面四组数据放回时间轴上,2026 年下半年的版图可以压缩成三个判断。

判断一:开源围剿闭源,差距进入"季度级"收窄。 看数据:Kimi K3 拿下人类偏好的前端编码榜第一(约 1679 Elo),并在 Program Bench、SWE Marathon 两个长程任务登顶,"开源能在单项打赢闭源"已经从假设变成事实;同时 Artificial Analysis 综合指数显示开源旗舰(K3 57 分)与闭源头部(Opus 5 61、GPT-5.6 Sol 59)只剩 2–4 分。按这个收敛速度,综合维度差距有望在 6–12 个月内被抹平。对采购决策的影响是:"闭源一定更强"的假设,2026 年年底之前大概率失效。

判断二:全模态成为标配,单模态产品竞争力被稀释。 事实是:一周 7 款多模态发布(第三节),且 MiniMax H3、SenseNova U1 两个重量级都是开源/开源权重,多模态正在复制编码板块"开源拉平门槛"的剧本。当"一套模型同时出文本、图像、视频、音频"成为默认选项,仍然只提供文本能力的单模态产品,在预算争夺中会越来越被动。对开发者的含义:新项目立项时,默认按"多模态统一接口"设计,而不是先接文本再补模态。

判断三:价格战显性化,比价从爱好变成工程刚需。 依据:性能差 20 分以内、价格差 12 倍(K3 vs GPT-5.5 Pro);同一模型经不同渠道调用,成本可差 50%–70%(第四节的网关折价例证)。官方定价越来越透明,意味着信息差在消失,而渠道差在扩大。同样一个 OpenAI 兼容接口,base_url 选得对不对,就决定了成本结构。这就是为什么 2026 年的技术团队清单里,应该多一项"定期比价"。

六、开发者选型清单

最后,我们总结一下全文,基于我的观点,我们有下面的选择:

场景

首选

备选

理由

通用对话 / 知识工作

Claude Fable 5

GPT-5.6

人类偏好榜头部,但注意价格档位

编码 · 长程 Agent 循环

Kimi K3

GPT-5.6 Sol

Program Bench / SWE Marathon 第一;开源权重可自托管

编码 · 单次深度审查

Claude Opus 4.8

Claude Fable 5

DeepSWE / FrontierSWE 深读能力领先

视频生成

Wan3.0 / MiniMax H3

FLUX 3 Video

按质量、成本、是否需开源三选

语音 / 实时交互

SeedRealtime

Hy ASR 3.0

音视频全双工 vs 上下文感知 ASR

高性价比批量任务

DeepSeek V4 Flash / V4 Pro

GLM-5.2

成本可较旗舰降一个数量级

多模型混合场景

统一 API 网关

一个 key 一个计费,省多厂商 SDK 维护

如果你正处于"多模型混合场景"、想一步到位省掉多家 SDK 维护,Nova Nexus 星海智能国际站(https://dolphin.token6688.com/)就是这类平台的一个代表:文本 / 视频 / 图像 / 语音多类模型一个 API key、OpenAI 兼容接口统一调用,正是上面说的"换 base_url 即切换"的典型实现。

三条使用原则:

  1. 按任务画像选型,不追单一榜单第一:文本、编码、多模态是三个不同的世界(第一、二、三节已经分别证明了)。
  1. 价格按量级估算,不是按官网页抄:批量场景优先跑性价比档 + 网关渠道,旗舰留给真正需要的 20% 任务。
  1. 多模型混用时,用统一接口而不是多家 SDK:2026 年几乎所有主流模型都兼容 OpenAI 协议,换 base_url 即可切换,维护成本下降一个量级。想自己动手比价和试接的,看文末。

附录

本文数据来源:LMArena 匿名盲测榜单(Elo 随投票滚动,快照时间 2026-07-21 ~ 08-05);Moonshot 官方发布的编码实测(2026-07);各厂商官方渠道发布(经 AI HOT 收录);主流 API 官方公开定价;公开比价数据快照(2026-08-06)。

免责声明:所有价格为公开渠道快照,以官方实时定价为准;榜单与价格都会随发布节奏变化。我写这篇文章时是 2026 年 8 月初,结论只在此时点成立,下个月可能又换一轮榜首。另个人查询资料恐有疏漏,如有错误请指出。

三个可以自取的资源(开发者向,开源维护,实时更新):

  • Nova Nexus 星海智能国际站(面向开发者和企业的多模型统一调用平台,OpenAI 兼容,一个 API key 调用文本 / 视频 / 图像 / 语音多类模型):https://dolphin.token6688.com/
  • 多模型公开价格对比页(Nova Nexus 星海智能国际站 vs OpenRouter,仅对外价):https://li589.github.io/nova-nexus/price/
  • 项目仓库(品牌落地页 + OpenAI 兼容 API 接入指南 + 模型覆盖清单):https://github.com/li589/nova-nexus

评论区聊一个话题:你生产环境现在用哪个模型?选它的理由是什么?数据会说话,但真实踩坑经验比数据更值钱。

更多推荐