8 月 3 日,阿里干了件以前从没干过的事:把 Qwen-Max 级别的模型权重开源。过去两年多,Max 系列一直是藏在 API 后面的商业旗舰,你花钱、它给接口,权重长什么样没人见过。这次 Qwen3.8-Max 直接把 2.4 万亿参数的权重亮出来,官方宣布下周(预计 8 月 10 日当周)在 Hugging Face 和 ModelScope 同步开源。

官方给的数据也很炸:PaperBench 93 分,比 Fable 5 高 4.2 分;芯片设计案例把 8,298 个逻辑门压到 678 个;模拟经营一年的电商店铺,赚了 41.6 万元。

但先别急着高潮。这份 benchmark 表是 Qwen 自己测的——the-decoder 等独立媒体已经明确标注"结果来自内部测试,独立验证待进行"。这篇文章把官方公布的对比数据全部拉出来,一张一张表过,顺便告诉你:哪些分数可以信,哪些地方藏着猫腻。

30 秒看完结论

场景 结论 一句话理由
编程(PaperBench 类研究型任务) Qwen3.8-Max 登顶 93.0 分,反超所有闭源旗舰
编程(SWE-bench Pro 类真实工程) Fable 5 领先 80.0 vs 67.7,差距超过 12 分
通用智能体 Fable 5 微弱领先 大多数基准领先 1-4 分,Qwen 紧随其后
多模态视觉 第一梯队但非第一 ZeroBench、Dense200 登顶,其余紧随 GPT-5.6 Sol
长周期任务 Qwen 差异化最强 芯片设计、电商模拟等案例无竞品可对标
开源 历史首次 Max 级权重下周开源,Kimi K3(2.8T)已提前占位

翻译成人话:Qwen3.8-Max 不是"全面超越闭源",而是在官方自测的几十个基准里挑出了它最强的领域(研究型编程、视觉、长周期任务)登顶,在真实工程编程上依然落后 Fable 5 一个身位。

Qwen3.8-Max 是什么:先对齐基本信息

项目 参数
总参数 2.4 万亿(95B 激活,MoE)
架构基础 Qwen 3.5
上下文 1M token
发布 2026-08-03,QwenCloud API 即日可用
开源 下周在 Hugging Face / ModelScope 放出权重
定价模式 reasoning_effort(xhigh / medium / low)三级控制成本

几个值得注意的点:这是 Qwen 家族首次开源 Max 级权重,也是继 7 月中旬 preview 版之后正式发布的完整版本。模型同时支持 OpenAI Chat Completions 和 Anthropic API 协议——意味着 Claude Code、Codex、Qoder CLI、Qwen Code、OpenClaw 这些主流智能体框架都能直接接入,不需要写适配层。

所以呢:如果你在等一个能本地部署、还能无缝接进现有 agent 工作流的国产旗舰,下周权重放出后,这是第一个选项。以前想跑 Qwen-Max 级别的模型只能租 API,现在可以自己拉权重了。

编码能力:PaperBench 反超,SWE-bench 追不上

先看官方公布的编码智能体对比(Qwen 官方自测,括号内为评估框架差异):

Benchmark Qwen3.8-Max Fable 5 Opus 4.8 GPT-5.6 Sol
PaperBench 93.0 88.8 80.3 90.5
Terminal Bench 2.1 86.6 84.6 84.6 88.8
SWE-bench Pro 67.7 80.0 69.2 64.6
DeepSWE 1.1 56.6 70.0 59.0 73.0
FrontierSWE 73.5 88.8 70.0
MLS-Bench-Lite 41.0 49.9 42.8 46.2

三个信息量很大的点:

第一,PaperBench 93 分是全场最高。这是研究型编程基准——模型要在没有现成代码的情况下复现论文实验。Qwen 在这个基准上比 Fable 5 高 4.2 分、比 GPT-5.6 Sol 高 2.5 分。但注意脚注:该基准由 Claude Opus 4.6 评判,且 Qwen 用 Claude Code 框架跑、GPT-5.6 Sol 用 Codex 跑——评估框架不一样,分数不完全可比

第二,SWE-bench Pro 上 Qwen 被 Fable 5 拉开了 12.3 分。SWE-bench Pro 是真实 GitHub issue 修复的标杆基准,含金量公认最高。67.7 vs 80.0,这不是"稍逊"而是"落后"。官方正文里大篇幅讲自主编程案例,但表格里这个刺眼的数字,文章只字未提。

第三,FrontierSWE 是全场差距最大的:Fable 5 拿 88.8,Qwen 只有 73.5——落后 15.3 分。FrontierSWE 是官方排行榜上难度更高的"下一代 SWE-bench"(MEAN@5 结果取自官方排行榜,数据截至 8 月 3 日),题目更接近真实工程现场。

所以呢:如果你拿它做"复现论文、跑研究实验"这类开放型任务,Qwen3.8-Max 是目前自测数据里最强的;但如果你让它修真实项目的 issue,Fable 5 依然是断层领先。买之前想清楚自己的场景是哪一类。

通用智能体:紧咬 Fable 5,但没一次登顶

Benchmark Qwen3.8-Max Fable 5 Opus 4.8 GPT-5.6 Sol
CoWorkBench 74.8 75.9 72.3 71.5
WorkSpaceBench 67.7 68.7 66.8 65.6
JobBench 53.4 57.4 48.4 45.4
SkillsBench 70.2 70.9 65.1 73.5
Agents’ Last Exam(通过率/得分) 27.0 / 52.4 27.0 / 45.1 30.6 / 53.6
Automation-Bench 27.3 29.1 27.2 29.7
WideSearch 81.9 81.2 72.9
HLE(带工具) 56.2 64.5 57.9 58.0

通用智能体是"全"维度里最有意思的一块:Qwen3.8-Max 没有一个基准登顶,但每个基准都在第二名附近。CoWorkBench 差 Fable 5 1.1 分、WorkSpaceBench 差 1.0 分、JobBench 差 4.0 分。

注意 HLE(带工具):这是"人类最后考试"的人类知识上限基准,Fable 5 的 64.5 分比 Qwen 的 56.2 高出 8.3 分——在知识广度和工具协作上,闭源旗舰依然有明显优势。

所以呢:通用 agent 场景(跑自动化流程、处理文档工作流),Qwen3.8-Max 已经是"闭源旗舰之下第一人",和 Fable 5 的差距在 1-4 分区间,但如果你需要的是知识密度极高的深度任务(HLE 类),差距会拉到 8 分以上。

通用推理:中游水平,不吹不黑

Benchmark Qwen3.8-Max Fable 5 Opus 4.8 GPT-5.6 Sol
GPQA Diamond 92.6 92.6 92.0 94.1
HLE 43.6 53.3 45.7 47.2
IFBench(指令跟随) 82.8 63.5 62.2 72.7
HealthBench 60.2 52.4 55.3
PLawBench 73.2 70.2 69.6 72.3
$OneMillion-Bench 52.5 55.9 41.8 53.8

纯推理(GPQA Diamond 科学问答)四家都在 92-94 分区间,Qwen 与 Fable 5 持平;但 HLE(开放知识考试)上 Fable 5 的 53.3 分一骑绝尘,Qwen 的 43.6 分落后近 10 分。

有意思的是 IFBench(指令跟随)Qwen 82.8 全场最高,HealthBench(医疗)60.2 也登顶。这说明 Qwen3.8-Max 不是全面中庸,而是在特定领域(指令遵循、医疗、法律)有局部优势

所以呢:如果你的场景是"让模型乖乖照指令办事"(比如批量数据处理、格式转换),Qwen 的指令跟随能力反而比闭源旗舰更好;但如果比知识深度,闭源还是闭源。

多模态:视觉第一梯队,多项登顶

Benchmark Qwen3.8-Max Fable 5 Opus 4.8 GPT-5.6 Sol
MMMU-Pro 82.3 81.2 75.6 83.0
MathVision 95.2 / 97.7 92.7 / 98.6 87.1 / 97.1 90.8 / 97.8
ZeroBench(Pass@5) 24.0 / 49.0 20.0 / 46.0 17.0 / 34.0 22.0 / 35.0
Dense200 87.0 31.1 20.8 55.3
OSWorld-Verified 86.1 85.0 83.4 83.2
VideoMME(含字幕) 90.4 85.4 89.5
参数化 CAD 基准 91.5 87.5 85.1 86.2

多模态是 Qwen3.8-Max 相对最强的板块:ZeroBench(超难视觉测试)、Dense200(密集信息图)、OSWorld-Verified(操作系统操作)、视频理解、参数化 CAD 均登顶;MathVision 在无置信区间口径下第一(95.2),有置信区间口径 Fable 5 更高(98.6)。Dense200 上 Fable 5 只有 31.1 分、Opus 4.8 只有 20.8 分,而 Qwen 拿到 87.0——这是全场最夸张的分差。

配合官方发布的内容(200 页 PDF 跨页理解、100 小时视频记忆图谱、截图重建前端项目、户型图转 Blender 3D),Qwen3.8-Max 的视觉能力确实不只是"能看图",而是贯穿了"看→做→检查"的闭环——它边生成边观察自己的中间结果,发现问题自己改。

所以呢:做视觉 agent、UI 自动化、图像理解类应用的开发者,Qwen3.8-Max 是目前自测数据里性价比最高的选择——而且下周权重开源后可以私有化部署,视觉数据不用出企业内网。

差异化武器:长周期任务,别人没数据可对比

编码、推理、多模态都是"存量竞争",但 Qwen 官方这次真正想讲的故事是长周期任务——让模型连续数天自主工作,这不是 benchmark 分数能概括的:

芯片设计:Qwen3.8-Max 自主跑完整个硅片设计流程(逻辑重构→多约束优化→物理版图),约 500 轮交互、71 次评估,把 GCD/RSA 密码加速器从 8,298 个门压缩到 678 个门,物理版图从 106×106 µm² 缩到 46×46 µm²(缩减 81%),最终在 500 MHz 下时序收敛。全程无黄金参考设计、无人工干预。

电商模拟:E-Commerce Bench(基于淘宝/天猫脱敏数据的一年期仿真),Qwen3.8-Max 用 10 万元启动资金运营多家店铺,识别出供应商池里 152 家欺诈商户,年末总余额 ¥416,252(4.16 倍回报),比第二名 GLM 5.2 高 38%,比上一代 Qwen3.7-Max 提升 152%。

自主编程:10 天以上的长周期运行中,Qwen3.8-Max 从零构建了 oh-my-cli 项目(截至 7 月 30 日:265 commits、127 PR、151 issues);复现论文"Unified Data Selection for LLM Reasoning"后自己改进,在 AIME24 上比论文方法再高 2.7 个百分点;WWW2025 多模态竞赛中 24 小时自主构建方案,0.60 → 0.853 准确率,击败 526 支人类团队中的 458 支。

这些案例的共同点是:没有起始代码、没有现成流程、连续工作数天。这个能力维度上,Fable 5 和 GPT-5.6 Sol 的官方资料里没有直接可比的公开数据。

所以呢:如果你的需求是"丢一个长期目标让 AI 自己干几天"(比如跑一个研究项目、运营一个模拟业务),Qwen3.8-Max 是目前唯一用完整案例证明过这件事的开源模型。但注意——这些案例全部是官方自述,复现成本极高,建议等社区把 oh-my-cli 仓库的 265 个 commits 跑完验证再说。

必须打的三个问号

问号一:全是官方自测。 整个对比表来自 Qwen 官方博客,the-decoder 明确标注"结果来自内部测试,独立验证待进行"。历史经验是:厂商自测分数通常比第三方复测乐观。等下周权重放出,人工分析(Artificial Analysis)复测才是真正的照妖镜。

问号二:评估框架不一致。 同一张表里,Terminal Bench 2.1 中 Qwen 用 Claude Code 测(avg@10、5 小时超时)、GPT-5.6 Sol 用 Codex 测;SWE-bench Pro 全员用 Claude Code,但 Qwen 的脚注承认"已修正有问题的任务并在优化后的基准上评估所有基线"——测法不同,分数就不能当同一把尺子用。Fable 5 的结果还涉及回退机制(官方脚注自述)。

问号三:成本问题被回避了。 有评论指出:Qwen3.8-Max 用近 20 倍于闭源旗舰的计算成本(2.4T 参数 + 大规模 RL 训练环境扩展),只换来了几个百分点的领先。官方博客的 RL 训练图表显示内部指标从 0.474 提升到 0.725——这意味着海量 GPU 算力堆出来的结果。对用户是好事(开源、便宜),但要说"AI 能力范式突破"还言之过早。

开源棋局:Qwen 不是唯一的下注者

Qwen3.8-Max 最大的历史意义不在分数,而在权重开源。7 月 27 日,月之暗面已经把 2.8T 参数的 Kimi K3 权重放上了 Hugging Face(还附赠了 attention kernels、MoE 通信库等基础设施代码)——比 Qwen3.8-Max 更大、更早开源。不过独立测试显示 K3 在网络安全和复杂数学上明显落后于西方顶级模型。

所以现在开源阵营的格局是:Kimi K3(2.8T,已开源)与 Qwen3.8-Max(2.4T,下周开源)正面交锋,而闭源阵营的 Fable 5、GPT-5.6 Sol、Opus 4.8 依然占据多个基准榜首。开源模型首次在旗舰级参数规模上形成双雄格局,"开源=落后闭源一代"的定律正在被改写——尽管还差最后一步:需要第三方复测来证明这一切不是官方滤镜

那么问题来了:你愿意把核心业务押在一个"官方自测登顶、权重即将开源"的模型上,还是等社区复测数据出来再动?我个人倾向后者——毕竟权重下周就放出来了,等一周,让数据说话。


数据来源:Qwen 官方博客(qwen.ai,2026-08-03)、the-decoder(2026-08-03)独立报道、新浪科技(2026-08-03)、SegmentFault 社区报道。所有 benchmark 分数均为 Qwen 官方自测,未经独立第三方复测;E-Commerce Bench、RecreationBench 等内部基准数据无独立来源。模型时间线:Fable 5 发布于 2026-06-09,Kimi K3 开源于 2026-07-27,Qwen3.8-Max 正式版发布于 2026-08-03,权重预计 2026-08-10 当周开源。

更多推荐