Qwen3.8-Max 正式发布后,最自然的比较对象就是 Kimi K3:一个拥有 2.4T 总参数、推理时激活 95B 参数;另一个达到 2.8T 总参数、激活 104B 参数。两款国产旗舰都瞄准长周期编程、知识工作和原生多模态,也都选择了开放权重路线。参数很接近,开放节奏和技术路径却不完全相同。

Qwen3.8-Max 想回答的是一个更难的问题:模型能不能接住一项复杂工作,在几天甚至更长时间里持续执行,根据结果调整方案,最后交出可用成果?

本文根据 Qwen 官方发布文章 与公开资料整理。文中案例和数据主要来自厂商测试,不能直接等同于第三方独立评测。

如果你正在寻找更灵活、更稳定的方式接入Kimi和Qwen,魔芋支持接入全球200+大模型(客服开白后),并提供合规保障、财务开票、企业级网关、技术支持与定制服务,助力更高效地管理应用AI能力。
链接注册可领百万Tokens:https://www.moyu.info/register?aff=qBX9

在这里插入图片描述

先看发布信息:2.4T 总参数,95B 激活

Qwen3.8-Max 建立在 Qwen3.5 的架构基础上,总参数量扩展到 2.4T,每次推理激活约 95B 参数。模型已经可以通过 QwenCloud API 使用,开放权重计划在发布公告后的下一周提供。

项目 Qwen3.8-Max
总参数量 2.4T
激活参数量 95B
架构基础 Qwen3.5
主要方向 编程、知识工作、研究、长周期任务、多模态智能体
当前使用方式 QwenCloud API
权重状态 官方宣布将于下周开放

从 2.4T 总参数和 95B 激活参数的组合可以看出,它走的是稀疏激活路线:模型虽然存着 2.4T 参数,但单次生成不会把全部参数都投入计算。这样可以在扩大模型容量的同时,控制每个 token 的计算量。不过,“只激活 95B”不代表部署轻松。完整权重的存储、跨卡通信、显存和推理框架仍然是很高的门槛,这类模型的主要使用者会是云厂商、大型机构和专业推理服务商,而不是普通个人工作站。

这次发布为什么一直在谈“长周期任务”

过去的大模型评测经常把任务切成一个个短问题:写一个函数、解一道题、回答一个知识点。Qwen3.8-Max 的官方案例换了一种考法:不给现成代码和固定步骤,让模型自己规划、调用工具、运行程序,再根据反馈继续修改。

连续运行十多天,从空目录做出工程项目

oh-my-cli 项目中,Qwen3.8-Max 从空目录开始构建测试框架。需求先被整理成 GitHub Issue,再由智能体认领任务、编写代码、运行单元测试和端到端测试,最后提交 PR。失败的任务会重新回到修复流程。

截至官方统计时间,这次自主运行持续约 16 天,累计产生 265 次提交、127 个 PR 和 151 个 Issue。完整轨迹放在了 qwen-code-dev-bot/oh-my-cli 仓库中。

代码行数只是表面,更有价值的是“恢复能力”。长任务必然会碰到测试失败、依赖变化和方案走偏。模型能否保留任务状态、读懂反馈并继续推进,比一次性生成一段漂亮代码更接近真实的软件工程。

用 125 小时复现论文,再继续改进

另一个案例是复现论文《Unified Data Selection for LLM Reasoning》。模型拿到论文和 GPU,但没有起始代码,需要自己搭建数据处理、训练和评估流程。

官方给出的过程数据很具体:约 125 小时、7600 行代码、1100 多次操作、33 轮 GPU 训练。前 37 小时用于重建论文流程,后续约 88 小时进入“提出假设、运行实验、分析结果、再次调整”的循环。它在四轮中测试了 18 个想法,最终方案在 AIME24 上比复现出的论文基线高 2.71 个百分点。

这更像一名会做实验的研究助理,而不是只负责生成代码的补全工具。当然,这仍是 Qwen 团队设计并报告的案例。等权重发布后,社区能否在不同论文、不同训练环境中复现相似表现,会更有说服力。

24 小时参加真实比赛,超过 87% 的队伍

Qwen 团队还让模型参加了 WWW2025 多模态对话意图识别挑战赛。它在 24 小时内组合了 BERT、MacBERT、RoBERTa、Qwen2.5-VL-7B 和 Chinese-CLIP,通过交叉验证调整权重,在 45 次提交中把准确率从 0.60 提高到 0.853。

按照官方结果,它超过了 526 支队伍中的 458 支,也就是约 87%。这个案例说明,模型没有执着于“用一个大模型解决一切”,而是根据文本、截图和置信度选择不同模型,再把结果合并。这种工程取舍很像真实竞赛和生产项目。

从写代码到做芯片:闭环反馈才是主角

Qwen3.8-Max 的芯片设计案例很有代表性。任务是优化一个 GCD/RSA 密码硬件加速器,工具链包括 Iverilog、Yosys 和 OpenROAD。模型需要保证功能正确,同时尽量减少门数,并完成后端布局布线验证。

在约 500 轮交互和 71 次评估后,设计从 8298 个门缩减到 678 个门。官方称最终版图面积由 106×106 μm² 降到 46×46 μm²,总线长从 33369 μm 降到 4187 μm,并在 500 MHz 下实现正时序裕量。

模型在这个过程中做过算法级改写、位宽裁剪、状态机精简和逻辑共享。单次生成 RTL 只是起点,之后还要反复经历“编辑、仿真、综合、看结果、再改”的闭环。这个模式同样出现在 365 天电商经营模拟中:模型根据库存、现金流、供应商谈判和促销反馈持续调整,最终余额达到 416252 元。官方报告的回报为 4.16 倍,比第二名高 38%。

两个任务看起来相距很远,底层能力却相同:状态要保存,反馈要读懂,策略还得允许推翻重来。Agent 的难点一直都在这里。

多模态不只是“看图”,而是边做边检查

Qwen3.8-Max 也被定位为原生多模态智能体。它可以处理图片、长文档和视频,并用于前端重建、视频编辑、3D 室内设计等任务。

更实用的一点是,视觉被放进了执行循环。模型生成页面或 3D 场景后,会继续观察布局、方向、空间关系和交互结果;如果电视朝反了、组件错位或动画不符合预期,它可以修改计划并重新生成。

这和传统视觉问答有明显区别。前者回答“图里有什么”,后者要根据画面判断“我刚才做得对不对”。当代码执行、GUI 操作和视觉检查被串起来,智能体才有机会在真实软件环境里完成一整项任务。

Qwen3.8-Max 对比 Kimi K3:相似的规模,不同的开放节奏

Qwen3.8-Max 发布后,最自然的比较对象是 Moonshot AI 的 Kimi K3。两者都是 2026 年推出的超大规模模型,都面向开放权重路线,也都把长周期编程、知识工作和原生多模态放在核心位置。

对比项 Qwen3.8-Max Kimi K3
总参数量 2.4T 2.8T
激活参数量 95B 104B
架构信息 基于 Qwen3.5,更多细节待权重与模型卡公布 KDA + Gated MLA、Attention Residuals、Stable LatentMoE
专家激活 官方发布文未披露完整专家配置 896 个专家中激活 16 个,另有 2 个共享专家
上下文长度 本次官方发布文未给出明确数字 1,048,576 tokens
多模态 原生多模态,强调视觉反馈闭环 原生视觉,支持文本与图像输入
开放进度 宣布下周开放权重 权重已在 Hugging Face 提供
主要定位 编程、工作、研究和长周期任务 长周期编程、知识工作与推理

Kimi K3 的总参数和激活参数都略高,官方模型卡披露也更完整。根据 Kimi K3 官方模型卡,它有 2.8T 总参数、104B 激活参数和 100 万 token 上下文,采用量化感知训练,权重以 MXFP4 形式发布。Kimi K3 的优势很现实:社区现在就可以下载权重、检查配置并开始适配。

Qwen3.8-Max 的 95B 激活参数比 Kimi K3 的 104B 少约 8.7%,理论上可能带来一定的单 token 计算差异,但不能据此直接判断谁更便宜或更快。实际推理成本还取决于精度、专家路由、上下文长度、并行方式、缓存策略和硬件利用率。

Qwen 的看点在另一边。Qwen 家族已有较成熟的模型谱系、工具链和开发者生态,这次又首次把 Max 档位纳入开放权重路线。如果许可证、推理代码、量化版本和部署文档能同步到位,它会给开源 Agent 生态提供一个新的旗舰底座。

因此,这两款模型目前还不能简单排出胜负。Kimi K3 在开放时间和架构透明度上领先一步;Qwen3.8-Max 则拿出了大量长周期任务案例,并承诺把 Max 级权重交给社区。要得出有意义的结论,需要等 Qwen 权重落地后,在同一套硬件、相同上下文和同一 Agent 框架里测试。

“开放权重”不等于完整开源,这几点还要等

发布消息很热闹,但有三件事需要冷静看待。

第一,开放权重不等于完整开源。训练数据、数据清洗方法、训练代码和完整训练过程是否公开,要看后续仓库与许可证。文章标题里常把 open-weight 简写为“开源模型”,技术讨论中最好把两者分清。

第二,现阶段的亮眼结果主要来自官方案例。16 天自主编程、芯片优化和 365 天电商模拟都很有意思,但测试环境、任务选择和评价方法由厂商掌握。权重发布后的第三方复现更重要。

第三,2.4T 参数决定了它不是一款轻量本地模型。即便每次只激活 95B 参数,完整模型的存储和服务成本仍然惊人。开放权重的第一波价值,更可能体现在研究、云端部署、推理优化和蒸馏,而不是“消费级显卡一键运行”。

写在最后

我认为,Qwen3.8-Max 这次最重要的消息不是 2.4T,而是 Qwen 愿意把 Max 级模型权重开放出来。

参数规模当然会吸引眼球,但官方案例已经把竞争方向说得很清楚:下一阶段比的是模型能否在真实工具环境中持续工作,遇到失败能不能恢复,交付结果能不能被测试和验证。一次回答写得漂亮,和连续十天把项目做完,中间隔着一整套工程能力。

Kimi K3 已经抢先交出了开放权重,Qwen3.8-Max 则带着 95B 激活参数和一批长周期案例入场。接下来要看开放权重能否按计划发布、许可证是否友好、社区能否复现官方结果,以及推理框架能否把这样的超大 MoE 模型跑得足够稳定。

如果这些环节顺利,Qwen3.8-Max 的意义会比一张跑分表更大:它可能成为开放权重 Agent 模型的新底座。现在先别急着封王,等权重落地,代码和复现结果会给出更可靠的答案。


参考资料

  1. Qwen3.8-Max 官方发布文章
  2. Kimi K3 官方 Hugging Face 模型卡
  3. Qwen3.8-Max 自主编程案例 oh-my-cli

更多推荐