一、版本发布总览

版本 发布日期 关键参数规模 核心改动
Qwen v1 2023.08-11 1.8B / 7B / 14B / 72B 首代开源,SFT + RLHF 对齐
Qwen1.5 2024.02.05 0.5B ~ 110B(8档)+ MoE-A2.7B DPO/PPO 对齐,首个 MoE 模型
Qwen2 2024.06.06 0.5B ~ 72B + 57B-A14B(MoE) GQA / SwiGLU / RoPE,7T tokens 数据
Qwen2.5 2024.09.19 0.5B ~ 72B(7档) 18T tokens 数据,151K 词表,衍生 Coder/Math/VL
Qwen3 2025.04.29 Dense 0.6B~32B + MoE 235B-A22B Thinking/Instruct 模式,256K→1M 上下文
Qwen3-Omni 2025.09.22 全模态 MoE 端到端多模态,实时语音交互
Qwen3.5 2026.02.16 Dense 0.8B~27B + MoE 至 397B-A17B 统一视觉语言基座,Gated Delta Net + MoE,201 语言
Qwen3.6 2026.04.16 27B Dense + 35B-A3B MoE Agentic Coding,Thinking Preservation

二、各版本详细信息

2.1 Qwen v1(2023年8月-11月)

参数规模: 1.8B、7B、14B、72B

模型变体:

模型 训练数据量 最大上下文长度
Qwen-1.8B / Chat 2.2T tokens 32K
Qwen-7B / Chat 2.4T tokens 32K
Qwen-14B / Chat 3.0T tokens 8K
Qwen-72B / Chat 3.0T tokens 32K
  • 每个尺寸提供 Base(基座)和 Chat(对话)版本
  • Chat 模型额外提供 Int4 / Int8 量化
  • 对话模型采用 SFT + RLHF 对齐
  • 支持工具调用(Tool Use)、Agent 能力、代码解释器

相关链接:


2.2 Qwen1.5(2024年2月)

参数规模:

类型 尺寸
Dense(稠密) 0.5B、1.8B、4B、7B、14B、32B、72B、110B
MoE(混合专家) Qwen1.5-MoE-A2.7B(2024-03-28 发布)

核心升级(vs Qwen v1):

  1. 对齐方法升级:引入 DPO(Direct Policy Optimization)PPO(Proximal Policy Optimization),替代纯 RLHF
  2. 尺寸覆盖扩大:新增 0.5B、4B、32B、110B 四个规格
  3. 首次引入 MoE 架构:Qwen1.5-MoE-A2.7B,仅激活 2.7B 参数
  4. Chat 模型人类偏好对齐显著提升

相关链接:


2.3 Qwen2(2024年6月)

参数规模: 0.5B、1.5B、7B、57B-A14B(MoE)、72B

核心升级(vs Qwen1.5):

  1. 训练数据扩展至 7T tokens
  2. 架构引入 GQA(Grouped Query Attention)SwiGLU 激活函数、RoPE 位置编码
  3. 新增 57B-A14B 的 MoE 模型(总参数 57B,活跃参数 14B)
  4. 作为 Qwen2.5 系列的技术基础

衍生专项模型:

模型 说明 参数规模
Qwen2-VL 视觉语言模型 2B、7B、72B
Qwen2-Audio 音频理解模型

相关链接:


2.4 Qwen2.5(2024年9月)

参数规模: 0.5B、1.5B、3B、7B、14B、32B、72B(共 7 个开源尺寸)

另有 Qwen2.5-Turbo 和 Qwen2.5-Plus(MoE,闭源 API 访问)

架构细节:

特性 说明
注意力机制 GQA(Grouped Query Attention)
位置编码 RoPE(Rotary Position Embedding)
激活函数 SwiGLU
归一化 RMSNorm + QKV bias
分词器 BBPE,词表大小 151,643

核心升级(vs Qwen2):

  1. 预训练数据从 7T → 18T tokens(2.5 倍增长)
  2. 改进数据过滤、合成数据生成、领域数据配比
  3. MoE 模型采用细粒度专家分片 + 共享专家路由
  4. Qwen2.5-72B-Instruct 性能与 Llama-3-405B-Instruct(5 倍参数量)相当

衍生专项模型:

模型 发布时间 参数规模 说明
Qwen2.5-Coder 2024 多尺寸 代码专项模型
Qwen2.5-Math 2024 多尺寸 数学推理模型
QwQ-32B 2025.03 32B 推理增强模型
Qwen2.5-VL 2025.01.28 3B / 7B / 32B / 72B 视觉语言模型(32B 于 2025.03.25 补充发布)
Qwen2.5-Omni 2025.03.22 全模态模型

相关链接:


2.5 Qwen3(2025年4月)

参数规模:

类型 尺寸
Dense(稠密) 0.6B、1.7B、4B、8B、14B、32B
MoE(混合专家) 30B-A3B、235B-A22B

Qwen3-2507 更新(2025年7-8月):

在 3 个尺寸(235B-A22B、30B-A3B、4B)上分离出两个独立变体:

  • Instruct 版本:非思考模式,高效通用对话
  • Thinking 版本:思考模式,复杂逻辑推理
  • 上下文长度达 256K tokens,可扩展至 1M tokens

核心升级(vs Qwen2.5):

  1. Dense 模型尺寸重新设计(0.6B / 1.7B / 8B 为新增规格)
  2. MoE 旗舰 235B-A22B(总参数 235B,活跃 22B)
  3. 从统一模式切换演进为 Thinking / Instruct 独立变体
  4. 上下文窗口大幅扩展至 256K-1M

衍生专项模型:

模型 发布时间 说明
Qwen3-VL 2025 下半年 Dense(2B/4B/8B/32B)+ MoE(30B-A3B / 235B-A22B),含 Instruct 和 Thinking 版
Qwen3-Coder-Next 2026 Hybrid Attention + MoE 架构,基于 Qwen3-Next-80B-A3B-Base
Qwen3-Next-80B-A3B 2025.09.11 超稀疏 MoE + Hybrid Attention,极致推理效率

相关链接:


2.6 Qwen3-Omni(2025年9月)

定位: 端到端全模态基座模型

核心能力:

  • 输入:文本、图像、音频、视频
  • 输出:文本 + 实时自然语音流式响应
  • 架构:MoE Thinker-Talker 设计 + 多码本低延迟方案
  • 支持 119 种文本语言19 种语音输入语言10 种语音输出语言
  • 在 36 项音频/视频基准中 22 项达到 SOTA

相关链接:


2.7 Qwen3.5(2026年2月)

发布时间线:

日期 发布模型
2026-02-16 Qwen3.5-397B-A17B(MoE 旗舰)
2026-02-24 Qwen3.5-122B-A10B / 35B-A3B(MoE)+ 27B(Dense)
2026-03-02 Qwen3.5-9B / 4B / 2B / 0.8B(Dense 小模型)

参数规模:

类型 尺寸
MoE(混合专家) 397B-A17B、122B-A10B、35B-A3B
Dense(稠密) 27B、9B、4B、2B、0.8B

核心升级(vs Qwen3):

  1. 统一视觉-语言基座(Early Fusion):在万亿级多模态 token 上预训练,单一模型同时达到 Qwen3 文本能力 + 超越 Qwen3-VL 的视觉能力
  2. 高效混合架构:引入 Gated Delta Networks + 稀疏 MoE,实现高吞吐低延迟推理
  3. 可扩展 RL 泛化:跨百万级 Agent 环境的强化学习,渐进式复杂任务分布
  4. 全球语言覆盖:扩展至 201 种语言和方言
  5. 下一代训练基础设施:多模态训练效率接近纯文本训练的 100%,异步 RL 框架支持大规模 Agent 编排

相关链接:


2.8 Qwen3.6(2026年4月)

发布时间线:

日期 发布模型
2026-04-16 Qwen3.6-35B-A3B(MoE)
2026-04-22 Qwen3.6-27B(Dense)

参数规模:

类型 尺寸
MoE 35B-A3B
Dense 27B

核心升级(vs Qwen3.5):

  1. Agentic Coding 增强:前端工作流和仓库级推理能力更流畅精准
  2. Thinking Preservation(思维保留):新特性,在对话历史中保留思考上下文,简化迭代开发、减少重复推理开销
  3. 定位为"稳定性和实际可用性"优先的迭代版本,基于社区反馈打磨

相关链接:


三、其他重要衍生模型

模型 发布时间 类型 说明 GitHub
Qwen3-TTS 2026.01.21 语音合成 流式生成、声音克隆、自由声音设计(11.8K stars) QwenLM/Qwen3-TTS
Qwen3-ASR 2026.01.28 语音识别 多语言语音/音乐/歌曲识别,语言检测,时间戳预测 QwenLM/Qwen3-ASR
Qwen-Image 2025.08.03 图像生成 图像生成基座模型,复杂文字渲染,精确图像编辑(8K stars) QwenLM/Qwen-Image
Qwen-VLA 2026.05.28 具身智能 视觉-语言-动作模型,面向机器人等具身智能场景 QwenLM/Qwen-VLA
Qwen3-VL-Embedding 2026.01.08 多模态嵌入 视觉语言嵌入模型 QwenLM/Qwen3-VL-Embedding
Qwen3-Embedding 2025.06.05 文本嵌入 文本嵌入模型 QwenLM/Qwen3-Embedding
Qwen3Guard 2025.09.23 安全 安全护栏模型 QwenLM/Qwen3Guard
Qwen Code 2025.06.26 开发工具 终端 AI Agent,类似 Claude Code(25K stars) QwenLM/qwen-code

四、关键技术演进总结

技术特性 首次引入版本 说明
SFT + RLHF Qwen v1 基础对齐方法
DPO / PPO Qwen1.5 替代纯 RLHF,提升偏好对齐
MoE 架构 Qwen1.5-MoE 激活参数 2.7B,大幅降低推理成本
GQA Qwen2 分组查询注意力,提升推理效率
SwiGLU Qwen2 替代传统激活函数
RoPE Qwen2 旋转位置编码
BBPE Tokenizer(151K) Qwen2.5 统一多语言词表
18T 数据规模 Qwen2.5 预训练数据从 7T 翻倍至 18T
Thinking / Instruct 分离 Qwen3-2507 推理与对话解耦为独立模型
Hybrid Attention + MoE Qwen3-Next / Coder 混合注意力,代码/效率专项架构创新
256K → 1M 上下文 Qwen3-2507 超长上下文支持
MoE Thinker-Talker Qwen3-Omni 端到端多模态架构
Gated Delta Networks + MoE Qwen3.5 极致推理效率的混合架构
Early Fusion 多模态训练 Qwen3.5 统一视觉语言基座
Thinking Preservation Qwen3.6 跨轮对话保留思考上下文

五、模型变体分类汇总

类别 代表模型
基座模型(Base) Qwen-7B、Qwen2.5-72B、Qwen3-32B
对话模型(Chat / Instruct) Qwen-Chat、Qwen2.5-Instruct、Qwen3-Instruct、Qwen3.6-27B
推理模型(Thinking) Qwen3-Thinking、QwQ-32B
代码模型(Coder) Qwen2.5-Coder、Qwen3-Coder-Next
数学模型(Math) Qwen2.5-Math
视觉语言模型(VL) Qwen2-VL、Qwen2.5-VL、Qwen3-VL
全模态模型(Omni) Qwen2.5-Omni、Qwen3-Omni
音频模型(Audio / TTS / ASR) Qwen2-Audio、Qwen3-TTS、Qwen3-ASR
图像生成模型 Qwen-Image
具身智能模型(VLA) Qwen-VLA
嵌入模型(Embedding) Qwen3-Embedding、Qwen3-VL-Embedding
MoE 模型 Qwen1.5-MoE-A2.7B、Qwen2-57B-A14B、Qwen3-235B-A22B、Qwen3.5-397B-A17B

六、参数规模对比一览

版本        参数规模(B = 十亿参数)
─────────────────────────────────────────────────────────────────────
Qwen v1     1.8B ─── 7B ─────── 14B ────────── 72B
Qwen1.5     0.5B ─ 1.8B ─ 4B ─ 7B ── 14B ─ 32B ─ 72B ─ 110B ─ MoE-A2.7B
Qwen2       0.5B ─ 1.5B ─────── 7B ──────────── 72B ─ MoE-57B-A14B
Qwen2.5     0.5B ─ 1.5B ─ 3B ─ 7B ── 14B ─ 32B ─ 72B
Qwen3       0.6B ─ 1.7B ─ 4B ─ 8B ── 14B ─ 32B ─── MoE-30B-A3B ─ MoE-235B-A22B
Qwen3.5     0.8B ─ 2B ─── 4B ─ 9B ── 27B ─── MoE-35B-A3B ─ MoE-122B-A10B ─ MoE-397B-A17B
Qwen3.6     ──────────────────── 27B ─── MoE-35B-A3B

七、注意事项

  1. Qwen2.5 的 MoE 模型(Turbo、Plus)为闭源 API 模型,不在开源范围内
  2. Qwen v1 的量化版(Int4/Int8)仅针对 Chat 模型提供
  3. Qwen3-2507 中 Thinking 和 Instruct 的分离,标志着从"统一模式切换"到"独立模型"的策略转变
  4. Qwen3.5 起,所有开源模型均采用 Apache 2.0 许可证
  5. Qwen3.5 的视觉-语言统一基座是重大架构突破——单一模型同时具备强文本和强视觉能力,无需分别训练
  6. Qwen3.6 目前仅发布两个尺寸(27B / 35B-A3B),更多尺寸可能后续补充

八、官方资源汇总

资源 链接
QwenLM GitHub 组织 https://github.com/QwenLM
HuggingFace 主页 https://huggingface.co/Qwen
ModelScope 主页 https://modelscope.cn/organization/qwen
Qwen Studio(在线体验) https://chat.qwen.ai/
Qwen 官方博客 https://qwen.ai/blog
Qwen Agent 框架 https://github.com/QwenLM/Qwen-Agent
Qwen Code(终端 AI Agent) https://github.com/QwenLM/qwen-code
Logo

免费领 150 小时云算力,进群参与显卡、AI PC 幸运抽奖

更多推荐