Qwen3模型技术架构演进的趋势
Qwen3技术改进点:
1)Qwen3引入了几个关键改进,以增强其功能和可用性。首先,它将两种截然不同的操作模式,即思维模式和非思维模式整合到一个模型中。这允许用户在这些模式之间切换,而无需在不同的模型之间交替,例如从Qwen2.5切换到QwQ 。这种灵活性确保开发人员和用户可以有效地调整模型的行为以适应特定任务。此外,Qwen3结合了预算思维,为用户提供了对模型在任务执行期间应用的推理努力水平的细粒度控制。这种能力对于优化计算资源和性能、优化模型的思维行为以满足实际应用中不同的复杂性至关重要。此外,Qwen3已经预先训练了36万亿个tokens,涵盖多达119种语言和方言,有效地增强了其多语言能力。这种扩展的语言支持增强了其在全球用例和国际应用程序中部署的潜力。这些进步共同使Qwen3成为一个先进的开源大型语言模型家族,能够有效地处理跨不同领域和语言的复杂任务。
三个学习过程
预培训过程遵循三阶段策略。
在第一阶段,该模型在大约30万亿个令牌上进行训练,以建立一个强大的常识基础。
在第二阶段,它进一步接受知识密集型数据的培训,以提高科学、技术、工程、数学 (词干) 和编码等领域的推理能力。
在第三阶段,模型在长上下文数据上进行训练,以将其最大上下文长度从4,096个token增加到32,768个。
模型架构
Qwen3密集模型的架构类似于Qwen2.5,包括使用Grouped Query Attention (GQA), SwiGLU , Rotary Positional Embeddings (RoPE),和 RMSNorm 与预归一化。此外,我们删除了Qwen2中使用的QKV-偏差 ,并将qk-norm 引入到注意力机制中,以确保qwen3的稳定训练。有关模型架构的关键信息。
Qwen3模型与Qwen3 dense模型共享相同的基础架构。关于模型架构的关键信息如表2所示。我们遵循Qwen2.5-MoE 并实现细粒度专家分段 。Qwen3 MoE模型共有128位专家,每个令牌有8位激活的专家。与Qwen2.5-MoE不同,Qwen3-MoE设计不包括共享专家。此外,我们采用全球批量负载均衡损失 来鼓励专家专业化。这些架构和培训创新大大提高了下游任务的模型性能。
qwen3 MoE基础模型仅使用1/5的激活参数就可以实现与Qwen3 dense基础模型相似的性能。
Qwen2.5-32B-Base,其激活参数是Qwen3-30B-A3B的11倍,是Qwen3-14B的两倍以上
后训练策略

后训练有两个核心目标:
1)思维控制:涉及两种不同模式的集成,即“非思考”和“思考”模式,为用户提供选择模型是否进行推理以及通过指定令牌预算来控制思考深度的灵活性。
2)强到弱蒸馏:旨在简化和优化轻量级模型的后训练过程。通过利用大型模型的知识,我们大大减少了构建小型模型所需的计算成本和开发工作。
Long-CoT Cold Start:
1)构建数学, 逻辑,代码等测试样例, 并给出标准答案
2)查询过滤阶段,我们使用Qwen2.5-72b-指令来识别和删除不易验证的查询。这包括包含多个子问题或要求一般文本生成的查询。此外,我们排除了Qwen2.5-72b-指令可以在不使用CoT推理的情况下正确回答的查询。这有助于防止模型依赖于表面猜测
3)使用QwQ-32B为每个剩余的查询生成N个候选响应 。当QwQ-32B始终无法生成正确的解决方案时,人类注释者会手动评估响应的准确性。
思维模式融合
将“非思考”能力整合到之前开发的“思考”模型中。
结果: Qwen3-32B,在大多数基准测试中都优于我们之前最强的推理模型,QwQ-32B,并且与闭源OpenAI-o3-mini表现相当,表明其强大的推理能力。Qwen3-32B在非思考模式下也表现出色,并超越了我们之前的旗舰非推理密集模型,Qwen2.5-72B-Instruct。
方法: SFT数据集结合了 “有思维” 和 “没有思维” 的数据。
为了更好地整合这两种模式,并使用户能够动态切换模型的思维过程,我们为Qwen3设计了聊天模板。我们分别在用户查询或系统消息中引入/思考和/no思考标志。这允许模型跟随用户的输入并相应地选择适当的思维模式。对于非思维模式的样本,我们在助手的响应中保留了一个空的思维块。
强到弱的蒸馏
强到弱蒸馏管道专门设计用于优化轻量级模型,可通过5个密集模型 (Qwen3-0.6B,1.7b,4B,8B和14B) 和一个MoE模型 (Qwen3-30B-A3B)。这种方法增强了模型性能,同时有效地赋予了强大的模式切换能力。蒸馏过程分为两个主要阶段:
1)离策略蒸馏:在初始阶段,我们结合使用think和no think模式生成的教师模型输出进行响应蒸馏。这有助于轻量级学生模型发展基本推理技能以及切换不同思考模式的能力,并为接下来的on-policy训练阶段奠定坚实基础。
2)策略蒸馏:在这一阶段,学生模型生成用于微调的策略序列。具体来说,采样提示,并且学生模型以思考或不思考模式产生响应。然后通过将学生的逻辑与教师模型(Qwen3-32B 或 Qwen3-235B-A22B)的逻辑对齐来最小化KL散度来进行微调。
模型能力评估
1)只有60% 的激活参数和35% 的总参数,Qwen3-235B-A22B (思考) 在17/23的基准测试中表现DeepSeek-R1,特别是在推理要求的任务上。
2)蒸馏学习比强化学习具有显著更好的性能,而只需要大约1/10的GPU时间。此外,从教师logits中进行的蒸馏使学生模型能够扩大其探索空间并增强其推理潜力,如蒸馏后在aime'24和aime'25基准上改进的pass @ 64分数所证明的那样。与最初的检查点相比。相比之下,强化学习不会导致通过 @ 64分数的任何改善。这些观察突出了利用更强大的教师模式指导学生模型学习的优势
更多推荐



所有评论(0)