在这里插入图片描述

结构性简读:https://blog.csdn.net/weixin_42990464/article/details/158649495
全文翻译:Qwen-Image Technical Report
公开时间:2025年8月4日
论文地址:https://arxiv.org/abs/2508.02324

Qwen-Image是一个双流的MMDIT结构的扩散模型,核心两大优势:复杂文本渲染能力强、图像编辑精准度高。在多项权威评测基准上斩获最优成绩,整体图像生成、图像编辑综合实力突出。Qwen-Image 作为 FireRed 与 Qwen Image 2 的基础版本,深入理解其技术细节具有重要的参考价值。
在这里插入图片描述

1. 数据策略

1.1 基本概述

  1. 数据层:搭建完整闭环数据管线,涵盖海量数据收集、过滤、人工标注、数据合成、样本均衡调配全流程;
  2. 训练策略:采用渐进式课程学习训练
    训练递进顺序:无文本图像渲染 → 简单文字渲染 → 复杂文字渲染 → 段落级图文生成;
    价值:原生文字生成能力大幅提升;
  3. 语言适配效果:英文字母类语言表现优异,对中文这类表意复杂文字渲染效果突破明显。

1.2 数据分布

收集了10亿对数据,主要涉及四个主要领域:自然类(Nature)、设计类(Design)、人物类(People)和合成数据类(Synthetic Data)
在这里插入图片描述

1.3 数据过滤流程

训练过程中逐步应用数据过滤,随着训练推进持续优化数据质量。在第四阶段引入合成数据,此时基础模型已经达到一定的稳定性,具体流程说明如下:

  1. 初始数据筛选:剔除破损、低分辨率、重复、违规不安全素材

  2. 画质优化:依据清晰度、光影、熵值等指标,淘汰模糊、过曝、信息匮乏图片
    在这里插入图片描述

  3. 提升图文匹配:借助CLIP筛选契合度高的图文对;搭配三类标题数据,兼顾知识属性与画面描述性

  4. 强化文字生成能力:数据集划分为中英、其他语种、无文本四类,依靠数据合成攻克小众字符长尾难题

  5. 高分辨率提纯:开启640p训练阶段,去除带水印、二维码、观感较差的图像

  6. 均衡品类+优化人像数据:定位人像等薄弱类目,检索增补素材,搭配精细化人脸、表情、背景描述文案

  7. 多尺度均衡训练:640p、1328p双分辨率协同训练;为图像分类,并保留每个类别中质量与美学最佳的图像,同时对包含文字渲染的数据进行重采样,以应对长尾分布问题。
    在这里插入图片描述

1.4 文字渲染增强

现实图像文字呈现长尾分布,中文等表意文字生僻字符使用率极低;仅依靠天然图文数据,模型无法充分学习罕见字符,文本渲染场景泛化性差。为此搭建三阶段文本感知图像合成框架补足数据缺陷。整套合成体系解决天然数据集文字稀缺、分布不均衡问题;覆盖简单纯色、实景日常、专业结构化排版三类场景,产出多元完备训练数据,大幅提升模型各类场景文本渲染鲁棒性,可精准遵循用户复杂文字生成指令输出高质量图像。
在这里插入图片描述

2. 训练策略

基于 流匹配(flow matching) 训练目标来预训练 Qwen-Image
在这里插入图片描述

多任务联合训练范式
融合三类任务:文生图(T2I)、图文转图(TI2I)、图生图(I2I)图像重建;
作用:对齐 Qwen2.5-VL 视觉语言模型与 MMDiT 扩散模型的隐空间表征;
双编码机制
原图通过两路输入编码:

  • 送入 Qwen2.5-VL:提取全局语义表征;
  • 送入 VAE 变分自编码器:提取视觉重建表征。
    价值:在编辑画面时兼顾语义不变性视觉画质保真度

2.1 生产者–消费者(Producer–Consumer)框架

借鉴Ray架构搭建生产者-消费者框架,拆分数据预处理、模型训练两大环节,二者异步运行;可动态迭代数据流程(这应该就是为什么在7个训练阶段中,每一个阶段的数据都都参与训练),无需暂停模型训练。
在这里插入图片描述
在后续的的模型应用中,可以参考这种动态架构,模型一直保持训练,训练数据集在线实时更新。也可以在特定epoch时,进行热切换。

2.2 分布式架构

Qwen-Image 参数量巨大,仅依靠 FSDP 无法将完整模型载入单卡 GPU,因此基于 Megatron-LM 框架搭建训练体系,并配套多项显存与并行优化方案。
在这里插入图片描述

2.3 训练策略

多阶段渐进式预训练策略,从分辨率、文本学习、数据品质、样本分布、数据来源五个维度循序渐进训练,持续迭代优化模型生成效果与泛化能力。
在这里插入图片描述

2.4 后训练与强化学习

先进行了(SFT),搭建了按语义类别分层梳理的数据集,并通过精细化人工标注,针对性弥补模型现存缺陷。要求入选图像画面清晰、细节丰富、光影明亮且具备写实质感,以此引导模型生成更具真实感、细节更细腻的内容

采用了两种不同的强化学习(RL)策略:直接偏好优化(DPO)(Rafailov等人,2023)和群体相对策略优化(GRPO)。DPO擅长于流匹配(一步)在线偏好建模,且计算效率高,而GRPO在训练过程中执行策略内采样,并使用奖励模型评估每条轨迹。为了利用离线偏好学习的可扩展性优势,**使用DPO进行相对大规模的RL,并将GRPO保留用于小粒度的RL细化。**两种算法的详细信息如下。

强化学习部分,DPO处理如下(使用了两类数据),原文 https://zhuanlan.zhihu.com/p/1937855646893610634请查阅

强化学习部分,GRPO处理如下,原文 https://zhuanlan.zhihu.com/p/1937855646893610634
在这里插入图片描述

3、算法分析

3.1 TI2I扩展

Qwen-Image在文生图(T2I)基础能力之上,拓展了图文多模态生成任务,涵盖指令式图像编辑、新视角合成、深度估计等计算机视觉任务,统一归为通用图像编辑任务范畴。

依托Qwen2.5-VL能力,模型原生兼容图像+文本双输入:通过视觉变换器(ViT)提取图像视觉补丁并编码,与文本标记拼接构成完整输入序列;同时将图像、文本指令同步输入MMDiT文本流,并配置专属系统提示词规范输入逻辑。

在这里插入图片描述

额外引入VAE图像隐表征,将其与带噪声的图像隐变量按序列维度拼接输入图像流,有效保留人物、场景的结构一致性。首先,系统提示词+用户图片+用户指令输入qwen2.5-vl大幅提升模型的指令跟随能力),同时将用户图片vae(强化图像视觉保真度、结构稳定性,完美贴合原图特征)与 target 加噪凭借在一起输入dit。

为了区分多个输入图像,扩展MSRoPE机制,在原有图像高、宽定位维度基础上,新增帧维度,支撑模型精准区分多幅输入图像。这表明qwen-image eidt编辑训练后的模型,rope与原版差异较大。eidt模型可以退化为t2i模型,t2i模型进化为ti2i模型要重新适应rope与qwen-vl编码特征的变化。
在这里插入图片描述

3.2 VAE 重建性能

根据参数分析,推断qwen-image vae架构与wan 2.1 vae高度一致,只是针对单帧的图像场景进行加强训练,重点补充了大量的文字图片数据,保障了qwen image的文字渲染效果
在这里插入图片描述
在这里插入图片描述

3.3 增强思考

如果是基于 Qwen-Image 进行业务效果增强,首先要明确基础模型最大只训练到 1328p,可能需要扩展分辨率;其次要认识到,基模训练的数据集分布存在局限,除了补充指定数据进行加强训练外,还可以从以下两个方向着手:

首先,可以在文本编码器 Qwen2.5-VL 上迭代。该模型版本较早,对于结构性要求(如计数、方位、结构等),文本编码特征可能差异较小,导致无法生成预期图像。

其次,在 VAE 方面,需要验证业务数据通过 VAE 编解码后的压缩性能差异,评估是否需要对 VAE 模型进行针对性微调。

更多推荐