RzenEmbed: Towards Comprehensive Multimodal Retrieval
核心聚焦通用多模态检索嵌入模型的研发。针对现有方法局限于自然图像、对视频与视觉文档支持不足、训练过程受噪声与样本难度分布影响等问题,论文提出了统一的 RzenEmbed 框架,通过改进的对比学习目标与两阶段训练策略,实现了文本、图像、视频、视觉文档四大模态的高效嵌入学习,在 MMEB 基准数据集上取得 SOTA 性能,尤其在挑战性强的视频与视觉文档检索任务中表现突出。
一、研究背景与核心问题
1.1 研究动机
多模态检索旨在跨文本、图像、视频等异质数据类型寻找语义关联信息,是人工智能领域的基础任务。现有方法虽在图像 - 文本检索上取得进展,但存在显著局限:
- 模态覆盖片面:多数模型聚焦自然图像与文本,对视频(含时间动态特征)、视觉文档(含布局敏感语义)等复杂模态支持不足,泛化能力有限;
- 训练目标缺陷:标准 InfoNCE 损失易受假阴性样本(语义相似却被误判为负样本)与易样本主导(简单负样本占用大量学习资源)问题影响,导致嵌入判别力不足;
- 超参设置僵化:InfoNCE 的温度参数多为固定值,无法适配不同任务(如细粒度文档检索与粗粒度视频检索)的最优分布需求;
- 提示设计缺失:缺乏系统的文本提示策略,难以生成一致且紧凑的多模态嵌入表示。
1.2 核心问题
- 如何构建统一框架,实现文本、图像、视频、视觉文档四大模态的通用嵌入学习?
- 如何优化对比学习目标,缓解假阴性样本与样本难度分布不均对训练的负面影响?
- 如何通过自适应超参与提示设计,进一步提升模型在多样化任务中的鲁棒性与性能?
1.3 研究贡献
- 提出RzenEmbed 统一框架:采用两阶段训练策略,实现文本、图像、视频、视觉文档的 discriminative 嵌入学习,支持跨模态与单模态检索;
- 优化对比学习目标:引入假阴性样本缓解机制与难度加权策略,强化模型对挑战性样本的学习;
- 集成多维度优化技巧:融合任务特异性可学习温度参数、嵌入提示设计与模型融合(model souping),提升模型鲁棒性;
- 实现 SOTA 性能:在 MMEB 基准(含 V1 与 V2 版本)上取得最优整体分数,尤其在视频与视觉文档检索任务中超越所有现有方法。
二、RzenEmbed 核心方法
RzenEmbed 以 Qwen2-VL 为骨干模型,通过改进的对比学习目标、两阶段训练与多维度优化技巧,构建通用多模态嵌入空间,框架如图 1 所示。
2.1 模型架构
(1)骨干模型选择
选用 Qwen2-VL 作为基础模型,核心优势包括:
- 原生动态分辨率支持,高效处理不同尺寸的视觉输入;
- 多模态旋转位置编码(M-RoPE),同时适配静态图像与视频的时间特征建模;
- 强大的指令跟随能力,适配多任务场景。
(2)输入处理与嵌入提取
- 视觉输入:图像直接输入,视频按固定间隔采样帧序列,经视觉编码器与投影层转化为视觉 token;
- 文本输入:采用 “指令 + 文本” 结构,引导模型执行特定检索任务;
- 嵌入提取:LLM 联合编码视觉 token 与文本 token,从输入序列的最后一个 token(EOS)的隐藏状态中提取最终嵌入向量,作为多模态输入的统一表示。
2.2 改进的对比学习目标
基于 InfoNCE 损失进行两大关键改进,解决传统对比学习的核心痛点:
(1)假阴性样本缓解(False Negative Mitigation)
- 核心逻辑:识别并排除语义相似的假阴性样本,避免模型因惩罚合理相似性而误导学习;
- 实现方式:对每个查询 - 正样本对(q, k⁺),计算负样本 k⁻与正样本 k⁺的相似度,若超过预设阈值 δ(论文设为 0.95),则将该负样本从损失计算的分母中排除;
- 公式表达:sim(ki−,k+)>δ 时,ki− 被判定为假阴性样本,不参与损失计算。
(2)难度加权策略(Hardness-Weighted Strategy)
- 核心逻辑:对负样本按与查询的相似度加权,让模型更关注挑战性强的硬负样本;
- 权重计算:负样本权重 wi=exp(α⋅sim(q,ki−)),其中 α=9(控制加权强度),相似度越高的负样本权重越大;
- 改进损失函数:LWHNM=−logexp(sim(q,k+)/τ)+∑i=1Nwi⋅exp(sim(q,ki−)/τ)exp(sim(q,k+)/τ)该损失通过放大硬负样本的梯度贡献,引导模型学习细粒度语义区分。
2.3 两阶段训练策略
(1)第一阶段:多模态持续预训练(Multimodal Continual Training)
- 目标:建立基础的跨模态对齐能力,学习文本、图像、视频的统一嵌入空间;
- 数据类型:
- 单模态数据:文本 - 文本(T→T)对(来自 MSMARCO、NQ 等数据集),共 30 万条;
- 跨模态数据:文本 - 图像(T→I)对(来自 LAION-2B,含 CogVLM-19B 重描述数据)200 万条,文本 - 视频描述(T→VD)对 25 万条;
- 融合模态数据:图像 - 文本 - 图像(IT→I)对(来自 Megapairs 数据集)250 万条;
- 数据增强:对 LAION-2B 图像进行细粒度重描述,替换泛化标签(如 “a cat”→“an orange tabby cat basking in the sun”),提升语义对齐精度与数据去噪效果。
(2)第二阶段:微调(Fine-Tuning)
- 目标:提升模型对复杂任务与特殊场景的适配能力,强化指令跟随与检索性能;
- 数据构成:以 MMEB-V2 训练集为核心,补充多模态检索与 QA 数据集,按任务类型、输入模态、场景维度构建多样化指令数据;
- 关键处理:
- 合并图像分类数据集:解决单一分类数据集标签空间有限导致的假阴性样本过多问题;
- 增强视频数据:分割长视频为短片段(自然硬负样本)、引入 1-3 分钟长视频(强化长时依赖建模),提升视频检索难度;
- 批次采样策略:单一批次从单个数据集采样(分类数据集除外),集中硬负样本,提升对比学习效果。
2.4 多维度优化技巧
(1)任务特异性可学习温度参数
- 核心创新:为 7 类任务(图像分类、图像 QA、图像检索、图像接地、文档检索、视频检索、视频 QA)分别设置可学习温度参数 τₜ,而非固定全局温度;
- 实现方式:通过 τₜ=exp (θₜ) 确保参数 positivity,θₜ通过反向传播与模型其他参数联合优化;
- 核心价值:适配不同任务的相似度分布需求,如细粒度文档检索需要更尖锐的分布(小 τ),粗粒度视频检索需要更平滑的分布(大 τ)。
(2)嵌入提示设计(Embedding Prompt)
- 核心逻辑:通过系统提示与表示提示,引导生成式骨干模型适配判别式嵌入学习;
- 提示模板:
- 系统提示:“Given an image, summarize the provided image in one word. Given only text, describe the text in one word.”;
- 表示提示:纯文本查询用 “Represent the given text in one word.”,多模态查询用 “Represent the given image in one word.”;
- 输入结构:训练与推理时均采用 “<系统提示> < 查询 > < 表示提示 >” 格式,强制模型生成紧凑的判别式表示。
(3)模型融合(Model Souping)
- 核心逻辑:合并多个专用 LoRA 适配器的低秩权重矩阵,形成统一适配器,蒸馏互补知识;
- 实现方式:通过加权聚合策略整合多个 LoRA 适配器,再与预训练骨干模型融合;
- 核心价值:在不增加推理开销的前提下,提升模型稳定性与泛化能力。
三、实验设计与结果
3.1 实验设置
(1)训练配置
- 优化器:AdamW,学习率 2e-4,余弦学习率调度;
- 高效微调:对视觉编码器与 LLM 的所有线性层应用 LoRA(秩 = 64);
- 训练规模:第一阶段 500 万条数据,第二阶段含 MMEB-V2 训练集与补充数据,单轮训练;
- 硬件:16 张 NVIDIA A800(80GB)GPU,采用 bf16 混合精度训练与梯度检查点优化内存。
(2)评估基准
- MMEB-V1:包含分类、VQA、检索、接地 4 类元任务,共 36 个数据集,区分分布内(IND)与分布外(OOD)任务;
- MMEB-V2:扩展视频与视觉文档任务,共 78 个数据集,涵盖图像、视频、视觉文档三大模态的分类、QA、检索等任务。
(3)对比模型
涵盖编码器 - only 模型(CLIP、BLIP-2 等)、闭源模型(Seed-1.6-embedding)、基于 MLLM 的嵌入模型(VLM2Vec、UniME-V2、B3 等)。
3.2 核心实验结果
(1)MMEB-V1 基准结果
RzenEmbed 在 2B 与 7B 模型规模下均取得最优性能:
表格
| 模型规模 | 关键指标 | 分类 | VQA | 检索 | 接地 | 整体分数 |
|---|---|---|---|---|---|---|
| 2B(Qwen2-VL) | RzenEmbed | 68.5 | 66.3 | 74.5 | 90.3 | 72.3 |
| 2B(Qwen2-VL) | 最优对比模型(Ops-MM-embedding-v1) | 68.1 | 65.1 | 69.2 | 80.9 | 69.0 |
| 7B(Qwen2-VL) | RzenEmbed | 70.6 | 71.7 | 78.5 | 92.1 | 75.9 |
| 7B(Qwen2-VL) | 最优对比模型(Ops-MM-embedding-v1) | 69.7 | 69.6 | 73.1 | 87.2 | 72.7 |
关键发现:RzenEmbed 在所有元任务中均表现最优,尤其在接地任务(90.3/92.1)与检索任务(74.5/78.5)上优势显著,证明其判别式嵌入学习的有效性。
(2)MMEB-V2 基准结果
RzenEmbed 在多模态任务中全面领先,尤其在视频与视觉文档检索中突破现有性能:
表格
| 模型规模 | 模态 | 整体分数 | 视频任务整体 | 视觉文档任务整体 |
|---|---|---|---|---|
| 2B | RzenEmbed | 67.2 | 47.3 | 74.5 |
| 2B | 最优对比模型(Ops-MM-embedding-v1) | 63.4 | 45.8 | 74.4 |
| 7B | RzenEmbed | 71.6 | 55.7 | 77.1 |
| 7B | 闭源模型(Seed-1.6-embedding) | 71.3 | 53.5 | 73.4 |
关键发现:
- 7B 版本的 RzenEmbed 超越闭源模型 Seed-1.6-embedding,在视频与视觉文档任务上分别提升 2.2 与 3.7 个百分点;
- 2B 与 7B 版本分别比同规模最优对比模型提升 3.8 与 4.0 个百分点,验证模型架构与训练策略的有效性。
3.3 消融实验与关键分析
(1)消融实验(基于 MMEB 基准)
验证各核心组件的贡献,基线模型(标准 InfoNCE)整体分数为 65.7:
表格
| 实验配置 | 合并分类数据集 | 可学习温度 | 系统提示 | 数据集重采样 | 整体分数 | 图像任务 | 视频任务 | 视觉文档任务 |
|---|---|---|---|---|---|---|---|---|
| Exp1 | ✓ | ✗ | ✗ | ✗ | 66.3 | 71.0 | 45.3 | 75.0 |
| Exp2 | ✗ | ✓ | ✗ | ✗ | 66.4 | 71.5 | 44.0 | 75.3 |
| Exp3 | ✗ | ✗ | ✓ | ✗ | 66.4 | 71.3 | 45.0 | 75.0 |
| Exp4 | ✓ | ✓ | ✓ | ✗ | 66.7 | 71.6 | 45.8 | 75.0 |
| Exp5 | ✓ | ✓ | ✓ | ✓ | 67.2 | 72.3 | 47.3 | 74.5 |
关键结论:
- 所有组件均能独立提升性能,其中数据集重采样(平衡任务学习动态)与可学习温度的贡献最显著;
- 多组件融合后达到最优性能,证明各优化方向的互补性。
(2)模型融合(Model Souping)效果
合并多个 LoRA 适配器后,模型性能进一步提升:
表格
| 融合方式 | 整体分数 | 图像任务整体 | 视频任务整体 | 视觉文档任务整体 |
|---|---|---|---|---|
| Mix 1 | 71.11 | 75.78 | 54.16 | 76.83 |
| Mix 2 | 71.16 | 75.64 | 54.59 | 76.86 |
| Mix 3 | 71.18 | 75.43 | 55.09 | 76.88 |
| Souped | 71.61 | 75.92 | 55.73 | 77.06 |
关键发现:模型融合后整体分数提升至 71.61,视频任务提升最显著(+1.57),证明多适配器知识蒸馏的有效性。
四、相关工作对比
表格
| 研究方向 | 代表工作 | 核心差异 |
|---|---|---|
| 传统多模态嵌入 | CLIP、SigLIP | 仅支持图像 - 文本,不支持视频与视觉文档,无指令跟随能力 |
| MLLM 适配嵌入 | VLM2Vec、UniME-V2 | 缺乏假阴性缓解与难度加权策略,未针对视频 / 视觉文档优化 |
| 数据合成驱动 | MegaPairs、mmE5 | 依赖数据合成提升性能,未优化对比学习目标本身 |
| 硬负样本挖掘 | B3、LLaVE | 仅聚焦硬负样本挖掘,未整合假阴性缓解、可学习温度等多维度优化 |
| 本研究(RzenEmbed) | - | 统一支持四大模态,融合对比学习优化、可学习温度、提示设计与模型融合,全面提升性能与鲁棒性 |
五、局限性与未来方向
5.1 局限性
- 视频处理开销:视频帧采样与编码导致推理 latency 高于图像检索,需优化效率;
- 长视频建模不足:对超过 3 分钟的超长视频,时间依赖建模能力仍有提升空间;
- 多语言支持有限:当前主要基于英文数据训练,多语言场景的泛化性需验证。
5.2 未来方向
- 效率优化:探索视频帧的稀疏采样与轻量化编码,降低推理开销;
- 长视频建模:引入更高效的时间建模机制(如稀疏注意力),适配超长视频检索;
- 多语言扩展:构建多语言多模态训练数据,提升跨语言检索性能;
- 下游应用适配:针对 RAG、多模态推荐等场景优化嵌入模型,提升实用价值。
六、结论
RzenEmbed 通过统一框架、改进的对比学习目标与多维度优化技巧,实现了文本、图像、视频、视觉文档的通用嵌入学习。其核心创新在于:通过假阴性缓解与难度加权策略优化对比学习,用可学习温度参数适配多样化任务,结合嵌入提示与模型融合提升鲁棒性。实验证明,RzenEmbed 在 MMEB 基准上取得 SOTA 性能,尤其在视频与视觉文档等挑战性任务中表现突出,为多模态检索系统的实用化提供了关键技术支撑。
更多推荐
所有评论(0)