核心聚焦通用多模态检索嵌入模型的研发。针对现有方法局限于自然图像、对视频与视觉文档支持不足、训练过程受噪声与样本难度分布影响等问题,论文提出了统一的 RzenEmbed 框架,通过改进的对比学习目标与两阶段训练策略,实现了文本、图像、视频、视觉文档四大模态的高效嵌入学习,在 MMEB 基准数据集上取得 SOTA 性能,尤其在挑战性强的视频与视觉文档检索任务中表现突出。

一、研究背景与核心问题

1.1 研究动机

多模态检索旨在跨文本、图像、视频等异质数据类型寻找语义关联信息,是人工智能领域的基础任务。现有方法虽在图像 - 文本检索上取得进展,但存在显著局限:

  • 模态覆盖片面:多数模型聚焦自然图像与文本,对视频(含时间动态特征)、视觉文档(含布局敏感语义)等复杂模态支持不足,泛化能力有限;
  • 训练目标缺陷:标准 InfoNCE 损失易受假阴性样本(语义相似却被误判为负样本)与易样本主导(简单负样本占用大量学习资源)问题影响,导致嵌入判别力不足;
  • 超参设置僵化:InfoNCE 的温度参数多为固定值,无法适配不同任务(如细粒度文档检索与粗粒度视频检索)的最优分布需求;
  • 提示设计缺失:缺乏系统的文本提示策略,难以生成一致且紧凑的多模态嵌入表示。

1.2 核心问题

  • 如何构建统一框架,实现文本、图像、视频、视觉文档四大模态的通用嵌入学习?
  • 如何优化对比学习目标,缓解假阴性样本与样本难度分布不均对训练的负面影响?
  • 如何通过自适应超参与提示设计,进一步提升模型在多样化任务中的鲁棒性与性能?

1.3 研究贡献

  1. 提出RzenEmbed 统一框架:采用两阶段训练策略,实现文本、图像、视频、视觉文档的 discriminative 嵌入学习,支持跨模态与单模态检索;
  2. 优化对比学习目标:引入假阴性样本缓解机制与难度加权策略,强化模型对挑战性样本的学习;
  3. 集成多维度优化技巧:融合任务特异性可学习温度参数、嵌入提示设计与模型融合(model souping),提升模型鲁棒性;
  4. 实现 SOTA 性能:在 MMEB 基准(含 V1 与 V2 版本)上取得最优整体分数,尤其在视频与视觉文档检索任务中超越所有现有方法。

二、RzenEmbed 核心方法

RzenEmbed 以 Qwen2-VL 为骨干模型,通过改进的对比学习目标、两阶段训练与多维度优化技巧,构建通用多模态嵌入空间,框架如图 1 所示。

2.1 模型架构

(1)骨干模型选择

选用 Qwen2-VL 作为基础模型,核心优势包括:

  • 原生动态分辨率支持,高效处理不同尺寸的视觉输入;
  • 多模态旋转位置编码(M-RoPE),同时适配静态图像与视频的时间特征建模;
  • 强大的指令跟随能力,适配多任务场景。
(2)输入处理与嵌入提取
  • 视觉输入:图像直接输入,视频按固定间隔采样帧序列,经视觉编码器与投影层转化为视觉 token;
  • 文本输入:采用 “指令 + 文本” 结构,引导模型执行特定检索任务;
  • 嵌入提取:LLM 联合编码视觉 token 与文本 token,从输入序列的最后一个 token(EOS)的隐藏状态中提取最终嵌入向量,作为多模态输入的统一表示。

2.2 改进的对比学习目标

基于 InfoNCE 损失进行两大关键改进,解决传统对比学习的核心痛点:

(1)假阴性样本缓解(False Negative Mitigation)
  • 核心逻辑:识别并排除语义相似的假阴性样本,避免模型因惩罚合理相似性而误导学习;
  • 实现方式:对每个查询 - 正样本对(q, k⁺),计算负样本 k⁻与正样本 k⁺的相似度,若超过预设阈值 δ(论文设为 0.95),则将该负样本从损失计算的分母中排除;
  • 公式表达:sim(ki−​,k+)>δ 时,ki−​ 被判定为假阴性样本,不参与损失计算。
(2)难度加权策略(Hardness-Weighted Strategy)
  • 核心逻辑:对负样本按与查询的相似度加权,让模型更关注挑战性强的硬负样本;
  • 权重计算:负样本权重 wi​=exp(α⋅sim(q,ki−​)),其中 α=9(控制加权强度),相似度越高的负样本权重越大;
  • 改进损失函数:LWHNM​=−logexp(sim(q,k+)/τ)+∑i=1N​wi​⋅exp(sim(q,ki−​)/τ)exp(sim(q,k+)/τ)​该损失通过放大硬负样本的梯度贡献,引导模型学习细粒度语义区分。

2.3 两阶段训练策略

(1)第一阶段:多模态持续预训练(Multimodal Continual Training)
  • 目标:建立基础的跨模态对齐能力,学习文本、图像、视频的统一嵌入空间;
  • 数据类型:
    • 单模态数据:文本 - 文本(T→T)对(来自 MSMARCO、NQ 等数据集),共 30 万条;
    • 跨模态数据:文本 - 图像(T→I)对(来自 LAION-2B,含 CogVLM-19B 重描述数据)200 万条,文本 - 视频描述(T→VD)对 25 万条;
    • 融合模态数据:图像 - 文本 - 图像(IT→I)对(来自 Megapairs 数据集)250 万条;
  • 数据增强:对 LAION-2B 图像进行细粒度重描述,替换泛化标签(如 “a cat”→“an orange tabby cat basking in the sun”),提升语义对齐精度与数据去噪效果。
(2)第二阶段:微调(Fine-Tuning)
  • 目标:提升模型对复杂任务与特殊场景的适配能力,强化指令跟随与检索性能;
  • 数据构成:以 MMEB-V2 训练集为核心,补充多模态检索与 QA 数据集,按任务类型、输入模态、场景维度构建多样化指令数据;
  • 关键处理:
    • 合并图像分类数据集:解决单一分类数据集标签空间有限导致的假阴性样本过多问题;
    • 增强视频数据:分割长视频为短片段(自然硬负样本)、引入 1-3 分钟长视频(强化长时依赖建模),提升视频检索难度;
    • 批次采样策略:单一批次从单个数据集采样(分类数据集除外),集中硬负样本,提升对比学习效果。

2.4 多维度优化技巧

(1)任务特异性可学习温度参数
  • 核心创新:为 7 类任务(图像分类、图像 QA、图像检索、图像接地、文档检索、视频检索、视频 QA)分别设置可学习温度参数 τₜ,而非固定全局温度;
  • 实现方式:通过 τₜ=exp (θₜ) 确保参数 positivity,θₜ通过反向传播与模型其他参数联合优化;
  • 核心价值:适配不同任务的相似度分布需求,如细粒度文档检索需要更尖锐的分布(小 τ),粗粒度视频检索需要更平滑的分布(大 τ)。
(2)嵌入提示设计(Embedding Prompt)
  • 核心逻辑:通过系统提示与表示提示,引导生成式骨干模型适配判别式嵌入学习;
  • 提示模板:
    • 系统提示:“Given an image, summarize the provided image in one word. Given only text, describe the text in one word.”;
    • 表示提示:纯文本查询用 “Represent the given text in one word.”,多模态查询用 “Represent the given image in one word.”;
  • 输入结构:训练与推理时均采用 “<系统提示> < 查询 > < 表示提示 >” 格式,强制模型生成紧凑的判别式表示。
(3)模型融合(Model Souping)
  • 核心逻辑:合并多个专用 LoRA 适配器的低秩权重矩阵,形成统一适配器,蒸馏互补知识;
  • 实现方式:通过加权聚合策略整合多个 LoRA 适配器,再与预训练骨干模型融合;
  • 核心价值:在不增加推理开销的前提下,提升模型稳定性与泛化能力。

三、实验设计与结果

3.1 实验设置

(1)训练配置
  • 优化器:AdamW,学习率 2e-4,余弦学习率调度;
  • 高效微调:对视觉编码器与 LLM 的所有线性层应用 LoRA(秩 = 64);
  • 训练规模:第一阶段 500 万条数据,第二阶段含 MMEB-V2 训练集与补充数据,单轮训练;
  • 硬件:16 张 NVIDIA A800(80GB)GPU,采用 bf16 混合精度训练与梯度检查点优化内存。
(2)评估基准
  • MMEB-V1:包含分类、VQA、检索、接地 4 类元任务,共 36 个数据集,区分分布内(IND)与分布外(OOD)任务;
  • MMEB-V2:扩展视频与视觉文档任务,共 78 个数据集,涵盖图像、视频、视觉文档三大模态的分类、QA、检索等任务。
(3)对比模型

涵盖编码器 - only 模型(CLIP、BLIP-2 等)、闭源模型(Seed-1.6-embedding)、基于 MLLM 的嵌入模型(VLM2Vec、UniME-V2、B3 等)。

3.2 核心实验结果

(1)MMEB-V1 基准结果

RzenEmbed 在 2B 与 7B 模型规模下均取得最优性能:

表格

模型规模 关键指标 分类 VQA 检索 接地 整体分数
2B(Qwen2-VL) RzenEmbed 68.5 66.3 74.5 90.3 72.3
2B(Qwen2-VL) 最优对比模型(Ops-MM-embedding-v1) 68.1 65.1 69.2 80.9 69.0
7B(Qwen2-VL) RzenEmbed 70.6 71.7 78.5 92.1 75.9
7B(Qwen2-VL) 最优对比模型(Ops-MM-embedding-v1) 69.7 69.6 73.1 87.2 72.7

关键发现:RzenEmbed 在所有元任务中均表现最优,尤其在接地任务(90.3/92.1)与检索任务(74.5/78.5)上优势显著,证明其判别式嵌入学习的有效性。

(2)MMEB-V2 基准结果

RzenEmbed 在多模态任务中全面领先,尤其在视频与视觉文档检索中突破现有性能:

表格

模型规模 模态 整体分数 视频任务整体 视觉文档任务整体
2B RzenEmbed 67.2 47.3 74.5
2B 最优对比模型(Ops-MM-embedding-v1) 63.4 45.8 74.4
7B RzenEmbed 71.6 55.7 77.1
7B 闭源模型(Seed-1.6-embedding) 71.3 53.5 73.4

关键发现:

  • 7B 版本的 RzenEmbed 超越闭源模型 Seed-1.6-embedding,在视频与视觉文档任务上分别提升 2.2 与 3.7 个百分点;
  • 2B 与 7B 版本分别比同规模最优对比模型提升 3.8 与 4.0 个百分点,验证模型架构与训练策略的有效性。

3.3 消融实验与关键分析

(1)消融实验(基于 MMEB 基准)

验证各核心组件的贡献,基线模型(标准 InfoNCE)整体分数为 65.7:

表格

实验配置 合并分类数据集 可学习温度 系统提示 数据集重采样 整体分数 图像任务 视频任务 视觉文档任务
Exp1 66.3 71.0 45.3 75.0
Exp2 66.4 71.5 44.0 75.3
Exp3 66.4 71.3 45.0 75.0
Exp4 66.7 71.6 45.8 75.0
Exp5 67.2 72.3 47.3 74.5

关键结论:

  • 所有组件均能独立提升性能,其中数据集重采样(平衡任务学习动态)与可学习温度的贡献最显著;
  • 多组件融合后达到最优性能,证明各优化方向的互补性。
(2)模型融合(Model Souping)效果

合并多个 LoRA 适配器后,模型性能进一步提升:

表格

融合方式 整体分数 图像任务整体 视频任务整体 视觉文档任务整体
Mix 1 71.11 75.78 54.16 76.83
Mix 2 71.16 75.64 54.59 76.86
Mix 3 71.18 75.43 55.09 76.88
Souped 71.61 75.92 55.73 77.06

关键发现:模型融合后整体分数提升至 71.61,视频任务提升最显著(+1.57),证明多适配器知识蒸馏的有效性。

四、相关工作对比

表格

研究方向 代表工作 核心差异
传统多模态嵌入 CLIP、SigLIP 仅支持图像 - 文本,不支持视频与视觉文档,无指令跟随能力
MLLM 适配嵌入 VLM2Vec、UniME-V2 缺乏假阴性缓解与难度加权策略,未针对视频 / 视觉文档优化
数据合成驱动 MegaPairs、mmE5 依赖数据合成提升性能,未优化对比学习目标本身
硬负样本挖掘 B3、LLaVE 仅聚焦硬负样本挖掘,未整合假阴性缓解、可学习温度等多维度优化
本研究(RzenEmbed) - 统一支持四大模态,融合对比学习优化、可学习温度、提示设计与模型融合,全面提升性能与鲁棒性

五、局限性与未来方向

5.1 局限性

  1. 视频处理开销:视频帧采样与编码导致推理 latency 高于图像检索,需优化效率;
  2. 长视频建模不足:对超过 3 分钟的超长视频,时间依赖建模能力仍有提升空间;
  3. 多语言支持有限:当前主要基于英文数据训练,多语言场景的泛化性需验证。

5.2 未来方向

  1. 效率优化:探索视频帧的稀疏采样与轻量化编码,降低推理开销;
  2. 长视频建模:引入更高效的时间建模机制(如稀疏注意力),适配超长视频检索;
  3. 多语言扩展:构建多语言多模态训练数据,提升跨语言检索性能;
  4. 下游应用适配:针对 RAG、多模态推荐等场景优化嵌入模型,提升实用价值。

六、结论

RzenEmbed 通过统一框架、改进的对比学习目标与多维度优化技巧,实现了文本、图像、视频、视觉文档的通用嵌入学习。其核心创新在于:通过假阴性缓解与难度加权策略优化对比学习,用可学习温度参数适配多样化任务,结合嵌入提示与模型融合提升鲁棒性。实验证明,RzenEmbed 在 MMEB 基准上取得 SOTA 性能,尤其在视频与视觉文档等挑战性任务中表现突出,为多模态检索系统的实用化提供了关键技术支撑。

更多推荐