本文整理自 QCon 北京 2026《张延钊 - 昆3VR多模态向量模型技术解析》,通过AI音视频转录总结工具 Ai好记 视频转文字整理,以下为精炼整理后的会议笔记内容。

在这里插入图片描述

当检索的对象从纯文本扩展到图片、视频、PDF 富文本,传统的向量化方案就开始吃力了。

张延钊在 QCon 北京 2026 的分享,解析了通义千问团队基于 Qwen3-VL 多模态大模型构建统一表征与排序模型的做法。

它能在文本、图像、视频等多模态检索任务上做到 SOTA,背后的训练方法论和效率优化尤其值得借鉴。这篇把核心内容整理成一份完整笔记。


一、模型定位:为什么是 MLLM 而不是 CLIP

这套模型叫 Qwen3-VL-Embedding & Rank,是基于多模态大模型(MLLM)的统一向量表征模型。

在这里插入图片描述

它的核心优势,恰恰来自和传统 CLIP 架构的差异:

  • CLIP 是分开编码文本和图像,没法处理图文混合输入;
  • Qwen3-VL-Embedding 像大语言模型一样,通过一个统一编码器处理任意模态组合的输入;
  • 对富文本图片(比如 PDF)的理解能力更强;
  • 能利用大模型预训练的强大语义理解能力,用更少的数据高效训练。

一句话概括:传统方案是把各模态分开处理再拼起来,这套方案是让一个模型原生地理解多模态混合输入。

在这里插入图片描述


二、训练方法:对比学习 + 多阶段训练

模型的训练核心是对比学习。它的关键不是模型结构本身,而是数据质量。整套训练依赖高质量的三元组数据:(查询,正样本,难负样本)

训练过程分多个阶段,逐步推进:

  1. 基础能力训练:先把模型的基础表征能力打牢;
  2. 任务特定优化:针对分类、检索等具体任务做定向训练;
  3. 模型蒸馏与融合:用一个更强模型的输出作为监督,训练出更高效的学生模型。

在这里插入图片描述
在这里插入图片描述
在这里插入图片描述


三、数据构建:约 3 亿三元组怎么来

训练数据规模大约 3 亿三元组,靠大规模合成与严格筛选获得。演讲里强调了两点:

  • 质量过滤与类别均衡:原始多模态数据要先过滤、均衡,保证数据多样性;
  • 任务定制的合成筛选 pipeline:针对不同下游任务(分类、检索)设计专门的合成与筛选流程。

其中「难负样本」的构建尤其重要,这是提升模型细粒度语义理解的关键。如果负样本和查询完全不相关,模型太容易区分,根本学不到深层语义。团队的做法是:

  1. 合成看似相关、实际无关的样本,比如「北医三院」对「北京大学医学部」这种容易混淆的组合;
  2. 用多轮筛选:用模型检索候选池,过滤掉检索不到或太容易的样本;
  3. 保留难度适中的样本,并用迭代训练后的模型验证「难」样本是不是真的难。

四、应用场景:RAG 里的两个角色

这套模型覆盖的应用很广:纯文本、图像、视频、富文本(PDF)多种模态的任意组合输入与检索,可用在知识库问答、图像视频分类与检索、跨模态搜索等场景。

在 RAG 流程里,Embedding 和 Reranker 是分工协作的:

角色 职责 特点
Embedding 模型 初步召回,把文档编码成向量快速检索 效率高,适合大规模粗筛
Reranker 模型 精排,拼接查询和候选文档直接打分 精度高,但计算成本大

两者级联:先用 Embedding 粗筛出百级候选,再用 Reranker 精排出十级最优,最后交给大模型生成答案。

这里还提到一个对处理富文本特别有用的点:多模态模型可以直接把 PDF 每一页作为图像编码成向量,完整保留版面、结构、图表、字体等视觉信息,检索时端到端语义匹配,省掉了传统方案里先 OCR 再文本检索的环节,在格式复杂、图文并茂的文档上效果提升明显。


五、部署优化:三个层次平衡效果与成本

效果再好,部署成本太高也不行。演讲给了三个层次的优化手段:

  1. 维度截断:减少向量维度(比如 2048 截到 512),存储成本线性下降,效果损失可控;
  2. 表征量化:把 Float32 高精度浮点转成 INT8 / INT4 整数,大幅压缩存储,比如 INT8 可省到约 1/16;
  3. 输入压缩:对图像动态降分辨率(4K 降到 1K),对视频提高帧率、降低单帧分辨率,以更少的计算 token 换可接受的效果损失。

三者叠加,实际部署的存储和算力成本能大幅下降。


六、未来方向

团队规划的下一步方向也很有信息量:

  • 扩展支持音频等更多模态,走向真正的全模态统一;
  • 深耕垂直领域,比如自动驾驶、医疗影像;
  • 探索面向 AI Agent 使用习惯的检索模型训练新范式。

在这里插入图片描述


落地思考

对做检索、知识库、多模态应用的团队来说,这套分享最有价值的是三条:

  1. 数据比模型结构更关键:高质量难负样本的构造,直接决定模型学到多深。
  2. Embedding 与 Reranker 级联是 RAG 的标配打法:粗召回 + 精排,成本和精度都要兼顾。
  3. 效率优化是落地前必修课:维度截断、量化、输入压缩三种手段可以组合使用。

这类技术分享信息密度很高,光靠听很难一次消化。

我会用 Ai好记 把演讲视频转成图文笔记,自动生成精华速览和思维导图,把对比学习、难负样本、RAG 级联这些关键点结构化地抓出来,方便之后回头对照。

做技术笔记整理,这套流程帮我省了不少时间。


FAQ:多模态向量模型高频问题

Q:Qwen3-VL-Embedding 相比 CLIP 架构的优势是什么?
A:它能通过一个统一编码器处理任意模态组合的输入,对富文本图片理解更强,还能利用大模型预训练知识,用更少数据达到更好效果。

Q:Embedding 和 Reranker 在 RAG 里怎么配合?
A:Embedding 负责初步召回(快、适合大规模粗筛),Reranker 负责精排(准、但成本高)。两者级联,先粗筛百级候选,再精排出十级最优。

Q:难负样本为什么这么重要?
A:如果负样本和查询完全不相关,模型学不到深层语义。难负样本看似相关实则无关,能逼模型做细粒度区分。

Q:多模态模型处理 PDF 相比 OCR 方案有什么优势?
A:可直接把每页 PDF 作为图像编码成向量,完整保留版面、结构、图表等视觉信息,省掉 OCR 环节,在图文并茂的文档上效果更好。

Q:部署时怎么降成本?
A:维度截断、表征量化(Float32 转 INT8)、输入压缩(降分辨率/调帧率)三个层次叠加使用。

以上内容由 Ai好记 转录整理。
Ai好记是一款支持音视频转图文笔记的AI知识库工具,支持B站、小红书、抖音、小宇宙等平台链接及本地音视频文件,视频转文字后自动生成精华速览、思维导图和结构化图文笔记,帮助你把几小时的视频内容变成可搜索、可复习的图文笔记。

在这里插入图片描述

更多推荐