大模型的探索与实践-课程笔记(五):Multi-Modal 多模态
·
Take-away Messages
- 多模态的定义与流派
- 多模态的核心组件
- 模态编码器
- 输入投影仪
- 大模型基座
- 输出投影仪
- 模态生成器
- 多模态常见任务
- 多模态痛点
第一部分:多模态的定义与核心挑战
1. 什么是多模态?
- 传统定义:包括文字、图片、音频、视频等不同形式的数据输入与输出。
- 广义定义:将多种不同的任务(Multi-task)指向同一个目标,也视作一种多模态。
2. 模态的两大派系(任务的区别)
多模态任务极其复杂,输入输出格式不固定。核心可分为两类情况:
- 模态融合(Fusion):不同模态代表同一个事物的不同侧面。例如:一张狗的图片 + 一段狗的叫声。此时需要将这两种模态“融合”在一起进行分类或识别。
- 模态拼接(Concat):一个模态是另一个模态的操作指令或补充。例如:一段文字(指令:“把视频调成紫色”) + 一段原始视频。这两个模态讲的不是同一件事,更适合“拼接”处理。
3. 多模态为什么难做?
- 相比于文本任务可以统一为“下一个词预测(自回归)”,多模态各个子任务千变万化,很难找到一个统一的框架。
- 语料极度匮乏:互联网上带有高质量标签的图文对、视频数据远少于纯文本,导致多模态模型的训练严重受限于数据量。
4. 模态异构性与语义鸿沟
- 模态异构性:底层的物理信息结构完全不同。文本是高度浓缩的、离散的符号(具有极强的高层语义逻辑);而图像和音频是密集的、连续的矩阵或信号(包含海量冗余的底层物理信息)。
- 语义鸿沟:由于异构性,像素层面的计算数值(如 RGB 矩阵)与人类理解的高层抽象概念(猫、狗)之间存在天然断层,机器很难在未对齐的参数空间里直接把“文本符号”和“连续像素”对应起来。
第二部分:多模态的核心组件
多模态大模型的底层本质包含五个流水线步骤串联:
组件一:模态编码器 (Modality Encoders) —— 【从模态到特征】
- 作用:原始图片(像素矩阵)或音频是无法直接送给大模型的。编码器(如 Vision Transformer, CNN)负责将原始数据降维,转换为密集(Dense)的特征向量(Embedding)。
- 为什么要降维/Embedding? 最初的 One-hot 编码极其稀疏且占用空间极大,更致命的是它无法体现事物间的相关关系。Embedding 能将高维流行空间中的数据映射到低维特征空间中,并保留语义关系(经典例子:国王 - 男 + 女 = 王后)。
组件二:输入投影器 (Input Projectors) —— 【模态对齐(最难点)】
- 作用:不同模态提取出的特征维度和空间完全不同,投影器相当于“胶水”,负责把它们映射到大模型能够理解的统一维度空间内。
- 三种主流对齐方案:
- 基于投影的对齐(拼接 + MLP):简单粗暴地将特征拼接后过一个多层感知机。坑点:会增加模型复杂度,经常出现“加了某模态反而效果变差”的过拟合问题。
- 基于注意力的对齐(深层对齐,如 Cross-Attention):目前的主流。将模态切成小块(Patch/Block),通过注意力网络寻找其深层相关性,不易丢失信息,但训练难度大。
- 基于统一 Tokenization 的对齐:试图把所有模态强制映射到同一个特征空间(在这个空间里可以对图片和文字直接做加减乘除)。理想很丰满,但由于“一段文字对应无数种图片”的非对称性,实际落地效果不如注意力机制。
两大经典多模态表征理论学习范式:
- 联合表征 (Joint Representation):强制将不同模态的特征压缩到同一个共享的特征空间中。通常适用于“模态融合”任务。
- 协同表征 (Coordinated Representation):各自模态保留自己的特征空间,但在空间距离上施加相似性约束。例如工业界基石模型 CLIP (Contrastive Language-Image Pre-training) 采用的对比学习 (Contrastive Learning):在向量空间中,把有关联的“图-文对”拉近,把无关的“图-文对”推远,这极大地启发了现代大模型的对齐思路。
组件三:大模型基座 (LLM Backbone) —— 【核心大脑】
- 作用:完成对齐后的特征会被当作“外语词汇”送入冻结的大规模语言模型(如 LLaMA, GPT)中,利用 LLM 强大的逻辑推理能力进行处理和输出。
组件四:输出投影器 (Output Projectors) —— 【模态反向映射】
- 作用:与输入投影器互为对偶,将大模型的输出特征重新映射回目标模态能够理解的表征空间。
组件五:模态生成器 (Modal Generators) —— 【从特征到模态】
- 作用:负责最后的“显影”。比如利用扩散模型(Diffusion)将输出特征还原成一张具体的图片,或利用解码器还原出一段文字/音频。
第三部分:多模态常见任务与痛点
1. 常见多模态任务
- 视觉问答 (VQA):看图回答问题。
- 难点:在图片中很难像纯文本那样构建“思维链(CoT)”,一旦涉及数学推理(如数图中有几个苹果加橘子),错答率极高。
- 图像与视频描述生成:要求模型理解图片元素,或理解视频中随时间演变的动态和行为交互。
- 跨模态检索:以图搜文,或以文搜图。
2. 图像生成存在的普遍痛点
- 指令遵循极差:难以进行局部的精确修改。例如,生成一张图片后,要求“只让第一排的某人举手”,或者“微调一下耳朵的形状”,模型往往会“牵一发而动全身”,把整张图的画风或毫不相干的元素全改掉(越迭代越离谱)。
- 排版与文字生成困难:如果让图像模型直接生成结构化的长文本(如做一整个含有密集文字的 PPT 单页),经常会出现乱码(如诡异的韩文/火星文),细节漏洞百出。
- 多模态幻觉:对于 VQA 等任务,模型生成的文本中经常包含图像/视频中并不存在的物体或动作。其理论原因在于,负责推理的大模型基座拥有过于强大的文本先验,当视觉投影过来的特征不够清晰时,LLM 更倾向于靠语料库的统计概率去“脑补盲猜”,而不是靠“看见”的事实作答。
AI工具
| 工具/模型名称 | 类别 | 核心功能与特色 | 应用领域与启发 |
|---|---|---|---|
| Sora / Sora-like (如Suno/Hailuo等) | 视频生成大模型 | 具备极强的物理世界模拟能力(World Model)。不只是像素的堆叠,能理解物体的空间关系、重力、碰撞等物理规律。 | 应用:影视级视频素材生成。 启发:优秀的视频生成大模型本质上是在大脑中“建构”常识世界,而非死记硬背。 |
| 豆包 (Doubao) | 多模态大模型 | 字节跳动旗下模型。拥有国内领先的多模态数据优势(背靠抖音的海量音视频语料),在实时语音、视频理解上表现较好。 | 应用:多模态交互(视频通话、图片理解)。 启发:多模态模型的护城河往往是高质量的图文/音视频匹配数据。 |
| GPT-4o / GPT-4V | 多模态大模型 | 领先的视觉语言模型。但在局部细节修改(如“只让第三排男生举手”)或生成包含复杂文字的图片时,仍然存在明显的短板和指令遵循问题。 | 应用:图像生成与改写、视觉问答。 |
| 自动数据分析 Agent | 垂直领域 Agent | 结合开源/闭源模型(DeepSeek / GPT-4o),用户只需拖入数据集,即可一键生成数十页甚至上百页带可视化图表的数据分析报告。 | 应用:低门槛的自动化数据挖掘与报告撰写。 创新点:预先固化了部分 Workflow 以缩减大模型规划(Planning)的试错空间,从而提升稳定性。 |
更多推荐

所有评论(0)