第一次接触多模态大模型时,很多人脑子里的理解大概是这样的:

图片来了,先经过一个 Vision Encoder,变成 Embedding,然后塞给 LLM。

也就是:

Image → Vision Encoder → Embedding → LLM → Answer

这个理解不能说错。

但如果只停留在这里,你其实还没有真正理解“多模态”。

因为真正困难的问题根本不是:

怎么把图片接到 LLM 上?

而是:

一张图片、一段声音、一段视频和一句文字,原本是四种完全不同的数据,大模型为什么最终可以把它们放到一起理解?

这个问题一旦想通,Vision Encoder、Multimodal Token、Cross Attention、VLM、Audio Understanding、Video Understanding 这些概念,基本都会串起来。

这篇文章不准备堆模型名字。

我更想讲清楚多模态大模型背后的几个底层问题:

Representation、Alignment、Fusion、Compression、Temporal Modeling。

理解这五个词,远比记住十几个模型名字有价值。


一、先推翻一个最常见的认知:LLM 其实从来没有“看见”文字

我们平时说:

“大模型读了一句话。”

其实严格来说,大模型根本没有看到“文字”。

例如:

这是一件红色连衣裙

进入模型之前,需要先经过 Tokenizer。

文字会被切成 Token,再通过 Embedding Layer 转换成向量。

最后真正进入 Transformer 的东西,本质上是:

[
X=[x_1,x_2,x_3,\cdots,x_n]
]

其中:

[
x_i\in \mathbb R^d
]

也就是说,Transformer 真正处理的是:

一串高维向量。

它并不知道屏幕上那个东西叫“汉字”,也不知道 Token 原来是一个英文单词还是一个中文字。

到了 Transformer 这一层,所谓:

  • 单词
  • 句子
  • 图片
  • 声音
  • 视频

最终都要面对同一个问题:

怎样变成 Transformer 可以处理的一系列向量?

这就是理解多模态大模型的第一个关键。


二、多模态真正统一的,不是数据格式,而是 Representation

Text、Image、Audio、Video 的原始数据结构其实差别非常大。

文本可以看成离散符号序列。

图片本质是:

[
H\times W\times C
]

也就是大量 Pixel。

音频更加特殊,它首先是一条随着时间变化的 Waveform:

[
x(t)
]

视频则进一步增加了时间维度:

[
H\times W\times C\times T
]

所以原始状态下:

文字和图片根本不在同一个“世界”里。

Pixel 和 Word 没办法直接比较。

声音的振幅和图像颜色更没有办法直接计算语义相似度。

因此,多模态模型必须先做一件非常重要的事情:

把不同模态转换成有语义的 Representation。

也就是:

[
Raw\ Signal
\rightarrow
Representation
]

图片要从 Pixel 变成视觉特征。

声音要从 Waveform 变成声学特征。

视频要从连续 Frame 变成带有空间和时间信息的视觉表示。

到了这里,多模态才真正开始。


三、图片为什么要经过 Vision Encoder?

先看最容易理解的图片。

假设有一张 336×336 的图片。

最粗暴的方法,是不是可以直接把每一个 Pixel 当成一个输入?

理论上可以。

工程上非常不现实。

因为一张图片里面 Pixel 太多,而且单个 Pixel 几乎没有高级语义。

一个 RGB 值:

(211, 43, 57)

本身不会告诉模型:

“这里是一只猫的耳朵。”

所以现代视觉模型通常不会直接让 LLM 理解原始 Pixel,而是先交给 Vision Encoder。

Vision Transformer 的经典思路是:

把图片切成很多 Patch。

例如 Patch Size 为 14×14,那么一张 336×336 的图片可以切成:

[
24\times24=576
]

个 Patch。

于是图片开始变成一种类似“序列”的东西。

文本原本是:

Token 1
Token 2
Token 3
...

图片现在变成:

Patch 1
Patch 2
Patch 3
...
Patch 576

每个 Patch 再映射成一个 Vector。

经过多层 Vision Transformer 以后,这些 Vector 就不再只是简单的颜色块。

它们逐渐可以编码:

  • 边缘
  • 纹理
  • 颜色
  • 形状
  • 物体
  • 人体部位
  • 空间关系
  • 场景信息

所以 Vision Encoder 真正做的事情,可以压缩成一句话:

把低级视觉信号转换成高级视觉 Representation。

这一步非常关键。

因为 LLM 不应该负责从 RGB 数值中重新学习“什么叫边缘、什么叫物体”。

Vision Encoder 已经提前完成了大量视觉抽象。


四、Multimodal Token 到底是什么?

这是很多教程讲得最模糊的地方。

很多人一看到 Token,就下意识认为:

Token 就是一个单词或者一个字。

其实不是。

更准确的理解应该是:

Token 是 Transformer 的一个计算单位。

文本 Token 一般经历:

Text
→ Token ID
→ Embedding
→ Vector

但是视觉 Token 完全可以是:

Image Patch
→ Vision Encoder
→ Visual Feature
→ Vector

它不一定存在一个类似“Token ID = 12857”的离散编号。

所以 Multimodal Token 很多时候并不是传统意义上的“词”。

它只是:

被组织成 Token 序列形式的一组连续向量。

这时候你会发现一个非常有意思的事情。

在 Transformer 看来:

文本 Token 是 Vector。

视觉 Token 也是 Vector。

Audio Token 也是 Vector。

Video Token 最后还是 Vector。

这就是多模态能够成立的数学基础。


五、但是还有一个关键问题:Vision Encoder 的 Vector,LLM 凭什么看得懂?

到这里其实才进入多模态大模型真正有意思的地方。

假设 Vision Encoder 输出:

[
V\in R^{576\times1024}
]

也就是说,一张图片产生 576 个视觉特征,每个特征是 1024 维。

但是我们的 LLM Hidden Size 可能是:

[
4096
]

问题马上出现:

一个是 1024 维。

一个是 4096 维。

根本不能直接接。

所以中间通常需要:

  • Projector
  • Adapter
  • Connector
  • Resampler

之类的模块。

最简单的情况,可以理解成学习一个映射:

[
1024\rightarrow4096
]

于是架构变成:

Image
→ Vision Encoder
→ Visual Features
→ Projector
→ LLM-Compatible Features
→ LLM

看到这里,很多人会说:

“明白了,Projector 就是把 Vision Embedding 转成 LLM Embedding。”

这句话依然只对了一半。


六、这里一定要分清两件事:Dimension Alignment 和 Semantic Alignment

假设 Vision Encoder 输出 1024 维。

LLM 需要 4096 维。

加一个 Linear Layer:

[
y=Wx+b
]

从数学上来说,维度已经对上了。

但是问题来了:

维度对上,为什么 LLM 就知道这个 Vector 代表一只猫?

当然不知道。

如果这个 Projector 是随机初始化的,那么:

猫的图片
→ 一串随机意义的 4096 维数字

对于 LLM 来说依然是乱码。

所以真正困难的不是:

[
1024\rightarrow4096
]

而是:

[
Vision\ Meaning
\rightarrow
Language\ Meaning
]

这就是 Semantic Alignment。

例如训练数据不断告诉模型:

<Image>

Question:
What is this?

Answer:
A cat.

或者:

<Image>

Question:
What color is the dress?

Answer:
Red.

经过大量训练以后,模型才逐渐学会:

某类 Visual Representation 和“cat”相关。

某类颜色特征和“red”相关。

某些局部视觉模式和“袖口”“领子”“纽扣”相关。

所以一定要记住一个非常重要的区别:

Projector 解决的是“怎么接得上”。

Alignment Training 解决的是“接上以后有没有意义”。

前者是维度问题。

后者才是真正的智能问题。


七、再往深一层:所谓 Embedding Space,其实不是一个东西

很多文章喜欢说:

“不同模态被映射到同一个 Embedding Space。”

这句话很容易让人形成错误理解。

实际上至少要区分三层空间。

第一层:Raw Input Space

这是最原始的数据。

图片是 Pixel。

声音是 Waveform。

文本是 Symbol。

视频是连续图像和时间。

这个阶段的不同模态几乎无法直接比较。


第二层:Modality Feature Space

经过 Encoder 之后:

Image → Vision Features

Audio → Audio Features

Video → Spatiotemporal Features

这些 Feature 已经带有语义。

例如视觉特征可能开始表示:

“衣服”“红色”“人脸”“边缘”“材质”。

音频特征可能开始表示:

“语音”“节奏”“频率”“环境声”。

它们已经不再是 Raw Signal。


第三层:LLM-Compatible Representation

如果这些 Feature 最后还要交给 LLM,那么通常还需要一个 Connector,把它们变成 LLM 能消费的 Representation。

因此真正完整的链路应该理解成:

[
Raw\ Input
\rightarrow
Modality\ Representation
\rightarrow
LLM-Compatible\ Representation
\rightarrow
Reasoning
]

这个视角非常重要。

因为以后你再看到任何多模态架构,第一件事不应该是问:

“它用了什么大模型?”

而是应该问:

信息在什么空间里?又是在哪里完成空间转换的?


八、CLIP 和 LLaVA 做的其实不是同一件事

理解了“不同空间”,很多模型也就不容易混淆了。

例如 CLIP 的核心目标之一,是让:

一只狗的图片

和:

"a dog"

在语义表示空间里距离比较近。

也就是说,它更强调:

[
Image
\leftrightarrow
Text
]

之间的语义对齐。

这特别适合:

  • Image Retrieval
  • Text-to-Image Search
  • Zero-shot Classification
  • Image-Text Matching

但是,“图片和文字可以计算相似度”并不代表“图片已经能直接作为 LLM 的 Token”。

这是两件事。

像 LLaVA 一类模型更关心:

怎样把 Vision Encoder 的视觉表示转换成 LLM 能够继续做语言推理的 Representation。

一个偏 Shared Semantic Space。

一个偏 LLM-Compatible Space。

如果把这两个概念混在一起,后面看多模态论文会越来越乱。


九、不同模态进入模型以后,到底怎么互相“交流”?

这就进入第二个核心问题:

Multimodal Fusion。

目前可以先抓住两种经典思想。

一种是:

把不同 Token 放进同一个序列。

另一种是:

使用 Cross Attention 让一个模态去读取另一个模态。


十、第一种融合:把 Visual Token 和 Text Token 放在一起

最直觉的方式是:

Visual Token 1
Visual Token 2
Visual Token 3
...
Text Token 1
Text Token 2
Text Token 3
...

然后一起进入 Transformer。

从 Transformer 的角度看:

根本没有所谓“前面这些是图片、后面这些是文字”的天然规则。

它只看见一系列 Vector。

如果模型训练得足够好,那么文本中的:

“袖口”

这个 Token,就可以通过 Attention 和代表袖口区域的 Visual Token 建立联系。

这种设计最大的吸引力在于:

架构统一。

Everything is Token。

这句话几乎可以看成现代多模态模型非常重要的一条设计哲学。


十一、第二种融合:Cross Attention

另一种方式是不把所有视觉 Token 都直接混进语言序列。

而是让:

Language Stream

和:

Vision Stream

分别保留。

需要视觉信息的时候,再通过 Cross Attention 去读取。

理解 Cross Attention,最关键的不是背公式,而是理解 Q、K、V。

Attention 的经典形式是:

Softmax
\left(
\frac{QK^T}{\sqrt d}
\right)V
]

第一次看到这个公式,很容易觉得只是矩阵运算。

其实它的思想极其直觉。


十二、Q、K、V 到底是什么?用“袖口是什么颜色”讲一次就懂

假设用户问:

这个人的袖口是什么颜色?

模型现在有一个问题。

所以 Query 可以理解成:

我现在想找什么?

这里关心的是:

袖口
颜色

视觉端有大量 Visual Token。

不同 Token 可能对应:

人脸
背景
衣服
袖口
裤子
鞋

这些 Token 对应的 Key,可以理解成:

我这里是什么信息?

于是模型计算 Query 和所有 Key 的匹配程度。

本质上就是:

“我现在在找袖口,谁和袖口最相关?”

可能得到类似:

Face        0.03
Background  0.01
Cuff        0.91
Pants       0.05

经过 Softmax 后,袖口对应视觉 Token 得到最大的 Attention Weight。

然后模型去读取这个 Token 的 Value。

Value 可以理解成:

真正要拿走的信息。

里面可能包含:

颜色、纹理、形状、局部视觉特征。

最终模型得到:

袖口 → 蓝色

所以 Cross Attention 完全可以理解成:

一种可学习的、可微分的语义检索机制。

Query:我找什么?

Key:你是什么?

Attention Score:你和我的问题有多相关?

Value:如果相关,我真正读取你的什么信息?

理解到这里以后,Cross Attention 就不再是一个公式。


十三、真正做工程时,还有一个巨大问题:Token 太多

图片看懂了。

视频也能拆 Frame。

那是不是把所有信息全部做成 Token,塞进模型就行?

很快会碰到现实问题:

算不起。

假设一张高分辨率图片产生数千个 Visual Token。

一段视频每秒几十帧。

如果每一帧又产生数百甚至上千个视觉表示,那么一分钟视频产生的 Token 数量会非常恐怖。

而 Transformer 的标准 Attention 计算量与序列长度之间大致具有平方级关系:

[
O(N^2)
]

也就是说,Token 数翻倍,Attention 成本并不是简单翻倍。

因此,多模态模型真正重要的工程能力之一,其实是:

如何用尽可能少的 Token 保存尽可能多的信息。


十四、这就是为什么 Resampler、Pooling、Patch Merging 如此重要

假设 Vision Encoder 产生:

2000 个 Visual Features

LLM 并不一定需要完整吃掉这 2000 个。

如果通过某种机制压缩成:

64 个高信息密度 Token

并且依然能够保留:

  • 物体
  • 颜色
  • OCR
  • 空间布局
  • 人物关系
  • 动作
  • 场景

那么整个系统的效率会高很多。

这就是很多模型中出现这些技术的根本原因:

  • Resampler
  • Pooling
  • Token Merging
  • Patch Merging
  • Dynamic Resolution
  • Query Token
  • Visual Token Compression

它们表面上名字不同,背后解决的其实是同一个问题:

[
大量输入信息
\rightarrow
少量高价值表示
]

我更喜欢把它理解成:

Semantic Compression。


十五、多模态模型有一个非常值得长期关注的指标:每个 Token 的信息密度

如果从系统设计视角看,我认为一个很有价值的问题是:

[
\frac{Useful\ Information}{Token}
]

也就是:

一个 Token 究竟携带了多少真正有用的信息?

假设模型 Context Window 是固定的。

一种视觉方案处理一张图需要 10000 个 Token。

另一种方案只需要 1000 个 Token,而且理解效果差不多。

后者能做什么?

它可以:

一次处理更多图片。

处理更长的视频。

保留更多历史上下文。

给推理留下更大空间。

降低推理成本。

所以 Token Compression 并不是一个边角优化。

它其实直接决定:

多模态模型能够“看多远”。


十六、Audio 为什么不能简单理解成“语音转文字”?

图片讲完以后,再看 Audio。

最常见的音频处理流程之一是:

Waveform
→ Spectrogram / Acoustic Representation
→ Audio Encoder
→ Audio Features

例如 Speech Model 经常把声音转换成 Mel Spectrogram,再交给 Encoder。

但真正重要的问题不是 Mel Spectrogram 本身。

而是:

Audio 里面包含的信息远远不只有文字。

例如一句:

机器停一下。

把它做 Speech-to-Text 以后,只剩:

机器停一下

但是原始声音里还可能包含:

  • 是谁说的
  • 音量大小
  • 情绪
  • 紧张程度
  • 语气
  • 背景机器是否异常
  • 有没有警报声
  • 有没有碰撞声
  • 声音发生在什么时候

所以:

[
Audio
\neq
Transcript
]

更准确应该理解为:

Linguistic\ Information
+
Acoustic\ Information
+
Prosody
+
Environment
+
Temporal\ Information
]

这也是为什么真正的 Audio Understanding 和传统 ASR 不是同一个问题。

ASR 的目标主要是:

[
Speech\rightarrow Text
]

而 Audio Understanding 希望模型直接理解:

这段声音到底发生了什么。


十七、Video 更复杂,因为它不是“很多张图片”这么简单

很多人第一次理解 Video Model,会自然认为:

Video 不就是把每一帧当图片处理吗?

这只能解决一部分问题。

因为图片主要回答:

What is there?

也就是:

这里有什么?

但视频还有一个更重要的问题:

What happened?

也就是:

发生了什么?

例如四帧画面:

第一帧:杯子放在桌上。

第二帧:手拿起杯子。

第三帧:杯子移动到嘴边。

第四帧:杯子离开嘴边。

如果单独分析每一张图片,模型可能都能识别:

Person
Hand
Cup
Face

但是“喝水”这个概念并不属于任何单独一帧。

它来自:

[
Frame_1
\rightarrow
Frame_2
\rightarrow
Frame_3
\rightarrow
Frame_4
]

也就是说:

Action 存在于状态变化之中。

这是理解 Video Understanding 最关键的一句话。


十八、视频真正高级的 Representation,是 State Transition

与其把视频理解成:

Image + Image + Image + Image

不如把它理解成:

[
S_0
\rightarrow
S_1
\rightarrow
S_2
\rightarrow
S_3
]

其中每个 (S_t) 都代表某个时间点的世界状态。

Action 则导致:

[
S_t
\rightarrow
S_{t+1}
]

例如制造场景:

Fabric
→ Cutting
→ Sewing
→ Finishing
→ Garment

真正强的 Video Model 不能只识别:

布料
机器
工人
衣服

它还需要理解:

哪个动作发生在前?

哪个动作导致了后面的状态?

一个对象如何随着时间变化?

这时候 Video Understanding 已经开始接近另一个很重要的概念:

World Model。

因为模型开始学习的,不只是“世界里面有什么”,而是:

世界是如何变化的。


十九、视频为什么特别难?因为它同时包含 Space 和 Time

图片主要建模:

[
x,y
]

视频增加一个:

[
t
]

所以 Video Representation 至少同时要解决:

Spatial Modeling

和:

Temporal Modeling

如果视频还有声音,那么又会增加:

Audio-Visual Temporal Alignment

例如一个杯子掉到地面:

画面中杯子撞击地面的时刻。

声音中的“砰”应该出现在相近时间。

如果视觉和声音在时间上没有对齐,模型对事件的理解就可能出现问题。

因此真正的 Video Understanding,本质上不是简单的“Vision × 更多 Frame”。

而是:

[
Spatial
+
Temporal
+
Event
+
Audio\ Alignment
]


二十、到这里,可以重新定义一次“多模态大模型”

现在再回来看所谓 Multimodal LLM。

它真正解决的并不是:

给 LLM 加一个图片上传按钮。

而是构建这样一条信息链路:

现实世界信号
→ Encoding
→ Representation
→ Alignment
→ Compression
→ Fusion
→ Attention
→ Reasoning
→ Output

其中:

Encoder

解决:

原始信号如何变成有意义的 Feature?

Alignment

解决:

不同模态之间怎样建立语义关系?

Connector

解决:

不同 Representation 如何接入 LLM?

Fusion

解决:

不同模态在哪里、以什么方式交换信息?

Compression

解决:

怎样在有限 Token 和算力下保存尽可能多的信息?

Temporal Modeling

解决:

模型怎样理解事件、顺序和状态变化?

把这几件事情理解清楚以后,很多模型架构就不再神秘。


二十一、以后看到任何多模态模型,不要先看模型名字

我建议以后读任何 Multimodal Model,都先问它六个问题。

这六个问题比背论文名字有用得多。

1. Input 是怎么切的?

Image 怎么 Patch?

Video 怎么采 Frame?

Audio 怎么切时间段?

不同模态怎么 Tokenize?

2. Encoder 是什么?

图片使用什么 Vision Encoder?

音频使用什么 Audio Encoder?

视频有没有独立的 Temporal Modeling?

3. Connector 是什么?

是 Linear Projector?

MLP?

Adapter?

Resampler?

Query Tokens?

4. Fusion 在哪里发生?

Visual Token 和 Text Token 直接拼接?

还是 Cross Attention?

是早期融合还是较晚融合?

5. Token 怎么压缩?

有没有:

Pooling?

Patch Merging?

Dynamic Resolution?

Dynamic FPS?

Token Pruning?

6. Alignment 怎么训练?

有没有 Image-Text Pair?

Contrastive Learning?

Caption Training?

Instruction Tuning?

Joint Multimodal Training?

如果这六个问题都能回答出来:

你基本已经理解了一篇多模态模型论文最核心的架构。


二十二、Vision-Language Model 和 Multimodal LLM 也不要混为一谈

Vision-Language Model,也就是 VLM,是一个比较大的概念。

像 CLIP 这样的模型,本身就是 Vision-Language Model。

它可以学习:

[
Image\leftrightarrow Text
]

之间的语义关系。

但它不一定是我们今天熟悉的 Chatbot。

而 Multimodal LLM 通常还包含一个强大的 Language Model,用于:

  • Instruction Following
  • Reasoning
  • Dialogue
  • Generation

所以可以粗略理解:

VLM 更关注:

Vision 和 Language 如何建立联系?

而 Multimodal LLM 更进一步关心:

有了这些视觉、音频、视频 Representation 以后,怎样利用 LLM 完成推理和生成?

两者有交集,但不是完全相同的概念。


二十三、多模态真正值得学习的,其实不是模型,而是 Representation Learning

到这里会发现:

Vision Encoder、Audio Encoder、Video Encoder 看起来是三套技术。

但如果从更高层看,它们其实都在解决同一个问题:

[
Raw\ Signal
\rightarrow
Structured\ Representation
\rightarrow
Semantic\ Representation
]

Vision 做的是:

[
Pixel
\rightarrow
Patch
\rightarrow
Visual\ Feature
\rightarrow
Object/Relation
]

Audio 做的是:

[
Waveform
\rightarrow
Acoustic\ Feature
\rightarrow
Speech/Event
\rightarrow
Meaning
]

Video 做的是:

[
Frame_t
\rightarrow
Visual\ Feature_t
\rightarrow
State_t
\rightarrow
Action/Event
]

所以如果你准备真正深入多模态,而不是只停留在调用 API,我认为第一个值得系统学习的领域并不是“某某多模态框架”。

而是:

Representation Learning。

因为 Encoder 结构可以变。

模型名字可以变。

但只要机器还需要理解现实世界,就永远绕不开:

怎样把现实世界压缩成可以计算的 Representation?


二十四、再给一个很容易被忽略的高级认知:统一不等于“全部变成同一种东西”

很多多模态架构图喜欢画成:

Image ─┐
Audio ─┼→ Unified Embedding Space
Video ─┤
Text  ─┘

很容易让人产生一种印象:

最先进的多模态系统,就是把所有模态全部转换到完全一样的空间。

其实不一定。

Vision 有自己的统计结构。

Audio 有自己的时间频率结构。

Video 有自己的时空结构。

强行把它们过早压缩成完全相同的 Representation,并不一定是最好的设计。

模型也可以保留:

Vision Representation
Audio Representation
Language Representation

然后通过:

  • Projector
  • Adapter
  • Cross Attention
  • Shared Transformer
  • Routing

进行信息交换。

所以真正重要的不是:

所有模态必须一模一样。

而是:

不同模态之间必须能够有效通信。

这个观点对于理解未来的 Omni Model、VLA、机器人模型尤其重要。


二十五、如果只能记住三个技术,我建议记住这三个

多模态领域知识非常多。

如果一开始什么都学,很容易陷入模型名字和论文细节里。

如果只能选择三个最值得真正吃透的技术,我会建议按这个顺序。

第一:Representation / Embedding

你必须真正理解:

什么是向量表示?

为什么相似语义可以形成相似 Representation?

为什么 Transformer 可以处理来自不同模态的 Token?

这是整个多模态世界的地基。


第二:Attention / QKV / Cross Attention

不是会背:

[
Softmax(QK^T)V
]

而是真正理解:

Query 在寻找什么?

Key 如何表示可匹配的信息?

Value 为什么是被读取的内容?

如果 Attention 真正理解了,Text、Vision、RAG、Memory、Multimodal Fusion 很多技术会突然产生统一感。


第三:Alignment + Compression

Alignment 决定:

模型有没有真正把不同模态的“意义”连接起来。

Compression 决定:

模型在有限成本下到底能处理多少现实世界信息。

一个决定“懂不懂”。

一个决定“看得多不多”。

这两者都会长期决定多模态模型的实际能力。


二十六、最后,用一句话真正理解多模态大模型

学完这一整套东西以后,再看最开始那个结构:

Image
→ Vision Encoder
→ Embedding
→ LLM
→ Answer

你应该已经觉得它太粗糙了。

更准确的理解应该是:

Raw Multimodal Signal
→ Modality Encoding
→ Semantic Representation
→ Alignment
→ Token Compression
→ Multimodal Fusion
→ Transformer Reasoning
→ Output

而如果一定要把整篇文章浓缩成一句话:

多模态大模型的本质,不是让 LLM 获得“眼睛”和“耳朵”,而是把现实世界中不同形式的信息,转换成机器可以计算、对齐、压缩、关联和推理的 Representation。

Text 只是其中一种 Representation。

Image 是另一种。

Audio 是另一种。

Video 又是另一种。

它们原本来自完全不同的数据世界。

多模态技术真正做的事情,就是让这些不同世界之间建立一套可以通信的数学语言。

一旦理解到这里,再去看 Vision Encoder、CLIP、LLaVA、Flamingo、Whisper、ImageBind、各种 Omni Model,你关注的就不会只是:

“这个模型支持图片吗?”

而会开始问:

它怎么编码?

在哪里对齐?

怎样融合?

Token 怎么压缩?

时间关系怎么建模?

不同 Representation 如何交换信息?

当你开始问这些问题时,才算真正从“会使用多模态模型”,走到了“开始理解多模态模型”。


延伸学习建议

如果准备继续往下学,可以按照这个顺序:

Vision Transformer(ViT)

先理解 Image 如何从二维 Pixel 变成 Token Sequence。

然后学习:

CLIP

理解 Image-Text Semantic Alignment 和 Contrastive Learning。

接着看:

LLaVA

理解 Vision Encoder、Projector 和 LLM 是如何连接的。

再看:

Flamingo

重点理解 Perceiver Resampler 和 Cross Attention。

然后补:

Whisper

理解 Audio Representation。

再研究:

ImageBind

理解不同模态之间如何构建共享语义 Representation。

最后再进入:

Video Understanding、Omni Model、VLA、World Model。

到了这一步,多模态就不再是一个个孤立的模型。

你会逐渐发现,它们其实都在回答同一个问题:

现实世界,究竟应该怎样被表示,才能被机器理解?

这才是多模态真正值得学习的地方。

更多推荐