上一轮工业革命已成历史,这一轮智能革命正在眼前。
我们正见证历史,关注我,一起学习大模型。

一、原理基础-何为多模态

先看何为模态?
“模态”指的是信息的呈现、传递或感知的特定形式或方式。 你可以把它通俗地理解为信息的“载体”、“通道”或“感官类型”。
说人话的话,你可以理解成类型,比如:
一段文字:“今天太阳好大啊”,如果变成一张画着大太阳的图片,你都可以认知出这是一个大太阳,只不过一个是文本类型,一个是图片类型。

有哪些模态

  • 文字/文本模态:你正在阅读的这些句子。
  • 视觉/图像模态:一张描绘了相同内容的照片、图表或绘画。
  • 听觉/语音模态:一段播客或某人向你口述相同的信息。
  • 视频模态:一段融合了动态图像、声音,有时还包括字幕的影片。

二、多模态大模型

传统AI

是“单模态”专家,各自为政:

一个模型只懂文本,看到图片就“瞎了”。

另一个模型只懂图像,看到文字就“文盲”了。

多模态AI

多模态大模型的目标,是在AI内部建立一个“通用翻译器”和“融合理解中心”。 它学会了:

对齐:理解“猫”这个文字,和一张“猫”的图片,指的是同一个东西。
关联:理解“婴儿的啼哭”(音频)通常与“哭泣的脸”(图像)和“需要帮助”(文本含义)相关联。
生成:可以根据“一首宁静的乡村音乐”(音频概念)生成一段匹配意境的文字描述,甚至是一幅画。

三、多模态的重要性

因为人类天生就是多模态生物。我们无时无刻不在通过眼睛、耳朵、甚至触觉,综合地接收和理解世界。让AI具备多模态能力,就是让它更贴近人类的智能方式,从而能够:

处理更复杂、更真实的任务:现实世界的问题很少只通过一种形式出现。

实现更自然的人机交互:你可以用最方便的方式(说话、截图、上传文件)与AI沟通。

进行更深层次的推理与创造:跨越不同形式的信息进行联想、对比和创造。

更多推荐