1. 深度学习的本质:编码与表征

深度学习模型(如 CNN, RNN)的本质是一个 Encoder(编码器)。它将输入(图片/语音/文字)转换成一个高维向量,这个过程也叫特征表征 (Representation)


2. 监督学习 vs. 无监督学习

  • 监督学习 (Supervised Learning):利用“数据+标签”训练。模型压缩特征的方向是由标签(Label)引导的。

  • 无监督学习 (Unsupervised Learning)只有数据,没有标签。意义在于利用海量的廉价无标签数据,让模型自主学习数据的本质分布


3. 自监督学习:未来的主流

自监督学习(Self-supervised Learning)是无监督的一种,核心是“自己监督自己”。

A. 对比学习 (Contrastive Learning)

  • 核心名词:正样本:指**“自己”与“自己的增广图”**组成的一对样本。 负样本:指**“自己”与“别人”**(其他不相关的图片)组成的一对样本 。        

  • 逻辑:让同一张图的两个变体(旋转、变色后)在特征空间里尽量靠近,不同图尽量远离。模型在训练时,会努力让正样本对在特征空间里的距离更近 。模型在训练时,会努力让负样本对在特征空间里的距离更远 。

B. 生成式自监督 (Generative SSL)

生成式自监督的核心思想是:“如果我能根据不完整的信息还原出完整的信息,就说明我真正理解了数据的内在规律。” 这就像是让 AI 做“完形填空”。

  • MAE (Masked Autoencoder):想象你在看一张被撕掉一大半的火烈鸟照片。虽然缺了很多块,但作为人类,你可以猜出哪里是头,哪里是腿 。MAE 就是让 AI 做同样的事:随机遮住图片中 75% 甚至更多的地方,只给它看剩下的碎片,让它还原整张图 。

  • 为什么能学到特征? AI 如果想把缺了的火烈鸟头画出来,它必须先通过剩下的碎片认出“这是一只火烈鸟”,并且知道“火烈鸟的脖子末端应该长个什么样的头” 。

  • GAN (生成对抗网络):

  • 通俗解释(警察与劫匪/假钞案)生成器 (Generator):像一个制造假钞的罪犯。它从随机噪声开始,努力画出像真钱一样的图片去“骗”警察 。判别器 (Discriminator):像一个经验丰富的警察(或验钞机)。它的任务是分辨出哪张是真钱(来自数据库),哪张是假钞(来自生成器) 

  • 为什么能学到特征? 为了不被抓住,罪犯(生成器)必须研究真钞的所有细节特征(纹理、水印、颜色);而为了抓到罪犯,警察(判别器)也必须练就一双火眼金睛 。在这个过程中,两者都习得了极强的特征提取能力 。


4. 特征分离 (Feature Disentanglement) —— 复试加分项

什么是特征分离?

在普通的特征提取中,模型提取出的向量是一个“大杂烩”,比如一段语音向量里既包含了“说了什么”,也包含了“是谁在说”。而特征分离的目标是让模型学会“各司其职”,将不同的属性编码到不同的维度中,实现互不干扰。

A. 图像领域:内容 (Content) vs 风格 (Style)
  • 核心逻辑:模型拥有两个独立的编码器。一个专门负责提取图像的几何结构、物体形状(内容),另一个专门提取笔触、色彩分布、纹理(风格)。

  • 应用场景:风格迁移(Style Transfer)。

B. 语音领域:语义内容 (Content) vs 说话人音色 (Speaker)
  • 核心逻辑:这是李宏毅老师课程中的经典案例。模型通过自监督任务(如 Voice Conversion),强迫一个路径只学习“文字信息”,另一个路径只学习“声纹特征”。

  • 应用场景:变声器、个性化语音合成。

💡 复试常考 Q&A 模拟:

问:为什么要做无监督/自监督学习?

答: 老师,因为带标签的数据非常稀缺且昂贵。通过自监督学习(如对比学习或 MAE),模型可以从海量原始数据中习得通用的特征提取能力,这能为后续的下游任务提供更好的初始化参数。

问:对比学习(Contrastive)和生成式(Generative)自监督有什么区别?

答: “老师,这两者的侧重点不同 :

对比学习 像是在做‘选择题’或‘找不同’。它不要求还原细节,只要能分清‘我是我,你是你’就行,所以它擅长提取区分度高的特征 。

生成式自监督(如 MAE)像是在做‘简答题’或‘填空题’ 。它要求模型具备重构能力,因此它对数据的全局结构和精细细节理解得更深 。 在实际应用中,我们往往根据下游任务的需求来选择。比如需要分类精度,对比学习往往表现更好;需要理解物体内部结构,生成式则更有优势。”

更多推荐