【考研复试】深度学习核心:特征提取与名词全解析
1. 深度学习的本质:编码与表征
深度学习模型(如 CNN, RNN)的本质是一个 Encoder(编码器)。它将输入(图片/语音/文字)转换成一个高维向量,这个过程也叫特征表征 (Representation)。

2. 监督学习 vs. 无监督学习
-
监督学习 (Supervised Learning):利用“数据+标签”训练。模型压缩特征的方向是由标签(Label)引导的。
-
无监督学习 (Unsupervised Learning):只有数据,没有标签。意义在于利用海量的廉价无标签数据,让模型自主学习数据的本质分布。
-


3. 自监督学习:未来的主流
自监督学习(Self-supervised Learning)是无监督的一种,核心是“自己监督自己”。
A. 对比学习 (Contrastive Learning)
-
核心名词:正样本:指**“自己”与“自己的增广图”**组成的一对样本。 负样本:指**“自己”与“别人”**(其他不相关的图片)组成的一对样本 。
-
逻辑:让同一张图的两个变体(旋转、变色后)在特征空间里尽量靠近,不同图尽量远离。模型在训练时,会努力让正样本对在特征空间里的距离更近 。模型在训练时,会努力让负样本对在特征空间里的距离更远 。
-

B. 生成式自监督 (Generative SSL)
生成式自监督的核心思想是:“如果我能根据不完整的信息还原出完整的信息,就说明我真正理解了数据的内在规律。” 这就像是让 AI 做“完形填空”。
-
MAE (Masked Autoencoder):想象你在看一张被撕掉一大半的火烈鸟照片。虽然缺了很多块,但作为人类,你可以猜出哪里是头,哪里是腿 。MAE 就是让 AI 做同样的事:随机遮住图片中 75% 甚至更多的地方,只给它看剩下的碎片,让它还原整张图 。
-
为什么能学到特征? AI 如果想把缺了的火烈鸟头画出来,它必须先通过剩下的碎片认出“这是一只火烈鸟”,并且知道“火烈鸟的脖子末端应该长个什么样的头” 。

-
GAN (生成对抗网络):
-
通俗解释(警察与劫匪/假钞案):生成器 (Generator):像一个制造假钞的罪犯。它从随机噪声开始,努力画出像真钱一样的图片去“骗”警察 。判别器 (Discriminator):像一个经验丰富的警察(或验钞机)。它的任务是分辨出哪张是真钱(来自数据库),哪张是假钞(来自生成器)
-
为什么能学到特征? 为了不被抓住,罪犯(生成器)必须研究真钞的所有细节特征(纹理、水印、颜色);而为了抓到罪犯,警察(判别器)也必须练就一双火眼金睛 。在这个过程中,两者都习得了极强的特征提取能力 。
-

4. 特征分离 (Feature Disentanglement) —— 复试加分项
什么是特征分离?
在普通的特征提取中,模型提取出的向量是一个“大杂烩”,比如一段语音向量里既包含了“说了什么”,也包含了“是谁在说”。而特征分离的目标是让模型学会“各司其职”,将不同的属性编码到不同的维度中,实现互不干扰。
A. 图像领域:内容 (Content) vs 风格 (Style)
-
核心逻辑:模型拥有两个独立的编码器。一个专门负责提取图像的几何结构、物体形状(内容),另一个专门提取笔触、色彩分布、纹理(风格)。
-
应用场景:风格迁移(Style Transfer)。

B. 语音领域:语义内容 (Content) vs 说话人音色 (Speaker)
-
核心逻辑:这是李宏毅老师课程中的经典案例。模型通过自监督任务(如 Voice Conversion),强迫一个路径只学习“文字信息”,另一个路径只学习“声纹特征”。
-
应用场景:变声器、个性化语音合成。

💡 复试常考 Q&A 模拟:
问:为什么要做无监督/自监督学习?
答: 老师,因为带标签的数据非常稀缺且昂贵。通过自监督学习(如对比学习或 MAE),模型可以从海量原始数据中习得通用的特征提取能力,这能为后续的下游任务提供更好的初始化参数。
问:对比学习(Contrastive)和生成式(Generative)自监督有什么区别?
答: “老师,这两者的侧重点不同 :
对比学习 像是在做‘选择题’或‘找不同’。它不要求还原细节,只要能分清‘我是我,你是你’就行,所以它擅长提取区分度高的特征 。
生成式自监督(如 MAE)像是在做‘简答题’或‘填空题’ 。它要求模型具备重构能力,因此它对数据的全局结构和精细细节理解得更深 。 在实际应用中,我们往往根据下游任务的需求来选择。比如需要分类精度,对比学习往往表现更好;需要理解物体内部结构,生成式则更有优势。”
更多推荐
所有评论(0)