第一部分-机器学习基础-1.3表示学习
一、 核心定义与目标
-
表示学习:一种旨在让机器自动从数据中学习有效特征(即“表示”) 的算法。其目标是提升最终机器学习模型的性能。
-
核心驱动力:解决语义鸿沟问题,即数据的底层特征(如像素、字符)与高层语义(如物体、概念)之间的不一致性。自动学习到的“好表示”应能反映高层语义,从而简化后续的预测任务。
二、 “好的表示”应具备的特性
一个好的表示通常是主观的,但普遍认为应具备以下优点:
-
强表示能力:用同样规模的向量承载更多信息。
-
简化后续任务:包含高层语义信息,使预测模型更容易构建。
-
一般性/可迁移性:理想情况下应独立于特定任务,便于迁移到其他领域。
三、表示学习的两种核心方式
在机器学习中,特征主要有两种表示方式:局部表示和分布式表示。它们从根本理念到实际应用都存在显著差异。
局部表示,也被称为离散表示或符号表示,其典型形式是 One-hot 向量。这种表示方法为每个独立的类别或符号分配一个唯一的、高维且稀疏的二进制向量。例如,在表示颜色时,“红色”、“中国红”、“黑色”都会被映射为不同的 One-hot 向量,每个向量中只有一维为 1,其余全为 0。
局部表示的主要优点在于其良好的可解释性,便于人类专家理解和进行特征组合工程,且稀疏向量与线性模型结合时计算效率很高。然而,它存在两个突出缺点:首先,其维度极高且不可扩展,每增加一个新类别(如一种新颜色)就必须增加一维;其次,它完全无法表达类别之间的语义相似度,在模型看来,“红色”和“中国红”之间的差异与“红色”和“黑色”之间毫无区别。
与之相对的 分布式表示,则采用低维的稠密向量来编码信息。例如,所有颜色都可以用一个三维的 RGB 值向量空间中的点来表示。在这种表示中,语义相关的对象在向量空间中的位置也更接近。
分布式表示的强大之处在于其极高的表示效率,能用很低的维度概括大量信息,并且能轻松处理新样本。最重要的是,它能自然地量化样本间的相似性,这是实现高级认知功能的基础。将高维的局部表示(如 One-hot 向量)映射到低维分布式空间的过程,称为嵌入,其目标是保持原始对象之间的拓扑关系,词嵌入就是自然语言处理中的一个经典应用。
综上所述,局部表示以可解释性和计算效率见长,但代价是表达能力弱、无法表征关系;而分布式表示则以强大的信息压缩和关系表征能力为核心优势,尽管其内部机制往往像一个“黑箱”,可解释性较差。表示学习,尤其是深度学习,的核心就是自动从数据中学习出这种富含语义的、高效的分布式表示。
四、 表示学习的关键
-
核心方法:构建具有一定深度的多层次特征表示。通过多步非线性转换,从底层特征逐步抽象出高层语义表示(通常是分布式表示)。这种深层结构能指数级增加特征的表示和重用能力。
-
与传统特征学习的区别:
-
传统方法(如PCA、LDA):依赖人为设计的准则来选取特征,且特征学习与模型训练分离,所学特征不一定能优化最终性能。
-
(现代)表示学习:特征学习是与最终预测任务协同、自动进行的,目标是直接提升模型性能。
-
总结要点
表示学习是机器学习发展的关键进阶,旨在自动化地从数据中学习具有高层语义、可迁移的分布式表示,以解决语义鸿沟问题。其核心突破在于摒弃了依赖人工、解释性强但能力有限的局部表示,转而采用能够编码丰富信息与关系的低维分布式表示,并通过深层神经网络结构实现从原始数据到高级表示的端到端学习。这为深度学习在复杂任务上的成功奠定了基础。
更多推荐
所有评论(0)