1️⃣ 梯度下降的局限性

在标准梯度下降中,参数更新方向是目标函数梯度的反方向:θt+1​=θt​−η∇L(θt​)它隐含了一个关键假设:参数空间是标准欧氏空间,即各维度的单位长度相同、方向正交。

  • 当参数空间不是欧氏空间(例如概率模型的参数空间是流形)时,梯度方向不再是 “最速下降” 方向。
  • 这会导致优化路径曲折、收敛缓慢,甚至在某些方向上震荡,无法高效逼近最优解。

2️⃣ 自然梯度的引入

自然梯度(Natural Gradient)的核心思想是:在参数空间的 “真实几何结构” 上进行优化,而不是在欧氏空间中。

  • 引入黎曼度量张量 G(θ)(最常用的是 Fisher 信息矩阵 FIM)来描述参数空间的局部几何。
  • 自然梯度更新公式为:θt+1​=θt​−ηG(θt​)−1∇L(θt​)
  • 这相当于在参数空间的流形上,沿着 “测地线” 方向更新参数,从而更准确地反映了参数变化对模型输出的真实影响。

3️⃣ 优化路径对比

以一个典型的二次型函数(等高线为椭圆)为例:

  • 标准梯度下降:由于梯度方向与等高线垂直,而等高线是椭圆,所以每次更新方向并不直接指向最小值,导致优化路径呈 “Z” 字形或锯齿状,收敛缓慢。

  • 自然梯度:通过度量张量修正了更新方向,使得路径更平滑、更直接地指向最优解,避免了无效的震荡,收敛速度更快。


4️⃣ 自然梯度的优势

  1. 修正方向偏差:在非欧氏参数空间中,提供了更准确的最速下降方向。
  2. 预条件(Pre-conditioning):Fisher 信息矩阵作为预条件子,缓解了不同参数维度间尺度不一致的问题。
  3. 提升稳定性:在概率模型(如贝叶斯网络、生成模型)中,优化过程更稳定,参数更新更符合模型的概率意义。
  4. 保持模型结构:在优化条件概率的对数似然时,能更好地保持模型的内在结构和参数的可解释性。

5️⃣ 自然梯度与二阶优化的联系

  • 自然梯度与牛顿法等二阶优化方法有相似之处,都利用了曲率信息。
  • 自然梯度使用 Fisher 信息矩阵 (FIM) 来近似 Hessian 矩阵的作用:
    • 当函数流形局部曲率较小时,FIM 会增大有效步长,帮助算法跳出平坦区域,加速收敛。
    • FIM 是协方差矩阵,总是半正定的,相比 Hessian 矩阵具有更好的数值稳定性,避免了负曲率带来的问题。

6️⃣ 应用限制与挑战

  • 计算瓶颈:计算 FIM 及其逆矩阵的复杂度为 O(d2) 到 O(d3),在深度神经网络(参数维度 d 极大)中开销巨大。
  • 内存限制:存储完整的 FIM 对于大规模模型几乎不可行。
  • 研究方向
    • 使用分块对角近似Kronecker 分解等方法降低 FIM 的计算和存储复杂度。
    • 提出 K-FAC(Kronecker-factored Approximate Curvature)等高效近似算法,在保持性能的同时大幅降低计算成本。

除了自然梯度,在非欧氏空间(如流形、概率 simplex、对称正定矩阵空间等)的优化中,还有以下几类经典且实用的算法:


1. 流形梯度下降(Manifold Gradient Descent)

  • 核心思想:将优化问题直接定义在流形上,梯度更新分为两步:
    1. 在流形的切空间上计算梯度并更新;
    2. 通过 ** 投影(retraction)** 将更新后的点映射回流形。
  • 典型应用
    • 低秩矩阵优化(如矩阵补全、PCA)
    • 正交约束优化(如正交字典学习、深度网络中的正交权重约束)
  • 代表方法
    • 黎曼共轭梯度法(Riemannian conjugate gradient)
    • 黎曼信赖域法(Riemannian trust-region)

2. 投影梯度下降(Projected Gradient Descent, PGD)

  • 核心思想:在欧氏空间中执行梯度下降,然后通过投影操作将参数约束到非欧氏可行域内。
  • 典型应用
    • 概率 simplex 优化(如分类器的 softmax 输出、概率分布参数)
    • 非负约束优化(如非负矩阵分解)
    • 球面上的优化(如单位范数向量)
  • 特点:实现简单,是处理凸约束下非欧氏空间优化的常用基线。

3. 黎曼牛顿法(Riemannian Newton's Method)

  • 核心思想:将牛顿法推广到黎曼流形上,利用流形的曲率信息(黎曼 Hessian)来修正更新方向。
  • 优势:相比流形梯度下降,收敛速度更快,能达到二次收敛。
  • 应用场景
    • 对称正定矩阵空间(SPD)上的优化(如度量学习、协方差矩阵估计)
    • 格拉斯曼流形(Grassmannian)上的子空间学习

4. 概率空间优化(Optimization on Probability Spaces)

  • 核心思想:直接在概率分布空间(如 Wasserstein 空间)上进行优化,利用最优传输理论。
  • 代表方法
    • Wasserstein 梯度下降:在 Wasserstein 空间中沿 Wasserstein 梯度方向更新分布,常用于生成模型(如 WGAN)。
    • 信息几何优化:除了自然梯度,还包括基于 α- 连接、Bregman 散度的优化方法。

5. 几何感知深度学习优化

  • 核心思想:在深度网络中显式地将参数约束在特定几何结构上,并用对应的优化算法更新。
  • 典型应用
    • 正交权重网络:使用 Cayley 变换或 Householder 反射保持权重矩阵的正交性。
    • SPD 网络层:在 SPD 空间上定义神经网络层,并用黎曼优化训练。

6. 约束优化方法

  • 核心思想:将非欧氏空间的约束显式地融入优化目标,使用拉格朗日乘子或增广拉格朗日方法求解。
  • 代表方法
    • 增广拉格朗日法(Augmented Lagrangian)
    • 交替方向乘子法(ADMM)
  • 应用场景:处理复杂的非凸、非欧氏约束,如在计算机视觉中的姿态估计、结构重建等问题。

非欧氏空间优化算法对比表

算法 / 方法 核心思想 适用空间 / 约束 收敛速度 计算复杂度 典型应用
自然梯度 引入黎曼度量张量(如 FIM)修正梯度方向,在流形上优化 概率分布空间、参数流形 较快(优于 SGD) 高(需计算 FIM 及其逆) 概率模型、生成模型、贝叶斯推断
流形梯度下降 切空间梯度更新 + 投影回流形 一般黎曼流形(如 Stiefel、Grassmannian) 线性 中等(依赖流形结构) 低秩矩阵学习、正交权重约束、子空间学习
投影梯度下降 (PGD) 欧氏梯度下降后,将结果投影到可行域 凸约束空间(如概率单纯形、非负矩阵、单位球面) 线性 低(投影操作简单) 分类器概率输出、非负矩阵分解、单位范数向量优化
黎曼牛顿法 推广牛顿法到流形,利用黎曼 Hessian 对称正定矩阵空间(SPD)、格拉斯曼流形 二次收敛 很高(需计算 Hessian) 度量学习、协方差矩阵估计、子空间跟踪
Wasserstein 梯度下降 在 Wasserstein 空间中沿最优传输梯度方向更新分布 概率分布空间(Wasserstein 空间) 中等 高(需求解最优传输) 生成对抗网络(WGAN)、分布匹配、图像生成
信息几何优化 基于 α- 连接、Bregman 散度的几何优化 指数族分布空间 较快 中高(依赖散度计算) 指数族模型拟合、信息论约束下的优化
ADMM 交替方向乘子法,分解复杂约束 一般凸 / 非凸约束空间 线性 中高(多步交替优化) 计算机视觉姿态估计、结构重建、分布式优化

更多推荐