梯度下降的局限性与解决办法(自然梯度…)以及梯度下降的应用
·
1️⃣ 梯度下降的局限性
在标准梯度下降中,参数更新方向是目标函数梯度的反方向:θt+1=θt−η∇L(θt)它隐含了一个关键假设:参数空间是标准欧氏空间,即各维度的单位长度相同、方向正交。
- 当参数空间不是欧氏空间(例如概率模型的参数空间是流形)时,梯度方向不再是 “最速下降” 方向。
- 这会导致优化路径曲折、收敛缓慢,甚至在某些方向上震荡,无法高效逼近最优解。
2️⃣ 自然梯度的引入
自然梯度(Natural Gradient)的核心思想是:在参数空间的 “真实几何结构” 上进行优化,而不是在欧氏空间中。
- 引入黎曼度量张量 G(θ)(最常用的是 Fisher 信息矩阵 FIM)来描述参数空间的局部几何。
- 自然梯度更新公式为:θt+1=θt−ηG(θt)−1∇L(θt)
- 这相当于在参数空间的流形上,沿着 “测地线” 方向更新参数,从而更准确地反映了参数变化对模型输出的真实影响。
3️⃣ 优化路径对比
以一个典型的二次型函数(等高线为椭圆)为例:
-
标准梯度下降:由于梯度方向与等高线垂直,而等高线是椭圆,所以每次更新方向并不直接指向最小值,导致优化路径呈 “Z” 字形或锯齿状,收敛缓慢。
-
自然梯度:通过度量张量修正了更新方向,使得路径更平滑、更直接地指向最优解,避免了无效的震荡,收敛速度更快。
4️⃣ 自然梯度的优势
- 修正方向偏差:在非欧氏参数空间中,提供了更准确的最速下降方向。
- 预条件(Pre-conditioning):Fisher 信息矩阵作为预条件子,缓解了不同参数维度间尺度不一致的问题。
- 提升稳定性:在概率模型(如贝叶斯网络、生成模型)中,优化过程更稳定,参数更新更符合模型的概率意义。
- 保持模型结构:在优化条件概率的对数似然时,能更好地保持模型的内在结构和参数的可解释性。
5️⃣ 自然梯度与二阶优化的联系
- 自然梯度与牛顿法等二阶优化方法有相似之处,都利用了曲率信息。
- 自然梯度使用 Fisher 信息矩阵 (FIM) 来近似 Hessian 矩阵的作用:
- 当函数流形局部曲率较小时,FIM 会增大有效步长,帮助算法跳出平坦区域,加速收敛。
- FIM 是协方差矩阵,总是半正定的,相比 Hessian 矩阵具有更好的数值稳定性,避免了负曲率带来的问题。
6️⃣ 应用限制与挑战
- 计算瓶颈:计算 FIM 及其逆矩阵的复杂度为 O(d2) 到 O(d3),在深度神经网络(参数维度 d 极大)中开销巨大。
- 内存限制:存储完整的 FIM 对于大规模模型几乎不可行。
- 研究方向:
- 使用分块对角近似、Kronecker 分解等方法降低 FIM 的计算和存储复杂度。
- 提出 K-FAC(Kronecker-factored Approximate Curvature)等高效近似算法,在保持性能的同时大幅降低计算成本。
除了自然梯度,在非欧氏空间(如流形、概率 simplex、对称正定矩阵空间等)的优化中,还有以下几类经典且实用的算法:
1. 流形梯度下降(Manifold Gradient Descent)
- 核心思想:将优化问题直接定义在流形上,梯度更新分为两步:
- 在流形的切空间上计算梯度并更新;
- 通过 ** 投影(retraction)** 将更新后的点映射回流形。
- 典型应用:
- 低秩矩阵优化(如矩阵补全、PCA)
- 正交约束优化(如正交字典学习、深度网络中的正交权重约束)
- 代表方法:
- 黎曼共轭梯度法(Riemannian conjugate gradient)
- 黎曼信赖域法(Riemannian trust-region)
2. 投影梯度下降(Projected Gradient Descent, PGD)
- 核心思想:在欧氏空间中执行梯度下降,然后通过投影操作将参数约束到非欧氏可行域内。
- 典型应用:
- 概率 simplex 优化(如分类器的 softmax 输出、概率分布参数)
- 非负约束优化(如非负矩阵分解)
- 球面上的优化(如单位范数向量)
- 特点:实现简单,是处理凸约束下非欧氏空间优化的常用基线。
3. 黎曼牛顿法(Riemannian Newton's Method)
- 核心思想:将牛顿法推广到黎曼流形上,利用流形的曲率信息(黎曼 Hessian)来修正更新方向。
- 优势:相比流形梯度下降,收敛速度更快,能达到二次收敛。
- 应用场景:
- 对称正定矩阵空间(SPD)上的优化(如度量学习、协方差矩阵估计)
- 格拉斯曼流形(Grassmannian)上的子空间学习
4. 概率空间优化(Optimization on Probability Spaces)
- 核心思想:直接在概率分布空间(如 Wasserstein 空间)上进行优化,利用最优传输理论。
- 代表方法:
- Wasserstein 梯度下降:在 Wasserstein 空间中沿 Wasserstein 梯度方向更新分布,常用于生成模型(如 WGAN)。
- 信息几何优化:除了自然梯度,还包括基于 α- 连接、Bregman 散度的优化方法。
5. 几何感知深度学习优化
- 核心思想:在深度网络中显式地将参数约束在特定几何结构上,并用对应的优化算法更新。
- 典型应用:
- 正交权重网络:使用 Cayley 变换或 Householder 反射保持权重矩阵的正交性。
- SPD 网络层:在 SPD 空间上定义神经网络层,并用黎曼优化训练。
6. 约束优化方法
- 核心思想:将非欧氏空间的约束显式地融入优化目标,使用拉格朗日乘子或增广拉格朗日方法求解。
- 代表方法:
- 增广拉格朗日法(Augmented Lagrangian)
- 交替方向乘子法(ADMM)
- 应用场景:处理复杂的非凸、非欧氏约束,如在计算机视觉中的姿态估计、结构重建等问题。
非欧氏空间优化算法对比表
| 算法 / 方法 | 核心思想 | 适用空间 / 约束 | 收敛速度 | 计算复杂度 | 典型应用 |
|---|---|---|---|---|---|
| 自然梯度 | 引入黎曼度量张量(如 FIM)修正梯度方向,在流形上优化 | 概率分布空间、参数流形 | 较快(优于 SGD) | 高(需计算 FIM 及其逆) | 概率模型、生成模型、贝叶斯推断 |
| 流形梯度下降 | 切空间梯度更新 + 投影回流形 | 一般黎曼流形(如 Stiefel、Grassmannian) | 线性 | 中等(依赖流形结构) | 低秩矩阵学习、正交权重约束、子空间学习 |
| 投影梯度下降 (PGD) | 欧氏梯度下降后,将结果投影到可行域 | 凸约束空间(如概率单纯形、非负矩阵、单位球面) | 线性 | 低(投影操作简单) | 分类器概率输出、非负矩阵分解、单位范数向量优化 |
| 黎曼牛顿法 | 推广牛顿法到流形,利用黎曼 Hessian | 对称正定矩阵空间(SPD)、格拉斯曼流形 | 二次收敛 | 很高(需计算 Hessian) | 度量学习、协方差矩阵估计、子空间跟踪 |
| Wasserstein 梯度下降 | 在 Wasserstein 空间中沿最优传输梯度方向更新分布 | 概率分布空间(Wasserstein 空间) | 中等 | 高(需求解最优传输) | 生成对抗网络(WGAN)、分布匹配、图像生成 |
| 信息几何优化 | 基于 α- 连接、Bregman 散度的几何优化 | 指数族分布空间 | 较快 | 中高(依赖散度计算) | 指数族模型拟合、信息论约束下的优化 |
| ADMM | 交替方向乘子法,分解复杂约束 | 一般凸 / 非凸约束空间 | 线性 | 中高(多步交替优化) | 计算机视觉姿态估计、结构重建、分布式优化 |
更多推荐


所有评论(0)