要理解深度学习,必须突破常规视角去理解优化
·
普林斯顿教授Sanjeev Arora指出,传统优化观点仅关注目标值与收敛速度,对深度学习远远不够。深度学习的许多重要特性无法从目标值中反映,需超越常规视角。
常规优化的局限
深度学习通常定义为定义目标函数并用梯度下降优化。但实践中,即使训练目标接近零,泛化效果仍可能良好或很差。目标值与泛化能力无必然关联。梯度下降本身就能找到泛化良好的解,而加速方法有时反而损害泛化。这说明“过程比结果更重要”。
两个说明性案例
无限宽网络:当网络宽度趋于无穷时,梯度下降轨迹等价于核回归问题,核为神经正切核(NTK)。研究显示,基于NTK的核回归在CIFAR10上可达77.4%准确率,优于任何已知核。
深度矩阵分解:在矩阵完备化任务中,用三层以上线性网络进行梯度下降,效果优于传统核范数最小化方法,尤其在数据稀疏时更明显。这种对低秩解的偏置无法被核范数捕捉。值得注意的是,Adam虽加速优化,却略损泛化。
结论
传统优化只关心目标值与收敛速度,但GD、SGD、Adam等不同策略会引出不同的优化轨迹,最终得到泛化能力各异的解。我们需要新的数学工具来理解这些轨迹——包括初始化、动力系统等——超越当前只关注驻点、梯度范数、Hessian范数的“景观视图”。
更多推荐
所有评论(0)