引言:一个“反常识”的突破

在深度学习的发展史上,2015年是一个值得被反复提及的年份。那一年,微软亚洲研究院的何恺明团队发表了一篇论文,提出了一种名为残差网络(Residual Network,ResNet) 的架构,在ImageNet大规模视觉识别挑战赛(ILSVRC)中以3.57%的top-5错误率一举夺魁——这个成绩首次超越了人类水平

但ResNet真正令人震撼的,不是它在竞赛中的夺冠,而是一个在当时看来近乎“反常识”的事实:它成功训练了一个152层的超深网络

在ResNet之前,深度学习领域有一个心照不宣的“天花板”:网络层数一旦突破20层,训练就变得极为困难,准确率甚至会出现不升反降的怪象。VGGNet达到了19层,已经是当时深度的极限。而ResNet不仅跨过了这个门槛,还把这个数字提升了一个数量级。更令人惊叹的是,后续的研究者基于ResNet的思想,成功训练出了1001层的网络。

是什么魔法让ResNet突破了深度的诅咒?答案就藏在四个字里——恒等映射(Identity Mapping)


第一章:深度网络的两大“诅咒”

要理解ResNet的伟大,首先要理解它解决了什么问题。在ResNet问世之前,深度网络的训练主要面临两重障碍。

1.1 梯度消失与梯度爆炸

神经网络通过反向传播(Backpropagation) 来学习——将输出端的误差信号逐层回传,每一层根据这个信号调整自己的权重。问题在于:当信号经过几十层网络向后传播时,它会一次又一次地被小数(或大数)相乘。

如果这些乘数多数小于1,梯度就会指数级衰减,等到传回浅层时,信号已经微弱到几乎无法驱动任何有效的学习。这就是梯度消失(Vanishing Gradient)。反之,如果乘数大于1,梯度则会指数级爆炸,导致参数更新剧烈震荡、训练崩溃。

早期的解决方案包括逐层预训练谨慎的初始化批归一化(Batch Normalization)。批归一化的引入让几十层的网络训练成为可能,但依然无法突破更深的极限。

1.2 退化问题:比梯度消失更致命的敌人

即使通过BN解决了梯度消失,研究者们又撞上了第二堵墙——退化问题(Degradation Problem)

按理说,更深的网络应该至少不弱于它的浅层版本。一个直观的想象是:如果我把一个20层的网络训练好了,然后在它后面再堆叠30层,只要这新增的30层什么都不做(即恒等映射),那么50层网络的性能至少应该和20层一样好。

然而现实令人沮丧。实验表明,56层网络的训练误差反而高于20层网络。这不是过拟合(过拟合表现为训练误差低、测试误差高),而是优化失败——网络根本找不到一组能让“新增层什么都不做”的权重参数。

深度学习之父之一Yann LeCun曾指出:让网络层“什么都不做”,恰好是神经网络最难解决的问题之一。


第二章:残差学习——把“难题”倒过来

2.1 换个思路:不学H(x),学H(x)-x

面对“学习恒等映射太难”的困境,何恺明团队提出了一个极为巧妙的思路转变。

假设我们希望某一段网络(由若干层堆叠而成)学习到的目标映射是 H(x)——即输入x经过这些层后期望的输出。传统网络直接让这些层去拟合 H(x) 本身。

残差网络不这么做。它让这些层去拟合残差映射 F(x) = H(x) - x

于是,原本的目标输出 H(x) 被改写为:

H(x) = F(x) + x

这个“+x”的操作,就是通过一条捷径连接(Shortcut Connection,也称跳跃连接) 实现的——输入x不经过中间层的任何变换,直接与中间层的输出F(x)相加,得到最终输出。

2.2 为什么学残差更容易?

关键在于“学习目标”的难度发生了质变

如果网络需要实现的是恒等映射(即H(x) = x),那么在残差结构中,网络只需要让 F(x) = 0 就行了。让一组层的输出逼近0,远比让它们逼近一个特定的输入值x要容易得多——借助权重衰减等正则化手段,网络天然地倾向于让权重向零靠拢。

如果目标映射H(x)与恒等映射相差不大,那么网络需要学习的只是一个微小的“修正量”F(x),而非从零开始构建整个映射关系。这就好比让你直接画一幅蒙娜丽莎很难,但让你在已有的底稿上做细微的润色(残差)就简单多了。

何恺明在论文中用了一个生动的比喻:如果最优解更接近恒等映射,那么优化器更容易发现这个“微小扰动”而非重新学习全部内容。


第三章:恒等映射的魔力——让梯度“直达”

ResNet训练千层网络的真正秘密,在于恒等映射为梯度提供了一条“无损高速公路”

3.1 数学上发生了什么

考虑一个残差块:x_{l+1} = x_l + F(x_l, W_l)

如果我们忽略F(x)的细节,只关注从第l层到第L层的正向传播:

x_L = x_l + Σ F(x_i, W_i)

反向传播时,损失函数对x_l的梯度(即误差信号要传回浅层所需经过的路径)为:

∂Loss/∂x_l = ∂Loss/∂x_L * (1 + ∂/∂x_l Σ F)

注意括号中的这个 “1” 。它来源于恒等映射路径。

这意味着:即使后面的残差路径F的梯度趋近于零,梯度依然可以通过这个“1”无损地从深层直接回传到浅层

这就是ResNet的核心数学保证——在信息流经上百层网络时,浅层总能接收到来自深层的、未经衰减的梯度信号

3.2 如果去掉“1”,会怎样?

何恺明团队在后续的论文《Identity Mappings in Deep Residual Networks》中,通过实验验证了恒等映射的重要性。他们尝试将捷径连接上的恒等映射替换为其他形式,比如:

  • 缩放(Scaling):在捷径上乘以一个系数λ(如0.5),即 h(x) = λx

  • 门控(Gating):引入可学习的门控机制

  • 1×1卷积:在捷径上增加参数

结果令人警醒:所有对恒等映射的“改进”都导致了更高的训练误差和更差的性能

为什么?因为一旦捷径上带有参数或缩放,反向传播的梯度公式会变成:

∂Loss/∂x_l = ∂Loss/∂x_L * (Π h'_i + ...)

当L很大时(即网络很深),如果h'_i < 1,梯度会指数级衰减;如果h'_i > 1,梯度会指数级爆炸。这恰恰是ResNet试图解决的问题!只有恒等映射(h' = 1) 才能确保梯度的稳定传递。

3.3 范数保持:更深反而更稳

最新的理论研究表明,ResNet还有一层更深的“护身符”。

一篇发表于arXiv的论文《Norm-Preservation: Why Residual Networks Can Become Extremely Deep?》从理论上证明:在ResNet中,每个残差块都在一定程度上保持范数(Norm-Preserving)——即梯度经过一个残差块后,其大小基本不变。

更令人惊讶的是该研究的另一个发现:随着网络层数增加,ResNet的这种“范数保持”特性反而会增强(δ随着L增大而变小)。这意味着:

  • 网络越深,信号在传播过程中的衰减或放大越小

  • 梯度消失和梯度爆炸的风险被自动控制

  • 优化过程更加稳定

这解释了为什么ResNet能在152层甚至1001层时依然稳定训练,而传统网络在30层就已经举步维艰。


第四章:从理论到实践——让“干净”的路径成为可能

4.1 “预激活”:更彻底的恒等映射

在原始的ResNet设计中,残差块的结构是“卷积→BN→ReLU→卷积→BN→ReLU”,其中ReLU激活函数位于加法操作之后。

何恺明团队在后续研究中发现:为了让恒等映射路径真正“干净”,应该把激活函数(BN和ReLU)移到卷积层之前,即形成“BN→ReLU→卷积”的顺序。这种设计被称为预激活(Pre-activation) 结构。

在预激活结构中,信息从输入到输出的恒等路径上没有任何非线性操作“阻挡”,梯度可以最纯粹地直接流动。基于这一设计,他们在CIFAR上成功训练了1001层的ResNet,且比原始版本更容易训练、泛化能力更好。

4.2 ResNet之后——成为现代深度学习的基石

ResNet的影响早已超越了计算机视觉领域。如今,从Transformer(GPT、LLaMA等大语言模型)到扩散模型(Stable Diffusion),几乎所有主流深度学习架构都在使用残差连接。

在Transformer中,每一层都由“多头自注意力 + 残差连接”和“前馈网络 + 残差连接”构成——如果不加残差连接,数十层Transformer的梯度根本无法有效传播。可以说,没有残差连接,就没有今天的大模型时代


结语:最伟大的创新往往最简单

复盘ResNet的成功,一个引人深思的事实是:它的核心思想极其简洁——只是加上了一条捷径连接,把学习目标从H(x)换成了F(x)+x。

但正是这种“简单”,切中了深度学习的要害。ResNet教会了我们三件事:

  1. 改变问题本身的定义,有时比寻找更复杂的解法更有效——当学习H(x)太难时,不妨去学H(x)-x

  2. 为信息(和梯度)保留一条“干净”的通道,比堆砌复杂模块更重要——恒等映射的“1”,胜过千般精巧的设计

  3. 大道至简——最持久的技术突破,往往建立在最清晰的数学原理之上

从2015年至今,ResNet已经走过了十年。在这十年里,Transformer等新架构不断涌现,但残差连接依然是所有深度网络的共同语言。理解恒等映射的魔力,就是理解深度学习何以能“深”到今天这个地步的钥匙。


参考文献:

  1. Deep Residual Learning for Image Recognition (He et al., CVPR 2016)

  2. Identity Mappings in Deep Residual Networks (He et al., ECCV 2016)

  3. Norm-Preservation: Why Residual Networks Can Become Extremely Deep? (arXiv:1805.07477)

更多推荐