SENet,全称为Squeeze-and-Excitation Networks,是一种深度学习架构,通过建模通道间的依赖关系来增强神经网络的表示能力。它由Jie Hu、Li Shen和Gang Sun于2018年提出,并赢得了当年ImageNet大规模视觉识别挑战赛(ILSVRC)。其核心创新是挤压与激励(SE)模块,该模块通过显式建模通道间的相互依赖关系,自适应地重新校准通道特征响应。这一机制使网络能够强调信息丰富的特征并抑制不太有用的特征,从而以仅适度的计算成本增加来提高准确性。
SE模块可以集成到各种基础架构中,最著名的是残差网络(ResNets),在其中它们被插入到残差模块中。通过应用通道注意力,SENet在图像分类任务上取得了显著的性能提升,其在ImageNet数据集上的top-1错误率为2.25%,较之前的最先进模型有了大幅改进。该架构也已扩展到其他领域,包括目标检测和语义分割,并影响了深度学习中后续的注意力机制。
挤压与激励模块
SE模块作用于形状为H × W × C的特征图U,其中H和W是空间维度,C是通道数。它包含两个主要操作:挤压和激励。
挤压:在空间维度上应用全局平均池化,生成长度为C的通道描述符z。此操作聚合全局空间信息,捕获每个通道的平均响应。形式上,对于每个通道c,z_c = (1/(H×W)) Σ_{i=1}^{H} Σ_{j=1}^{W} u_{c}(i,j),其中u_c是U的第c个通道。
激励:通道描述符通过一个小型门控机制,通常是两层全连接网络。第一层将维度降至C/r(其中r是缩减比,通常为16),随后是ReLU激活,第二层将维度扩展回C,随后是sigmoid激活。这产生一组逐通道缩放权重s,其中s = σ(W_2 δ(W_1 z)),W_1和W_2是学习到的权重矩阵,δ表示ReLU,σ表示sigmoid函数。
最终输出通过重新缩放原始特征图获得:x̂_c = s_c · u_c,其中s_c是通道c的缩放权重。这种重新校准强调了对于任务更具信息量的通道。
与残差网络的集成
SENet通常通过将SE模块插入ResNet的残差模块中来实现。在标准残差模块中,输入x与卷积子网络F(x)的输出相加,得到x + F(x)。在SE-ResNet模块中,SE模块在残差相加之前应用于卷积层的输出。具体来说,在模块中的最后一次卷积之后,特征图通过SE模块以产生重新校准的特征,然后将其添加到跳跃连接中。
这种集成使网络能够学习通道级注意力,同时保留残差连接的优势,如稳定的训练和梯度流动。SE模块增加了少量参数(每个模块约2C²/r)和可忽略的计算量,使其对于深层网络而言是高效的。
性能与影响
SENet在ImageNet分类基准上实现了2.25%的top-5错误率,超过了之前冠军的2.99% top-5错误率。这一结果证明了通道注意力在提高准确性方面的有效性。该架构在CIFAR-10和CIFAR-100等其他基准上也表现良好,并被适配用于目标检测和实例分割等任务,在COCO数据集上提高了平均精度(mAP)。
SENet的成功推动了神经网络中注意力机制的研究。它影响了后来的架构,如transformer中的multi-head attention,尽管transformer使用了不同形式的注意力。SE模块现在已成为许多最先进模型的常见组件,包括用于图像分类、分割甚至自然语言处理的模型。
数学表述
给定输入特征图U,SE模块按上述方式计算缩放向量s。挤压操作使用全局平均池化,这是一种空间信息聚合形式。激励操作使用瓶颈架构来捕获通道间的依赖关系。最终缩放是简单的逐元素乘法。
缩减比r控制门控机制的容量。较小的r会增加参数数量,但可能提高性能,而较大的r会降低计算成本。在实践中,r=16是平衡准确性和效率的常见选择。
变体与扩展
已提出了SE模块的几种变体。例如,并发空间与通道挤压与激励(scSE)模块将注意力同时应用于空间和通道维度。另一种变体,收集与激发(GE)模块,使用了不同的聚合策略。这些扩展旨在提高注意力机制的灵活性和有效性。
SE模块也已与其他技术结合,如batch normalization和dropout,以进一步稳定训练。在一些工作中,SE模块被插入到非残差架构中,如用于医学图像分割的U-Net,从而带来性能提升。
SE块的一个关键优势是其计算开销较低。对于典型的ResNet-50,添加SE块会使参数数量增加约10%,但浮点运算量(FLOPs)的增加不到1%。这使得SENet适合部署在资源受限的设备上,例如手机,在这些设备上效率至关重要。
压缩操作使用全局平均池化,这在计算上成本较低。激励操作涉及两个全连接层,但缩减比率保持了参数数量的小规模。因此,SE块可以添加到几乎任何卷积网络中,而不会在速度上造成显著性能下降。
与注意力机制的关系
SENet通常被描述为一种通道注意力形式,因为它学习关注重要的通道。这在概念上类似于其他领域的注意力机制,例如自然语言处理中的transformers,其中注意力权重在标记上计算。然而,SE块在特征图上操作,不涉及空间注意力。后来的工作,如卷积块注意力模块(CBAM),结合了通道和空间注意力,基于SENet的思想进行了扩展。
SENet的成功凸显了深度学习中特征重新校准的重要性。它表明并非所有通道都同等重要,学习对它们进行加权可以带来显著的准确性提升。这一原则已被现代架构广泛采用。
遗产与影响
SENet已成为许多深度学习模型中的标准组件。其影响超越了图像分类,扩展到一般深度学习等领域,在这些领域中注意力机制现已无处不在。该架构常被用作评估新注意力方法的基线。
在更广泛的领域背景下,SENet推动了通过架构创新而非仅仅增加深度或宽度来改进神经网络的趋势。它证明了精心设计的模块可以带来实质性改进,激发了其他领域的类似方法。
截至2020年代初,SE块在研究和工业中仍被广泛使用。它们已在TensorFlow和PyTorch等流行的深度学习框架中实现,并可在模型库中获得。压缩与激励的原理继续为基于注意力的架构的新发展提供信息。