译自英文

ConvNeXt是一种纯卷积神经网络架构,它借鉴了Transformer的设计理念对标准卷积网络进行了现代化改造,在视觉基准测试中取得了具有竞争力的性能。

ConvNeXt是一个纯卷积神经网络架构家族,由Facebook AI Research(现为Meta AI)的研究人员于2022年提出。它旨在缩小传统卷积网络与视觉Transformer(ViT)之间的性能差距,同时保留卷积的简单性和效率。其名称是“卷积”和“下一个”的组合词,表明其作为经典卷积网络设计(如ResNet)的现代继承者的角色。

该架构在论文《A ConvNet for the 2020s》中提出,作者为Zhuang Liu、Hanzi Mao、Chao-Yuan Wu、Christoph Feichtenhofer、Trevor Darrell和Saining Xie。该工作通过引入来自Transformer的设计策略,如分块化主干、深度卷积、倒置瓶颈块和更大的卷积核尺寸,系统性地现代化了标准ResNet。其结果是,在图像分类、目标检测和语义分割任务中,该模型家族在多种配置下以更少的参数和FLOPs匹配或超越了视觉Transformer的准确性。

设计原则

ConvNeXt从标准ResNet-50出发,应用一系列增量修改,每一步都通过受控实验进行验证。关键更改包括:

  • 分块化主干:将初始的7x7步长为2的卷积层替换为4x4步长为4的非重叠卷积,类似于视觉Transformer中的分块嵌入。
  • 深度卷积:将每个块中的3x3卷积替换为深度卷积,即对每个输入通道应用单个滤波器,从而减少计算量和参数。
  • 倒置瓶颈:将块结构改为宽-窄-宽模式(扩展比为4),其中1x1卷积用于扩展和压缩通道,模仿Transformer中的MLP块。
  • 更大的卷积核尺寸:将卷积核尺寸从3x3增加到7x7,以改善感受野和性能。
  • 更少的激活函数:用GELU(高斯误差线性单元)替换ReLU,并将每个块的激活层数量减少到一个。
  • 层归一化:用LayerNorm替换整个网络中的BatchNorm,这一转变与Transformer实践一致。
  • 独立的下采样层:下采样使用步长为2的2x2卷积层,放置在阶段之间,而不是集成到每个阶段的第一个块中。

这些更改逐步应用,每一步都在ImageNet上提高准确性,最终形成一个显著优于原始ResNet的模型。

模型变体

ConvNeXt提供多种配置,遵循ResNet的命名约定:ConvNeXt-T(微型)、ConvNeXt-S(小型)、ConvNeXt-B(基础)、ConvNeXt-L(大型)和ConvNeXt-XL(超大型)。基础模型约有8900万个参数,在ImageNet-1K上无需外部数据即可达到82.8%的top-1准确率。当在更大数据集(如ImageNet-21K)上预训练或使用弱监督数据时,较大变体可达到超过87%的top-1准确率。

该架构还包括一个名为ConvNeXt V2的变体,于2023年发布,引入了全卷积掩码自编码器用于自监督预训练。该版本提高了样本效率和鲁棒性,在多个基准上取得了最先进的结果。

性能与比较

在ImageNet-1K分类基准上,ConvNeXt-B在224x224输入下达到83.8%的top-1准确率,略高于DeiT-B视觉Transformer(81.8%),与Swin Transformer(83.5%)相当。在使用Mask R-CNN进行目标检测时,ConvNeXt骨干在box AP和mask AP方面均优于ResNet和Swin Transformer。对于使用UperNet的语义分割,ConvNeXt-L在ADE20K上达到53.1%的mIoU,比Swin-L高出0.6个百分点。

一个显著优势是,ConvNeXt模型在推理期间比Transformer更节省内存,因为它们不需要存储注意力矩阵。这使得它们非常适合在边缘设备和实时应用中部署,包括来自AppleSamsung等公司优化机器学习的端侧应用。

影响与启示

ConvNeXt的引入表明,卷积网络并未过时,可以现代化以与基于注意力的架构竞争。它影响了后续结合卷积和注意力的混合模型研究,如ConvNeXt V2和各种高效视觉骨干。其设计原则也被应用于其他领域,包括音频和视频处理,在这些领域中,该架构的归纳偏置是有益的。

MIT CSAILStanford AI Lab等机构的研究人员将ConvNeXt视为理解卷积与注意力之间权衡的关键参考。其代码和预训练模型在宽松许可证下开源,促进了学术界和工业界的广泛采用。

局限性与未来方向

尽管有其优势,ConvNeXt仍依赖手动设计的架构,而Transformer则受益于跨模态的缩放定律和统一架构。一些研究表明,与Transformer相比,ConvNeXt在非常大的数据集上的性能提升会减弱,而Transformer擅长捕捉长距离依赖。未来的工作已探索集成动态卷积或专家混合以进一步增强容量。

截至2024年,ConvNeXt仍是计算机视觉中的强基线,常被用作许多应用的默认骨干。其原则已被纳入FastViT和RepViT等更新架构中,这些架构旨在为移动和实时场景平衡效率与准确性。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:computer-vision·convolutional-neural-network·deep-learning·image-classification
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史