ConvNeXt est une famille d'architectures de réseaux de neurones purement convolutionnels introduite en 2022 par des chercheurs de Facebook AI Research (désormais Meta AI). Elle a été conçue pour combler l'écart de performance entre les réseaux convolutionnels traditionnels et les Vision Transformers (ViTs) tout en conservant la simplicité et l'efficacité des convolutions. Le nom est un mot-valise de « convolution » et « next », signifiant son rôle de successeur moderne des conceptions ConvNet classiques comme le ResNet.
L'architecture a été proposée dans l'article « A ConvNet for the 2020s » par Zhuang Liu, Hanzi Mao, Chao-Yuan Wu, Christoph Feichtenhofer, Trevor Darrell et Saining Xie. Le travail a systématiquement modernisé le ResNet standard en incorporant des stratégies de conception issues des Transformers, telles que le tronc en patchs, les convolutions depthwise, les blocs à goulot inversé et des tailles de noyaux plus grandes. Le résultat est une famille de modèles qui égalent ou dépassent la précision des Vision Transformers sur les tâches de classification d'images, de détection d'objets et de segmentation sémantique, tout en utilisant moins de paramètres et de FLOPs dans de nombreuses configurations.
Principes de conception
ConvNeXt part d'un ResNet-50 standard et applique une série de modifications incrémentales, chacune validée par des expériences contrôlées. Les changements clés incluent :
- Tronc en patchs : La couche convolutionnelle initiale de 7x7 avec pas de 2 est remplacée par une convolution non chevauchante de 4x4 avec pas de 4, similaire à l'incorporation de patchs dans les Vision Transformers.
- Convolutions depthwise : Les convolutions 3x3 dans chaque bloc sont remplacées par des convolutions depthwise, qui appliquent un filtre unique par canal d'entrée, réduisant le calcul et les paramètres.
- Goulot inversé : La structure du bloc est modifiée en un motif large-étroit-large (ratio d'expansion de 4), où les convolutions 1x1 expandent et compressent les canaux, imitant les blocs MLP des Transformers.
- Tailles de noyaux plus grandes : La taille du noyau est augmentée de 3x3 à 7x7, ce qui améliore le champ réceptif et la performance.
- Moins de fonctions d'activation : GELU (Gaussian Error Linear Unit) remplace ReLU, et le nombre de couches d'activation est réduit à une par bloc.
- Normalisation de couche : LayerNorm remplace BatchNorm dans tout le réseau, un changement aligné avec les pratiques des Transformers.
- Couches de sous-échantillonnage séparées : Le sous-échantillonnage est effectué à l'aide de couches convolutionnelles 2x2 avec pas de 2, placées entre les étapes, plutôt que d'être intégré dans le premier bloc de chaque étape.
Ces changements sont appliqués progressivement, chaque étape améliorant la précision sur ImageNet, culminant en un modèle qui surpasse le ResNet original par une marge significative.
Variantes du modèle
ConvNeXt est disponible en plusieurs configurations, suivant la convention de nommage de ResNet : ConvNeXt-T (tiny), ConvNeXt-S (small), ConvNeXt-B (base), ConvNeXt-L (large) et ConvNeXt-XL (extra large). Le modèle de base a environ 89 millions de paramètres et atteint une précision top-1 de 82,8 % sur ImageNet-1K sans données externes. Lorsqu'il est pré-entraîné sur des ensembles de données plus grands comme ImageNet-21K ou avec des données faiblement supervisées, les variantes plus grandes atteignent plus de 87 % de précision top-1.
L'architecture comprend également une variante appelée ConvNeXt V2, publiée en 2023, qui introduit un autoencodeur masqué entièrement convolutionnel pour le pré-entraînement auto-supervisé. Cette version améliore l'efficacité des échantillons et la robustesse, atteignant des résultats de pointe sur plusieurs benchmarks.
Performance et comparaisons
Sur le benchmark de classification ImageNet-1K, ConvNeXt-B atteint une précision top-1 de 83,8 % avec une entrée de 224x224, légèrement supérieure au DeiT-B Vision Transformer (81,8 %) et comparable au Swin Transformer (83,5 %). Pour la détection d'objets avec Mask R-CNN, les backbones ConvNeXt surpassent à la fois ResNet et Swin Transformer en termes de box AP et mask AP. Pour la segmentation sémantique avec UperNet, ConvNeXt-L atteint 53,1 % de mIoU sur ADE20K, dépassant Swin-L de 0,6 points.
Un avantage notable est que les modèles ConvNeXt sont plus efficaces en mémoire que les Transformers pendant l'inférence, car ils ne nécessitent pas de stocker les matrices d'attention. Cela les rend attrayants pour le déploiement sur des appareils de périphérie et dans des applications en temps réel, y compris celles d'entreprises comme Apple et Samsung qui optimisent pour l'apprentissage automatique sur appareil.
Impact et influence
L'introduction de ConvNeXt a démontré que les réseaux convolutionnels n'étaient pas obsolètes et pouvaient être modernisés pour concurrencer les architectures basées sur l'attention. Elle a influencé la recherche ultérieure sur les modèles hybrides combinant convolutions et attention, tels que ConvNeXt V2 et divers backbones visuels efficaces. Les principes de conception ont également été adoptés dans d'autres domaines, notamment le traitement audio et vidéo, où les biais inductifs de l'architecture sont bénéfiques.
Des chercheurs d'institutions comme MIT CSAIL et Stanford AI Lab ont cité ConvNeXt comme référence clé pour comprendre les compromis entre convolution et attention. Le code et les modèles pré-entraînés sont open-source sous une licence permissive, facilitant une adoption généralisée dans le milieu académique et industriel.
Limitations et orientations futures
Malgré ses forces, ConvNeXt repose toujours sur des architectures conçues manuellement, tandis que les Transformers ont bénéficié de lois d'échelle et d'architectures unifiées à travers les modalités. Certaines études suggèrent que les gains de performance de ConvNeXt diminuent sur de très grands ensembles de données par rapport aux Transformers, qui excellent dans la capture des dépendances à longue portée. Des travaux futurs ont exploré l'intégration de convolutions dynamiques ou de mélanges d'experts pour améliorer davantage la capacité.
En 2024, ConvNeXt reste un baseline solide en vision par ordinateur, souvent utilisé comme backbone par défaut dans de nombreuses applications. Ses principes ont été incorporés dans des architectures plus récentes comme FastViT et RepViT, qui visent à équilibrer efficacité et précision pour les scénarios mobiles et en temps réel.