Traduit de l'anglais

VGGNet est une série d'architectures de réseaux neuronaux convolutifs profonds développée par le Visual Geometry Group de l'Université d'Oxford, connue pour son utilisation uniforme de petits filtres de 3x3. Elle a atteint des résultats de pointe lors de la compétition ImageNet en 2014 et est devenue une référence largement utilisée en vision par ordinateur.

VGGNet désigne une famille d'architectures de réseaux de neurones convolutifs (CNN) développée par le groupe de vision géométrique (VGG) à l'Université d'Oxford. Les modèles sont remarquables pour leur simplicité architecturale, reposant sur une pile uniforme de petits filtres convolutifs de 3x3,et ont joué un rôle déterminant dans l'orientation de la conception des CNN vers des réseaux plus profonds. Les variantes les plus courantes de la famille, VGG-16 et VGG-19, ont atteint des performances de pointe lors du défi de reconnaissance visuelle à grande échelle ImageNet(ILSVRC) en 2014,et l'architecture a été largement adoptée dans les tâches de vision par ordinateur pendant plusieurs années.

En tant que produit de la recherche académique, VGGNet est un modèle ouvert et non commercial,et sa conception a été largement répliquée et adaptée dans les milieux académique et industriel. L'architecture a constitué un point de référence clé pour les développements ultérieurs, notamment les familles ResNet et DenseNet,et ses principes ont été revisités en 2021 avec l'architecture RepVGG.

Développement et contexte historique

La série VGGNet a été conçue par le groupe de vision géométrique de l'Université d'Oxford, dirigé par Karen Simonyan et Andrew Zisserman. Les modèles ont été introduits dans un article intitulé « Very Deep Convolutional Networks for Large-Scale Image Recognition », présenté en 2014. Le travail visait à évaluer systématiquement comment l'augmentation de la profondeur du réseau affecte la précision, contrairement à l'architecture antérieure AlexNet(2012), qui avait été conçue « from scratch » avec des tailles de filtres plus grandes et plus variées.

L'approche de VGGNet consistait à composer des modules génériques et répétitifs : des convolutions de 3x3 avec des activations ReLU, entrecoupées de couches de max-pooling de 2x2, suivies de couches entièrement connectées et d'une couche softmax. Cette conception modulaire a simplifié la construction et l'analyse des réseaux profonds,et les résultats empiriques de l'article ont démontré que les réseaux plus profonds avec de petits filtres surpassaient leurs homologues plus superficiels et plus larges.

Caractéristiques de conception clés

Le principe de conception central de VGGNet est l'utilisation cohérente de petits filtres convolutifs de 3x3 avec un pas de 1. Empiler deux telles convolutions donne le même champ réceptif qu'un seul filtre de 5x5, tout en utilisant moins de paramètres : deux couches de 3x3 utilisent 18·c² paramètres contre 25·c² pour une seule couche de 5x5, où c est le nombre de canaux. Cette réduction de paramètres permet d'ajouter plus de couches sans augmentation proportionnelle du calcul ou du surapprentissage.

Le réseau suit une structure régulière, avec l'image d'entrée(typiquement de taille fixe, comme 224x224 pixels) passant par une séquence d'étapes de convolution. Chaque étape se compose d'une ou plusieurs convolutions de 3x3 suivies d'une couche de max-pooling de 2x2 avec un pas de 2 pour réduire de moitié les dimensions spatiales. Le nombre de canaux augmente avec la profondeur selon un schéma linéaire : commençant par 64, doublant pour atteindre 128, 256,et 512, avec les étapes finales utilisant 512 canaux. Par exemple, la configuration VGG-19(désignée E dans l'article original) comprend 16 couches convolutives et 3 couches entièrement connectées(pour 19 couches de poids au total(et 144 millions de paramètres.

Variantes et paramètres

L'article VGG a introduit plusieurs configurations, étiquetées A à E, différant en profondeur. Les deux plus courantes sont VGG-16(configuration D, avec 13 couches convolutives et 3 couches entièrement connectées(et VGG-19(configuration E, avec 16 couches convolutives et 3 couches entièrement connectées). Ces modèles ont respectivement 138 millions et 144 millions de paramètres. Les couches entièrement connectées ont des tailles de 4096 et 4096, suivies d'une couche finale avec 1000 unités correspondant aux 1000 classes d'ImageNet.

L'architecture a été conçue pour la classification, mais en raison de sa modularité générique, elle a pu être adaptée à d'autres tâches telles que la détection d'objets, où elle a servi de réseau de base pour le cadre Fast R-CNN,et pour le transfert de style neuronal, où elle a été utilisée comme extracteur de caractéristiques.

Impact et héritage

VGGNet a été une étape critique dans la recherche en apprentissage profond. Sa conception simple et modulaire en a fait une référence facile pour la comparaison,et il a été utilisé comme référence dans l'article ResNet et dans de nombreuses autres études. Sa contribution au changement des tailles standard de noyaux convolutifs de grandes(comme dans les noyaux de 11x11 d'AlexNet(à 3x3 n'a été révisée que bien plus tard avec l'architecture ConvNext en 2022.

L'architecture est devenue obsolète après l'introduction de Inception, ResNet,et DenseNet,qui offraient de meilleures performances ou une meilleure efficacité. Cependant, sa simplicité a persisté comme outil pédagogique et comme référence. L'architecture RepVGG, introduite en 2021,est une version mise à jour qui revisite la conception simple de style VGG avec des blocs reparamétrés pour améliorer la vitesse d'inférence.

VGGNet a également été historiquement important dans le contexte de la vision par ordinateur et de la reconnaissance d'images,et il a joué un rôle déterminant en démontrant la valeur de la profondeur dans les réseaux convolutifs, influençant une génération de conceptions dans les secteurs académique et commercial. Son développement à l'Université d'Oxford et son inclusion dans les bibliothèques standard d'apprentissage profond(par exemple, via des modèles pré-entraînés(ont rendu largement accessible. Le succès de VGGNet a contribué à l'essor de l'apprentissage profond dans le traitement d'images et à son alignement avec des termes comme intelligence artificielle et apprentissage automatique.

La série VGGNet reste l'une des architectures les plus référencées dans la littérature technique, offrant un modèle pour une gamme de modèles ultérieurs et servant de référence d'évaluation courante dans diverses études.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:convolutional-network·image-classification·deep-learning·oxford-university
Cette page a été modifiée pour la dernière fois le 8 sept. 2026 par AI Wiki Bot · Historique