Traduit de l'anglais

VGGNet est une série de réseaux de neurones convolutifs profonds développés par le Visual Geometry Group de l'Université d'Oxford, connue pour son architecture simple et uniforme utilisant de petits filtres 3x3. Elle a obtenu des résultats de pointe lors du défi ImageNet 2014.

VGGNet désigne une famille d'architectures de réseaux de neurones convolutifs développée par le Visual Geometry Group (VGG) à l'Université d'Oxford. Les modèles ont été introduits dans un article de 2014 et sont devenus influents dans le domaine de l'apprentissage profond pour leur conception simple et modulaire ainsi que leurs performances solides sur les tâches de classification d'images. La famille VGG se caractérise par l'utilisation cohérente et uniforme de petits filtres convolutifs 3x3, une rupture avec les filtres plus grands utilisés dans les réseaux antérieurs comme AlexNet.

Les modèles VGG ont été largement adoptés dans diverses applications de vision par ordinateur. Un ensemble de réseaux VGG a obtenu les meilleurs résultats dans le défi de reconnaissance visuelle à grande échelle ImageNet (ILSVRC) en 2014. L'architecture a servi de référence pour comparaison dans l'article sur ResNet, de réseau de base dans le Fast Region-based CNN pour la détection d'objets, et de composant dans les algorithmes de transfert de style neuronal. Bien que des architectures ultérieures comme Inception, ResNet et DenseNet aient surpassé les performances de VGGNet, la série reste une étape historique importante dans l'évolution des réseaux de neurones convolutifs.

Principe de conception

L'idée centrale derrière VGGNet était de construire un réseau profond en empilant des modules génériques et simples plutôt que de concevoir chaque couche de zéro. Cela contrastait avec les approches antérieures comme AlexNet (2012), qui utilisait une structure plus hétérogène avec des filtres plus grands. L'architecture VGG consiste en des blocs répétés de couches convolutives 3x3 suivies de couches de max-pooling, aboutissant à un ensemble de couches entièrement connectées.

L'utilisation cohérente de petits filtres 3x3 était une innovation clé. Empiler deux convolutions 3x3 offre le même champ réceptif qu'une seule convolution 5x5, mais avec moins de paramètres (18c² contre 25c², où c est le nombre de canaux). Cela a permis des réseaux plus profonds avec moins de paramètres, tandis que la profondeur accrue permettait au réseau d'apprendre des caractéristiques plus complexes. La publication originale a démontré que les réseaux profonds et étroits surpassent nettement leurs homologues peu profonds et larges.

Architecture

L'architecture VGG est composée de modules génériques empilés séquentiellement. Les couches convolutives utilisent des filtres 3x3 avec un pas de 1 et des activations ReLU. Elles sont suivies de couches de max-pooling avec un filtre 2x2 et un pas de 2, qui réduisent les cartes de caractéristiques de moitié en largeur et en hauteur tout en préservant le nombre de canaux.

Après les étapes convolutives et de pooling, le réseau se termine par trois couches entièrement connectées de tailles 4096-4096-1000. La dernière couche a 1000 unités correspondant aux 1000 classes du jeu de données ImageNet. Une couche softmax produit la distribution de probabilité finale sur ces classes.

Configurations et profondeur

La famille VGG comprend plusieurs configurations désignées par une lettre et le nombre de couches de poids. Les variantes les plus couramment utilisées sont VGG-16 et VGG-19. VGG-16 a 13 couches convolutives et 3 couches entièrement connectées, totalisant environ 138 millions de paramètres. VGG-19 a 16 couches convolutives et 3 couches entièrement connectées, avec environ 144 millions de paramètres.

Dans l'architecture VGG typique, les étapes convolutives sont organisées en blocs. Chaque bloc consiste en une ou plusieurs couches convolutives 3x3 suivies d'une couche de max-pooling 2x2 avec un pas de 2, qui réduit les cartes de caractéristiques. Le nombre de canaux augmente progressivement à travers le réseau, de 64 dans le premier bloc à 512 dans les blocs les plus profonds. Les étapes finales sont trois couches entièrement connectées de tailles 4096, 4096 et 1000, suivies d'une couche softmax pour la classification sur 1000 classes ImageNet.

Principes de conception

Le principe architectural clé des modèles VGG est l'utilisation cohérente de petites convolutions 3x3 avec un pas de 1. Ce choix de conception était significatif car empiler deux convolutions 3x3 atteint le même champ réceptif qu'une seule convolution 5x5, tout en utilisant moins de paramètres. L'article original a démontré que les réseaux profonds et étroits surpassent les homologues peu profonds et larges, établissant l'importance de la profondeur dans le apprentissage automatique.

Contrairement aux réseaux antérieurs comme AlexNet (2012), qui utilisaient des filtres plus grands jusqu'à 11x11 et étaient conçus de zéro, VGGNet était composé de modules génériques et répétables. Cette approche modulaire a simplifié le processus de conception et rendu l'architecture plus facile à implémenter et à adapter. L'utilisation cohérente de petits filtres a permis des réseaux plus profonds avec le même champ réceptif tout en réduisant le nombre de paramètres.

Architecture

La famille VGG comprend plusieurs configurations de profondeur variable, désignées par la lettre 'VGG' suivie du nombre de couches de poids. Les versions les plus courantes sont VGG-16 (13 couches convolutives plus 3 couches entièrement connectées, totalisant environ 138 millions de paramètres) et VGG-19 (16 couches convolutives plus 3 couches entièrement connectées, totalisant environ 144 millions de paramètres). Celles-ci correspondent aux configurations D et E dans la publication originale.

Tous les modèles VGG suivent une structure similaire. Ils commencent par des modules convolutifs, chacun contenant des filtres 3x3 avec un pas de 1 et des activations ReLU. Après certains groupes de couches convolutives, une couche de max-pooling avec une fenêtre 2x2 et un pas de 2 réduit les dimensions spatiales de moitié tout en préservant le nombre de canaux. Le nombre de canaux augmente progressivement à travers le réseau, de 64 dans la première couche à 512 dans les couches convolutives les plus profondes.

Le réseau se termine par trois couches entièrement connectées de tailles 4096, 4096 et 1000. La dernière couche produit des scores pour les 1000 classes du jeu de données ImageNet. Une couche softmax convertit ensuite ces scores en une distribution de probabilité sur les classes.

Entraînement et performances

Les modèles VGG ont été entraînés sur le jeu de données ImageNet, qui contient plus de 14 millions d'images réparties sur 1000 catégories. L'entraînement de réseaux aussi profonds nécessitait des ressources computationnelles importantes et un réglage minutieux. Les modèles ont été entraînés sur plusieurs époques avec des techniques d'augmentation de données telles que le recadrage aléatoire et le retournement horizontal.

Dans la compétition ILSVRC 2014, un ensemble de modèles VGG a obtenu des résultats de pointe, démontrant l'efficacité de l'architecture. Le modèle VGG-16 en particulier est devenu une référence standard pour les tâches de classification d'images et a été largement utilisé dans l'apprentissage par transfert, où un réseau pré-entraîné sur ImageNet est adapté à d'autres tâches avec des ensembles de données plus petits.

Impact et héritage

VGGNet a joué un rôle déterminant dans le changement de la taille standard des filtres convolutifs dans les CNN, passant de grands noyaux (jusqu'à 11x11 dans AlexNet) aux filtres beaucoup plus petits de 3x3. Ce choix de conception a influencé de nombreuses architectures ultérieures. Le réseau a été largement utilisé comme colonne vertébrale pour d'autres tâches, notamment la détection d'objets dans le cadre du Fast Region-based CNN (Fast R-CNN) et comme réseau de base dans les algorithmes de transfert de style neuronal.

La conception simple de l'architecture en a fait un choix populaire pour les chercheurs et les praticiens. Son succès a démontré que la profondeur, combinée à des filtres petits et uniformes, pouvait produire des performances solides. Cependant, les modèles sont coûteux en calcul et ont une empreinte mémoire importante en raison des couches entièrement connectées.

La série VGG a finalement été supplantée par des architectures plus efficaces telles que Inception, ResNet et DenseNet, qui ont obtenu de meilleures performances avec moins de paramètres. En 2021, l'architecture RepVGG a réimaginé la conception simple de style VGG avec des techniques modernes, montrant qu'un réseau simple de type VGG pouvait à nouveau égaler les performances de pointe. Les VGGNet originaux restent courants comme extracteurs de caractéristiques dans diverses applications d'apprentissage par transfert.

Contexte historique

VGGNet a été développé à une époque où les réseaux de neurones devenaient plus profonds et plus puissants. AlexNet, le gagnant de l'ILSVRC 2012, utilisait de grands filtres convolutifs jusqu'à 11x11 et avait une structure relativement peu profonde de 8 couches. La proposition de VGG d'empiler de nombreuses convolutions 3x3 a démontré que la profondeur pouvait être augmentée considérablement tout en maintenant un nombre de paramètres gérable. Ce principe de composition de modules simples pour construire des réseaux profonds a influencé de nombreuses architectures ultérieures.

Les modèles VGG ont été utilisés comme référence de comparaison dans l'article sur ResNet et ont servi de colonne vertébrale pour divers systèmes de vision par ordinateur, y compris le Fast Region-based CNN pour la détection d'objets et les implémentations de transfert de style neuronal. Les modèles sont également devenus un choix standard pour l'extraction de caractéristiques dans de nombreuses tâches de vision.

Impact et héritage

L'importance de VGGNet réside dans sa démonstration qu'un réseau d'intelligence artificielle profond et soigneusement structuré pouvait obtenir d'excellents résultats avec une conception hautement régulière. Sa modularité l'a rendu facile à implémenter et à adapter, contribuant à sa popularité dans la recherche et l'industrie. L'architecture reste un exemple pédagogique courant dans les cours de apprentissage profond et une référence pour de nombreuses tâches de vision par ordinateur.

Bien que les architectures plus récentes aient surpassé les performances de VGG sur les références standard, l'influence du modèle persiste. Ses principes - petits filtres, empilements profonds et conception modulaire simple - sont visibles dans de nombreux réseaux ultérieurs. La disponibilité de modèles VGG pré-entraînés le rend également utile pour l'extraction de caractéristiques et l'apprentissage par transfert dans diverses applications, y compris la détection d'objets et le transfert de style.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:computer-vision·convolutional-neural-networks·deep-learning·image-classification
Cette page a été modifiée pour la dernière fois le 7 sept. 2026 par AI Wiki Bot · Historique