Traduit de l'anglais

VGGFace2 est un ensemble de données de reconnaissance faciale à grande échelle développé par le Visual Geometry Group de l'Université d'Oxford, contenant plus de 3,31 millions d'images de plus de 9 000 identités, utilisé pour l'entraînement et l'évaluation de modèles d'apprentissage profond en reconnaissance faciale.

VGGFace2 est un ensemble de données de reconnaissance faciale à grande échelle développé par le Visual Geometry Group de l'Université d'Oxford. Il contient plus de 3,31 millions d'images de plus de 9 000 identités, ce qui en fait l'une des références les plus utilisées pour l'entraînement et l'évaluation de réseaux neuronaux profonds dans les tâches de reconnaissance faciale. L'ensemble de données a été introduit en 2017 et est depuis devenu une ressource standard dans le domaine de la vision par ordinateur et de l'apprentissage profond.

L'ensemble de données a été créé pour remédier aux limitations des ensembles de données faciaux antérieurs, tels que LFW et MegaFace, en fournissant un ensemble d'images plus vaste et plus diversifié avec des variations de pose, d'âge, d'éclairage et d'ethnicité. Les images de VGGFace2 proviennent de Google Image Search et ne se limitent pas aux visages de célébrités, ce qui accroît la diversité des identités. Chaque identité compte en moyenne 362 images, avec un minimum de 80 et un maximum de 843 images par personne.

Collecte et annotation des données

Le processus de collecte a impliqué un scraping web automatisé suivi d'un filtrage manuel pour garantir l'exactitude. L'ensemble de données comprend à la fois des divisions d'entraînement et de test, l'ensemble de test contenant 500 identités absentes de l'ensemble d'entraînement. Les annotations comprennent des étiquettes d'identité, des boîtes englobantes pour les visages et des points de repère faciaux clés. L'ensemble de données a été publié sous une licence de recherche uniquement, et son utilisation nécessite l'acceptation de conditions interdisant la redistribution commerciale.

Architecture et utilisation pour l'entraînement

VGGFace2 est principalement utilisé pour entraîner des réseaux neuronaux convolutifs (CNN) pour la reconnaissance faciale. Le modèle de base, souvent appelé réseau VGGFace2, est un CNN profond avec une architecture ResNet-50 ou similaire à ResNet-50, entraîné à l'aide d'une perte softmax avec une marge importante. Le processus d'entraînement emploie généralement des techniques d'augmentation des données telles que le recadrage aléatoire, le retournement horizontal et la variation des couleurs pour améliorer la généralisation. L'ensemble de données a joué un rôle déterminant dans l'obtention de résultats de pointe sur des références telles que le défi MegaFace et le protocole IJB-C.

Impact sur la recherche en reconnaissance faciale

VGGFace2 a considérablement fait progresser le domaine de la reconnaissance faciale en fournissant un ensemble de données à grande échelle et diversifié qui permet l'entraînement de modèles avec une grande précision à travers différentes démographies. Il a été utilisé dans de nombreux articles de recherche et systèmes commerciaux, y compris ceux d'entreprises comme Google DeepMind et Samsung Research. La conception de l'ensemble de données a influencé des ensembles de données ultérieurs, tels que MS-Celeb-1M et WebFace260M, qui visent à augmenter encore le nombre d'identités et d'images.

Limitations et considérations éthiques

Malgré son utilité, VGGFace2 présente des limitations. Les images sont collectées sur le web sans consentement explicite des individus, ce qui soulève des préoccupations en matière de confidentialité. L'ensemble de données présente également des biais, car la distribution des identités peut ne pas représenter pleinement la démographie mondiale, ce qui peut entraîner des disparités de performance entre différents groupes ethniques. Les chercheurs ont appelé à des ensembles de données plus éthiques et à une évaluation minutieuse des systèmes de reconnaissance faciale pour atténuer les biais.

Travaux connexes et extensions

Le Visual Geometry Group a également publié VGGFace, un ensemble de données antérieur et plus petit, et a fourni des modèles pré-entraînés pour les deux. Les extensions de VGGFace2 incluent l'ensemble de données VGGFace2-HQ, qui contient des versions haute résolution des images. L'ensemble de données est souvent utilisé en conjonction avec d'autres ressources comme l'architecture Réseau résiduel et les techniques de Normalisation par lots pour améliorer la stabilité de l'entraînement et les performances.

Voir aussi

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:computer-vision·face-recognition·dataset·deep-learning
Cette page a été modifiée pour la dernière fois le 13 sept. 2026 par AI Wiki Bot · Historique