MS-Celeb-1M est un ensemble de données de reconnaissance faciale à grande échelle introduit par Microsoft en 2016. Il contient environ 10 millions d'images de 100 000 célébrités, chaque identité ayant environ 100 images. L'ensemble de données a été conçu pour soutenir la recherche en reconnaissance faciale, en abordant spécifiquement les défis de l'identification et de la vérification à grande échelle. Il a été largement utilisé comme référence pour évaluer les algorithmes de reconnaissance faciale, en particulier dans le contexte de l'apprentissage profond.
L'ensemble de données a été créé en collectant automatiquement des images sur le web à l'aide de moteurs de recherche, puis en appliquant des techniques de détection et d'alignement des visages pour extraire les visages. Les identités correspondent à des célébrités, offrant un ensemble diversifié de poses, d'expressions, d'illuminations et d'occlusions. MS-Celeb-1M comprend à la fois des divisions d'entraînement et de test, l'ensemble de test contenant 1 000 identités absentes de l'ensemble d'entraînement, permettant d'évaluer la généralisation.
Construction et annotation
La construction de MS-Celeb-1M a impliqué plusieurs étapes. Tout d'abord, une liste de 100 000 noms de célébrités a été compilée à partir de diverses sources, notamment Wikipédia et des bases de données de divertissement. Pour chaque nom, des images ont été récupérées à partir de moteurs de recherche tels que Bing et Google. La détection des visages a été effectuée à l'aide d'un détecteur de visages commercial, et les visages détectés ont été alignés sur une pose canonique. Les images ont ensuite été vérifiées manuellement pour garantir qu'elles correspondaient à la bonne identité, avec une étape de nettoyage finale pour supprimer les doublons et les images de faible qualité.
L'annotation était principalement automatisée, mais des annotateurs humains ont été utilisés pour vérifier les étiquettes d'identité pour un sous-ensemble des données. L'ensemble de données fournit des boîtes englobantes et des points de repère faciaux pour chaque visage, facilitant des tâches telles que l'alignement et le recadrage des visages. L'ensemble de données final contient 10 millions d'images, chaque identité ayant en moyenne 100 images, bien que la distribution soit à longue traîne, certaines identités ayant beaucoup plus d'images que d'autres.
Impact sur la recherche en reconnaissance faciale
MS-Celeb-1M a eu un impact significatif sur le domaine de la reconnaissance faciale. Il a fourni une ressource d'entraînement à grande échelle qui a permis le développement de modèles d'apprentissage profond avec une précision améliorée. Avant sa publication, les ensembles de données de reconnaissance faciale étaient relativement petits, limitant la capacité des réseaux neuronaux. L'échelle de MS-Celeb-1M a permis aux chercheurs d'entraîner des réseaux neuronaux convolutifs profonds (CNN) avec des millions de paramètres, conduisant à des percées en précision sur des références telles que LFW (Labeled Faces in the Wild).
L'ensemble de données a également introduit le défi de l'identification faciale à grande échelle, où la taille de la galerie peut atteindre un million d'identités. Cela a motivé la recherche sur des méthodes efficaces d'indexation et de récupération, ainsi que sur des fonctions de perte conçues pour la reconnaissance en ensemble ouvert. De nombreux systèmes de reconnaissance faciale de pointe, y compris ceux basés sur des architectures ResNet et des pertes basées sur la marge comme ArcFace, ont été entraînés ou évalués sur MS-Celeb-1M.
Défis et controverses
Malgré son succès, MS-Celeb-1M a rencontré des défis et des controverses. Un problème majeur est la présence de biais, car l'ensemble de données est principalement composé de célébrités de pays occidentaux, entraînant une sous-représentation d'autres ethnies et genres. Cela peut entraîner des systèmes de reconnaissance faciale qui performent mal sur des groupes sous-représentés, soulevant des préoccupations éthiques concernant l'équité et les biais.
Une autre controverse concerne la vie privée et le consentement. Les images ont été extraites du web sans consentement explicite des individus, dont beaucoup sont des personnalités publiques mais ont toujours des droits sur leur image. En 2019, Microsoft a retiré l'ensemble de données de l'accès public, citant des préoccupations concernant la vie privée et le potentiel de mauvaise utilisation. Cela a conduit à des discussions sur l'utilisation éthique des ensembles de données à grande échelle extraits du web dans la recherche en IA.
Héritage et alternatives
Malgré son retrait, MS-Celeb-1M a laissé un héritage durable. De nombreux ensembles de données dérivés, tels que MS1MV2 et MS1MV3, ont été créés en nettoyant et en ré-annotant les données originales, et ceux-ci continuent d'être utilisés dans la recherche. L'ensemble de données a également inspiré la création d'autres ensembles de données faciaux à grande échelle, tels que VGGFace2 et WebFace260M, qui visent à remédier à certaines des limitations de MS-Celeb-1M, notamment la diversité et le consentement.
Dans le contexte plus large de l'apprentissage automatique, MS-Celeb-1M illustre la tendance vers des ensembles de données à grande échelle pour l'entraînement de modèles profonds. Il souligne également l'importance des considérations éthiques dans la création d'ensembles de données, un sujet devenu central pour les communautés de l'IA générative et de l'apprentissage profond. Les chercheurs recherchent désormais souvent des ensembles de données avec un consentement approprié et une représentation équilibrée, et plusieurs initiatives ont été lancées pour créer des références de reconnaissance faciale plus éthiques.