MS-Celeb-1M é um conjunto de dados de reconhecimento facial em grande escala introducido pela Microsoft em 2016. Contiene aproximadamente 10 milhões de imagens de 100.000 celebridades, com cada identidade tendo cerca de 100 imagens. O conjunto de dados foi projetado para apoiar a pesquisa em reconhecimento facial, abordando especificamente os desafios da identificação e verificação em grande escala. Tem sido amplamente utilizado como referência para avaliar algoritmos de reconhecimento facial, particularmente no contexto da aprendizagem profunda.
O conjunto de dados foi criado coletando automaticamente imagens da web usando motores de busca e, em seguida, aplicando técnicas de detección e alineación de rostros para extraer las caras. Las identidades corresponden a celebridades, proporcionando un conjunto diverso de poses, expresiones, iluminaciones y oclusiones. MS-Celeb-1M incluye tanto divisiones de entrenamiento como de prueba, con el conjunto de prueba conteniendo 1.000 identidades no presentes en el conjunto de entrenamiento, lo que permite evaluar la generalización.
Construcción y Anotación
La construcción de MS-Celeb-1M involucró varios pasos. Primero, se compiló una lista de 100.000 nombres de celebridades de diversas fuentes, incluyendo Wikipedia y bases de datos de entretenimiento. Para cada nombre, se recuperaron imágenes de motores de búsqueda como Bing y Google. Se realizó la detección de rostros utilizando un detector facial comercial, y los rostros detectados se alinearon a una pose canónica. Las imágenes luego fueron verificadas manualmente para asegurar que correspondieran a la identidad correcta, con un paso final de limpieza para eliminar duplicados e imágenes de baja calidad.
La anotación fue principalmente automatizada, pero anotadores humanos fueron utilizados para verificar las etiquetas de identidad para un subconjunto de los datos. El conjunto de datos proporciona cajas delimitadoras y puntos de referencia faciales para cada rostro, facilitando tareas como la alineación y el recorte facial. El conjunto de datos final contiene 10 millones de imágenes, con cada identidad teniendo un promedio de 100 imágenes, aunque la distribución es de cola larga, con algunas identidades teniendo muchas más imágenes que otras.
Impacto en la Investigación del Reconocimiento Facial
MS-Celeb-1M ha tenido un impacto significativo en el campo del reconocimiento facial. Proporcionó un recurso de entrenamiento a gran escala que permitió el desarrollo de modelos de aprendizaje profundo con mayor precisión. Antes de su lanzamiento, los conjuntos de datos de reconocimiento facial eran relativamente pequeños, limitando la capacidad de las redes neuronales. La escala de MS-Celeb-1M permitió a los investigadores entrenar redes neuronales convolucionales profundas (CNN) con millones de parámetros, lo que llevó a avances en precisión en puntos de referencia como LFW (Labeled Faces in the Wild).
El conjunto de datos también introdujo el desafío de la identificación facial a gran escala, donde el tamaño de la galería puede ser de hasta un millón de identidades. Esto motivó la investigación en métodos eficientes de indexación y recuperación, así como funciones de pérdida diseñadas para el reconocimiento de conjunto abierto. Muchos sistemas de reconocimiento facial de última generación, incluidos aquellos basados en arquitecturas ResNet y pérdidas basadas en márgenes como ArcFace, fueron entrenados o evaluados en MS-Celeb-1M.
Desafíos y Controversias
A pesar de su éxito, MS-Celeb-1M ha enfrentado desafíos y controversias. Un problema importante es la presencia de sesgos, ya que el conjunto de datos está compuesto predominantemente por celebridades de países occidentales, lo que lleva a una subrepresentación de otras etnias y géneros. Esto puede resultar en sistemas de reconocimiento facial que funcionan mal en grupos subrepresentados, planteando preocupaciones éticas sobre la equidad y el sesgo.
Otra controversia involucra la privacidad y el consentimiento. Las imágenes fueron extraídas de la web sin consentimiento explícito de los individuos, muchos de los cuales son figuras públicas pero aún tienen derechos sobre su imagen. En 2019, Microsoft retiró el conjunto de datos del acceso público, citando preocupaciones sobre la privacidad y el potencial de uso indebido. Esto llevó a discusiones sobre el uso ético de conjuntos de datos a gran escala extraídos de la web en la investigación de IA.
Legado y Alternativas
A pesar de su retiro, MS-Celeb-1M ha dejado un legado duradero. Muchos conjuntos de datos derivados, como MS1MV2 y MS1MV3, fueron creados limpiando y re-anotando los datos originales, y estos continúan siendo utilizados en la investigación. El conjunto de datos también inspiró la creación de otros conjuntos de datos faciales a gran escala, como VGGFace2 y WebFace260M, que buscan abordar algunas de las limitaciones de MS-Celeb-1M, incluyendo la diversidad y el consentimiento.
En el contexto más amplio de aprendizaje automático, MS-Celeb-1M ejemplifica la tendencia hacia conjuntos de datos a gran escala para entrenar modelos profundos. También destaca la importancia de las consideraciones éticas en la creación de conjuntos de datos, un tema que se ha vuelto central para las comunidades de IA generativa y aprendizaje profundo. Los investigadores ahora a menudo buscan conjuntos de datos con consentimiento adecuado y representación equilibrada, y se han lanzado varias iniciativas para crear puntos de referencia de reconocimiento facial más éticos.