MS-Celeb-1M es un conjunto de datos de reconocimiento facial a gran escala introducido por Microsoft en 2016. Contiene aproximadamente 10 millones de imágenes de 100,000 celebridades, con alrededor de 100 imágenes por identidad. El conjunto de datos fue diseñado para apoyar la investigación en reconocimiento facial, abordando específicamente los desafíos de identificación y verificación a gran escala. Ha sido ampliamente utilizado como referencia para evaluar algoritmos de reconocimiento facial, particularmente en el contexto del aprendizaje profundo.
El conjunto de datos se creó recopilando automáticamente imágenes de la web mediante motores de búsqueda y aplicando técnicas de detección y alineación facial para extraer los rostros. Las identidades corresponden a celebridades, lo que proporciona una diversidad de poses, expresiones, iluminaciones y oclusiones. MS-Celeb-1M incluye divisiones de entrenamiento y prueba, con el conjunto de prueba conteniendo 1,000 identidades no presentes en el conjunto de entrenamiento, lo que permite evaluar la generalización.
Construcción y Anotación
La construcción de MS-Celeb-1M implicó varios pasos. Primero, se compiló una lista de 100,000 nombres de celebridades de diversas fuentes, incluyendo Wikipedia y bases de datos de entretenimiento. Para cada nombre, se recuperaron imágenes de motores de búsqueda como Bing y Google. Se realizó detección facial utilizando un detector facial comercial, y los rostros detectados se alinearon a una pose canónica. Las imágenes se verificaron manualmente para asegurar que correspondieran a la identidad correcta, con un paso final de limpieza para eliminar duplicados e imágenes de baja calidad.
La anotación fue principalmente automatizada, pero se utilizaron anotadores humanos para verificar las etiquetas de identidad en un subconjunto de los datos. El conjunto de datos proporciona cuadros delimitadores y puntos de referencia faciales para cada rostro, facilitando tareas como la alineación y el recorte facial. El conjunto de datos final contiene 10 millones de imágenes, con un promedio de 100 imágenes por identidad, aunque la distribución es de cola larga, con algunas identidades teniendo muchas más imágenes que otras.
Impacto en la Investigación del Reconocimiento Facial
MS-Celeb-1M ha tenido un impacto significativo en el campo del reconocimiento facial. Proporcionó un recurso de entrenamiento a gran escala que permitió el desarrollo de modelos de aprendizaje profundo con mayor precisión. Antes de su publicación, los conjuntos de datos de reconocimiento facial eran relativamente pequeños, lo que limitaba la capacidad de las redes neuronales. La escala de MS-Celeb-1M permitió a los investigadores entrenar redes neuronales convolucionales profundas (CNN) con millones de parámetros, lo que condujo a avances en precisión en puntos de referencia como LFW (Labeled Faces in the Wild).
El conjunto de datos también introdujo el desafío de la identificación facial a gran escala, donde el tamaño de la galería puede ser de hasta un millón de identidades. Esto motivó la investigación en métodos eficientes de indexación y recuperación, así como funciones de pérdida diseñadas para el reconocimiento de conjunto abierto. Muchos sistemas de reconocimiento facial de última generación, incluidos aquellos basados en arquitecturas ResNet y pérdidas basadas en márgenes como ArcFace, fueron entrenados o evaluados en MS-Celeb-1M.
Desafíos y Controversias
A pesar de su éxito, MS-Celeb-1M ha enfrentado desafíos y controversias. Un problema importante es la presencia de sesgos, ya que el conjunto de datos está compuesto predominantemente por celebridades de países occidentales, lo que lleva a una subrepresentación de otras etnias y géneros. Esto puede resultar en sistemas de reconocimiento facial que funcionan mal en grupos subrepresentados, planteando preocupaciones éticas sobre la equidad y el sesgo.
Otra controversia involucra la privacidad y el consentimiento. Las imágenes fueron extraídas de la web sin consentimiento explícito de los individuos, muchos de los cuales son figuras públicas pero aún tienen derechos sobre su imagen. En 2019, Microsoft retiró el conjunto de datos del acceso público, citando preocupaciones sobre la privacidad y el posible uso indebido. Esto llevó a discusiones sobre el uso ético de conjuntos de datos a gran escala extraídos de la web en la investigación de IA.
Legado y Alternativas
A pesar de su retiro, MS-Celeb-1M ha dejado un legado duradero. Muchos conjuntos de datos derivados, como MS1MV2 y MS1MV3, fueron creados limpiando y re-anotando los datos originales, y estos continúan utilizándose en la investigación. El conjunto de datos también inspiró la creación de otros conjuntos de datos faciales a gran escala, como VGGFace2 y WebFace260M, que buscan abordar algunas de las limitaciones de MS-Celeb-1M, incluyendo la diversidad y el consentimiento.
En el contexto más amplio del aprendizaje automático, MS-Celeb-1M ejemplifica la tendencia hacia conjuntos de datos a gran escala para entrenar modelos profundos. También destaca la importancia de las consideraciones éticas en la creación de conjuntos de datos, un tema que se ha vuelto central en las comunidades de IA generativa y aprendizaje profundo. Los investigadores ahora suelen buscar conjuntos de datos con consentimiento adecuado y representación equilibrada, y se han lanzado varias iniciativas para crear puntos de referencia de reconocimiento facial más éticos.