CASIA-WebFace es un conjunto de datos de reconocimiento facial a gran escala introducido en 2014 por investigadores del Instituto de Automatización de la Academia China de Ciencias. Contiene 494 414 imágenes de rostros de 10 575 identidades distintas, recopiladas de la web. El conjunto de datos se creó para satisfacer la necesidad de un recurso de entrenamiento público y a gran escala para modelos de reconocimiento facial, particularmente para enfoques de aprendizaje profundo que requieren cantidades sustanciales de datos etiquetados. Se ha convertido en un punto de referencia estándar en el campo de la visión por computadora y el aprendizaje automático, especialmente para tareas como la verificación e identificación facial.
El conjunto de datos fue desarrollado por Dong Yi, Zhen Lei, Shengcai Liao y Stan Z. Li, y se publicó como una alternativa gratuita a conjuntos de datos propietarios más grandes, como el conjunto de entrenamiento del desafío MegaFace. Cada imagen es un rostro recortado, típicamente alineado a una pose canónica, con variaciones en iluminación, expresión y oclusión. Las identidades son diversas y cubren diferentes edades, etnias y orígenes, lo que hace que el conjunto de datos sea adecuado para entrenar modelos que generalicen entre poblaciones. CASIA-WebFace se ha utilizado ampliamente en la investigación académica y ha contribuido a avances significativos en la precisión del reconocimiento facial.
Construcción y anotación
Las imágenes de CASIA-WebFace se recopilaron automáticamente de la web mediante motores de búsqueda y luego se filtraron utilizando un proceso semiautomático. El proceso implicó detección de rostros, agrupamiento y verificación manual para garantizar que cada identidad contuviera imágenes consistentes. El conjunto de datos final incluye 10 575 sujetos, con un promedio de aproximadamente 47 imágenes por sujeto. Las imágenes se almacenan en formato JPEG y van acompañadas de metadatos que indican el ID del sujeto. El conjunto de datos no incluye cuadros delimitadores ni puntos de referencia, ya que los rostros ya están recortados y alineados a un tamaño estándar de 250x250 píxeles.
Impacto en la investigación del reconocimiento facial
CASIA-WebFace ha sido fundamental en el desarrollo de los sistemas modernos de reconocimiento facial. Antes de su publicación, muchos investigadores dependían de conjuntos de datos más pequeños, como Labeled Faces in the Wild (LFW), para la evaluación, pero el entrenamiento de redes neuronales profundas requería conjuntos de datos más grandes. CASIA-WebFace proporcionó un volumen de datos suficiente para entrenar redes neuronales convolucionales (CNN) de manera efectiva. Se ha utilizado para entrenar modelos como FaceNet, SphereFace y CosFace, que lograron un rendimiento de vanguardia en LFW y otros puntos de referencia. El conjunto de datos también permitió la exploración de funciones de pérdida como el triplet loss y las pérdidas de margen angular, que mejoraron la discriminación entre identidades.
Limitaciones y consideraciones éticas
A pesar de su utilidad, CASIA-WebFace tiene limitaciones. Las imágenes se recopilan de fuentes web públicas sin el consentimiento explícito de las personas representadas, lo que plantea problemas de privacidad y ética. El conjunto de datos puede contener sesgos en términos de representación demográfica, ya que el proceso de extracción web puede sobrerrepresentar ciertas etnias o grupos de edad. Además, el filtrado automático puede introducir ruido en las etiquetas, donde algunas imágenes se asignan incorrectamente a identidades. Los investigadores han señalado estos problemas y han pedido conjuntos de datos obtenidos de manera más ética. En respuesta, algunos conjuntos de datos más nuevos se han creado con consentimiento explícito o mediante generación de datos sintéticos.
Uso en modelos de aprendizaje profundo
CASIA-WebFace se utiliza comúnmente como conjunto de entrenamiento para modelos de aprendizaje profundo en reconocimiento facial. El proceso típico implica el preprocesamiento de las imágenes (por ejemplo, normalización, aumento de datos) y luego el entrenamiento de una CNN con una capa de clasificación que genera probabilidades de identidad. Después del entrenamiento, la capa de clasificación se elimina y las activaciones de la penúltima capa sirven como incrustaciones faciales. Estas incrustaciones se utilizan luego para tareas de verificación o identificación. El conjunto de datos también se utiliza para el aprendizaje por transferencia, donde los modelos preentrenados en CASIA-WebFace se ajustan en conjuntos de datos más pequeños y específicos del dominio. Su tamaño y diversidad lo convierten en una opción práctica para investigadores con recursos computacionales limitados, ya que puede procesarse en una sola GPU en unos pocos días.
Legado y alternativas
Desde su publicación, CASIA-WebFace ha sido superado por conjuntos de datos más grandes como MS-Celeb-1M, VGGFace2 y WebFace260M. Sin embargo, sigue siendo una opción popular para la evaluación comparativa y para investigadores que requieren un tamaño de conjunto de datos manejable. El conjunto de datos también se ha utilizado en competiciones y como línea base en muchos artículos. Su influencia se extiende más allá del reconocimiento facial a la investigación general de visión por computadora, donde sirve como ejemplo de recopilación y anotación de datos a gran escala. A partir de 2025, CASIA-WebFace sigue siendo accesible para uso académico, aunque se anima a los investigadores a considerar las implicaciones éticas y utilizar conjuntos de datos más nuevos y obtenidos de manera más responsable cuando sea posible.