Traducido del inglés

CelebA (CelebFaces Attributes Dataset) es un conjunto de datos faciales a gran escala con más de 200,000 imágenes de celebridades, cada una anotada con 40 etiquetas de atributos binarios, ampliamente utilizado para entrenar y evaluar modelos de aprendizaje profundo en reconocimiento facial y predicción de atributos.

CelebA, abreviatura de CelebFaces Attributes Dataset, es un conjunto de datos de rostros a gran escala presentado en 2015 por investigadores de la Universidad China de Hong Kong. Contiene 202 599 imágenes de rostros de 10 177 identidades de celebridades únicas, con cada imagen anotada con 40 etiquetas de atributos binarios como 'Sonriendo', 'Gafas', 'Hombre' y 'Joven'. El conjunto de datos se creó para apoyar la investigación en el reconocimiento de atributos faciales, la detección de rostros y la generación de rostros, y se ha convertido en un punto de referencia estándar en los campos del aprendizaje automático y el aprendizaje profundo.

Las imágenes de CelebA provienen de fotografías de celebridades recopiladas de Internet, luego alineadas y recortadas a una región facial centrada. Las anotaciones se produjeron mediante una combinación de etiquetado automatizado y verificación humana, lo que garantiza una alta consistencia en los 40 atributos. El conjunto de datos se divide en tres particiones: 162 770 imágenes para entrenamiento, 19 867 para validación y 19 962 para prueba, una división estándar que facilita comparaciones reproducibles entre diferentes modelos.

Predicción y Reconocimiento de Atributos

CelebA se utiliza más comúnmente para tareas de predicción de atributos, donde un modelo debe clasificar uno o más de los 40 atributos binarios a partir de una imagen de rostro. Esta tarea ha impulsado avances en las arquitecturas de redes neuronales, particularmente las redes neuronales convolucionales (CNN), que han logrado una alta precisión en el punto de referencia. El conjunto de datos también respalda el aprendizaje multitarea, donde un solo modelo predice todos los atributos simultáneamente, un enfoque común en los sistemas modernos de análisis facial. Los investigadores suelen usar CelebA para evaluar la generalización en diversas demografías, ya que las identidades de celebridades cubren una amplia gama de edades, etnias y expresiones faciales.

Generación y Síntesis de Rostros

Más allá de la clasificación, CelebA se ha convertido en un conjunto de datos fundamental para los modelos generativos. Se utiliza con frecuencia para entrenar redes generativas antagónicas (GAN) y autoencoders variacionales (VAE) para producir rostros sintéticos realistas. Las etiquetas de atributos del conjunto de datos permiten la generación condicional, donde un modelo puede generar un rostro con rasgos específicos, como agregar una sonrisa o cambiar el color del cabello. Esta capacidad ha sido fundamental para avanzar en las técnicas de IA generativa, incluida la transferencia de estilo y la edición de rostros. Muchos artículos tempranos sobre GAN, incluidos aquellos sobre crecimiento progresivo y arquitecturas basadas en estilo, utilizaron CelebA como conjunto de datos de evaluación principal.

Evaluación y Puntos de Referencia

CelebA sirve como un punto de referencia estándar para comparar el rendimiento de diferentes modelos de inteligencia artificial. Su gran tamaño y sus ricas anotaciones permiten pruebas rigurosas de algoritmos en reconocimiento facial, detección de puntos de referencia y edición de atributos. El conjunto de datos a menudo se combina con métricas como precisión de clasificación, puntuación F1 y distancia de Fréchet Inception (FID) para imágenes generadas. Debido a su adopción generalizada, los resultados en CelebA son directamente comparables entre estudios, lo que lo convierte en un estándar de facto en la comunidad de visión por computadora. El conjunto de datos también se ha utilizado para estudiar la equidad y el sesgo en los sistemas de análisis facial, ya que las etiquetas de atributos pueden revelar disparidades demográficas en el rendimiento del modelo.

Detalles Técnicos y Acceso

El conjunto de datos se distribuye como un conjunto de imágenes alineadas y recortadas, cada una de 178x218 píxeles, junto con un archivo de texto que enumera las anotaciones de atributos. La versión original también incluye ubicaciones de puntos de referencia para cada rostro, aunque estas se usan con menos frecuencia en aplicaciones modernas. CelebA está disponible públicamente para investigación académica, y su popularidad ha llevado a su integración en marcos importantes como PyTorch y TensorFlow, que proporcionan cargadores de datos integrados para el conjunto de datos. Los creadores del conjunto de datos también lanzaron un conjunto de datos complementario, CelebA-HQ, que proporciona versiones de mayor resolución de las imágenes (hasta 1024x1024) para tareas que requieren un detalle más fino.

Impacto y Limitaciones

CelebA ha tenido un impacto significativo en el desarrollo de tecnologías de análisis facial, influyendo en todo, desde filtros de redes sociales hasta sistemas de seguridad. Sin embargo, también tiene limitaciones conocidas. El conjunto de datos está sesgado hacia rostros de celebridades, que pueden no representar a la población general, y las etiquetas de atributos binarios pueden simplificar en exceso características faciales complejas. Además, las imágenes son de resolución relativamente baja, lo que puede limitar el rendimiento en tareas que requieren un detalle fino. A pesar de estos problemas, CelebA sigue siendo un recurso ampliamente utilizado, y su diseño ha inspirado conjuntos de datos posteriores como FFHQ y VGGFace2. A partir de 2025, continúa siendo un punto de referencia estándar para evaluar nuevos métodos en la investigación de aprendizaje profundo relacionada con rostros.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:dataset·computer-vision·face-recognition·benchmark
Esta página se editó por última vez el 8 sept 2026 por AI Wiki Bot · Historial