CIFAR-100 es un conjunto de datos de 60 000 imágenes en color de 32x32 píxeles distribuidas en 100 clases, con 600 imágenes por clase. Es un subconjunto etiquetado del conjunto de datos 80 Million Tiny Images, publicado en 2009 por investigadores del Canadian Institute For Advanced Research. El conjunto de datos se utiliza comúnmente para entrenar y evaluar algoritmos de aprendizaje automático y visión por computadora, en particular modelos de aprendizaje profundo. Su baja resolución permite a los investigadores probar rápidamente diferentes enfoques antes de escalar a conjuntos de datos más grandes.
Las 100 clases se agrupan en 20 superclases. Por ejemplo, la superclase 'mamíferos acuáticos' incluye castores, delfines, nutrias, focas y ballenas. Cada imagen tiene dos etiquetas: una etiqueta fina (la clase específica) y una etiqueta gruesa (la superclase). Esta estructura permite tanto la clasificación de grano fino como tareas de aprendizaje jerárquico. El conjunto de datos se divide en 50 000 imágenes de entrenamiento y 10 000 imágenes de prueba, con 500 imágenes de entrenamiento y 100 de prueba por clase.
Historia y creación
CIFAR-100 se introdujo junto con CIFAR-10 en 2009. Las imágenes se obtuvieron del conjunto de datos 80 Million Tiny Images, una colección de imágenes de baja resolución recopiladas de la web. Se pagó a estudiantes para etiquetar las imágenes, garantizando una verdad fundamental precisa. El conjunto de datos se creó para ofrecer una alternativa más desafiante a CIFAR-10, que solo tiene 10 clases. El mayor número de clases aumenta la dificultad de las tareas de clasificación, lo que convierte a CIFAR-100 en un punto de referencia estándar para evaluar arquitecturas de redes neuronales.
Uso en aprendizaje automático
CIFAR-100 se utiliza ampliamente en la investigación de aprendizaje automático para tareas como clasificación de imágenes, reconocimiento de objetos y aprendizaje por transferencia. Los investigadores suelen usarlo para comparar el rendimiento de diferentes modelos de inteligencia artificial. Las redes neuronales convolucionales (CNN) tienden a lograr los mejores resultados en CIFAR-100, de manera similar a CIFAR-10. El conjunto de datos también se utiliza para evaluar la eficiencia computacional, ya que los equipos compiten por entrenar modelos más rápido y a menor costo en hardware como AWS Trainium o sistemas Cerebras.
Puntos de referencia y estado del arte
Muchos artículos de investigación reportan resultados de vanguardia en CIFAR-100, pero las comparaciones se complican por las diversas técnicas de preprocesamiento, como volteo de imágenes, desplazamiento y aumento de datos. Algunos modelos logran tasas de error inferiores al 10 %, pero las clasificaciones exactas dependen de las configuraciones experimentales. El conjunto de datos también forma parte de DAWNBench, un conjunto de pruebas para el rendimiento de entrenamiento e inferencia. En los últimos años, los modelos basados en transformers y las CNN avanzadas han mostrado un rendimiento sólido, aunque ninguna arquitectura domina de manera absoluta.
Conjuntos de datos relacionados
CIFAR-100 forma parte de una familia de conjuntos de datos similares. CIFAR-10 tiene 10 clases con 6000 imágenes cada una. CIFAR-10H proporciona etiquetas de incertidumbre perceptual humana para las imágenes de CIFAR-10. ImageNet (ILSVRC) contiene más de un millón de imágenes de mayor resolución distribuidas en 1000 clases. El conjunto de datos Street View House Numbers (SVHN) contiene imágenes en color de 32x32 píxeles de dígitos. El conjunto de datos 80 Million Tiny Images sirve como fuente para ambas variantes de CIFAR. Estos conjuntos de datos en conjunto respaldan la investigación en visión por computadora y aprendizaje profundo.
Véase también
- Base de datos MNIST
- Lista de conjuntos de datos para investigación en aprendizaje automático