El conjunto de datos CIFAR-10 (Canadian Institute For Advanced Research) es una colección de 60,000 imágenes en color de baja resolución utilizadas para entrenar y evaluar algoritmos de aprendizaje automático y visión por computadora. Publicado en 2009, se ha convertido en uno de los puntos de referencia más utilizados en el campo, permitiendo a los investigadores probar rápidamente diferentes enfoques para el reconocimiento de objetos. El conjunto de datos consiste en imágenes de 32x32 píxeles en 10 clases - aviones, automóviles, pájaros, gatos, ciervos, perros, ranas, caballos, barcos y camiones - con 6,000 imágenes por clase.
CIFAR-10 es un subconjunto etiquetado del conjunto de datos 80 Million Tiny Images de 2008. Cuando se creó el conjunto de datos, se pagó a estudiantes para etiquetar todas las imágenes. Debido a que las imágenes son de baja resolución, el conjunto de datos permite una experimentación rápida con diferentes algoritmos, lo que lo convierte en un punto de partida estándar para investigadores que desarrollan nuevas técnicas en aprendizaje automático y inteligencia artificial.
Estructura del Conjunto de Datos
Las 60,000 imágenes se dividen típicamente en 50,000 imágenes de entrenamiento y 10,000 imágenes de prueba. Cada imagen es una fotografía en color de 32x32 con tres canales (rojo, verde, azul), lo que resulta en un total de 3,072 píxeles por imagen. Las 10 clases son mutuamente excluyentes - cada imagen pertenece exactamente a una categoría. El pequeño tamaño de las imágenes distingue a CIFAR-10 de conjuntos de datos de mayor resolución como ImageNet, que contiene imágenes con una resolución promedio de 469x387.
Rol en la Investigación de Aprendizaje Automático
Los algoritmos informáticos para reconocer objetos en fotografías a menudo aprenden mediante ejemplos, y CIFAR-10 proporciona un conjunto estandarizado de ejemplos para este propósito. Varios tipos de redes neuronales convolucionales tienden a ser los mejores para reconocer las imágenes en CIFAR-10. El conjunto de datos ha sido fundamental para rastrear el progreso en aprendizaje profundo, desde las primeras redes superficiales hasta arquitecturas modernas con conexiones residuales y mecanismos de atención.
Los artículos de investigación que afirman resultados de última generación en CIFAR-10 han aparecido de manera consistente desde su publicación. Sin embargo, no todos los artículos están estandarizados en las mismas técnicas de preprocesamiento, como el volteo de imágenes o el desplazamiento de imágenes. Por esa razón, la afirmación de un artículo de ser de última generación podría tener una tasa de error más alta que una afirmación más antigua, pero aun así ser válida bajo diferentes condiciones de preprocesamiento.
Puntos de Referencia y Rendimiento
Más allá del desarrollo de algoritmos, CIFAR-10 se utiliza como un punto de referencia de rendimiento para equipos que compiten por ejecutar redes neuronales de manera más rápida y económica. La competencia DAWNBench, por ejemplo, tiene datos de referencia en su sitio web que comparan el tiempo y el costo de entrenamiento en diferentes configuraciones de hardware y software. Este uso conecta el conjunto de datos con esfuerzos de infraestructura más amplios de empresas como Google Cloud, Amazon Web Services y Azure.
Conjuntos de Datos Similares
Varios conjuntos de datos relacionados extienden o complementan a CIFAR-10. CIFAR-100 es similar pero contiene 100 clases con 600 imágenes cada una. CIFAR-10H es una versión etiquetada con incertidumbre perceptual humana. El conjunto de datos ImageNet (ILSVRC) contiene 1 millón de imágenes en color de 1,000 clases a mayor resolución. El conjunto de datos Street View House Numbers (SVHN) proporciona aproximadamente 600,000 imágenes de 10 clases (dígitos 0-9) también a resolución de 32x32. El conjunto de datos 80 Million Tiny Images sirve como el conjunto padre del cual se derivó CIFAR-10.
Véase También
- Lista de conjuntos de datos para investigación en aprendizaje automático
- Base de datos MNIST
Referencias
- Página de CIFAR-10 - El hogar del conjunto de datos
- Canadian Institute For Advanced Research