CIFAR-100-C es un conjunto de datos de referencia diseñado para evaluar la robustez de los modelos de aprendizaje automático frente a corrupciones comunes de imágenes. Consiste en versiones corruptas del conjunto de prueba de CIFAR-100, creadas aplicando 15 tipos de distorsiones en cinco niveles de severidad. El conjunto de datos se utiliza ampliamente en la investigación de robustez para medir cómo los modelos se generalizan a perturbaciones inesperadas en la entrada, complementando las métricas estándar de precisión.
El conjunto de datos original de CIFAR-100 contiene 60,000 imágenes en color de 32x32 en 100 clases, con 50,000 imágenes de entrenamiento y 10,000 imágenes de prueba. CIFAR-100-C toma las 10,000 imágenes de prueba y aplica cada tipo de corrupción en cada nivel de severidad, lo que resulta en 75,000 imágenes corruptas (15 corrupciones x 5 severidades x 10,000 imágenes). Las corrupciones simulan distorsiones del mundo real, como ruido, desenfoque, efectos climáticos y artefactos digitales.
Tipos de corrupción
Los 15 tipos de corrupción se agrupan en cuatro categorías: ruido (gaussiano, de disparo, impulsivo), desenfoque (desenfoque de desenfoque, congelado, de vidrio, de movimiento, de zoom), clima (nieve, escarcha, niebla, brillo) y digital (contraste, elástico, pixelado, JPEG). Cada corrupción se aplica algorítmicamente, con niveles de severidad que van desde 1 (leve) hasta 5 (severo). Por ejemplo, el ruido gaussiano añade valores de píxel aleatorios, mientras que el desenfoque de movimiento simula el movimiento de la cámara. El conjunto de datos se genera utilizando un código estandarizado, lo que garantiza la reproducibilidad entre estudios.
Uso en la evaluación de robustez
CIFAR-100-C se utiliza comúnmente para medir la robustez de las redes neuronales y otros modelos de aprendizaje automático. Los investigadores informan la tasa de error promedio en todas las corrupciones y severidades, a menudo denominada error de corrupción medio (mCE). Los modelos entrenados con técnicas de aumento de datos, como recortes aleatorios o variación de color, suelen tener un mejor rendimiento en CIFAR-100-C que los modelos entrenados sin ellas. El punto de referencia se ha convertido en una herramienta estándar en la comunidad de robustez, junto con CIFAR-10-C e ImageNet-C.
Relación con otros puntos de referencia
CIFAR-100-C es parte de una familia de puntos de referencia de corrupción introducidos por Hendrycks y Dietterich en 2019, que también incluye CIFAR-10-C e ImageNet-C. Estos conjuntos de datos comparten los mismos tipos de corrupción y niveles de severidad, lo que permite comparaciones entre conjuntos de datos. El punto de referencia se utiliza a menudo junto con evaluaciones de robustez adversarial, aunque se centra en corrupciones naturales en lugar de perturbaciones maliciosas. También se utiliza para estudiar los efectos de la normalización por lotes y otras elecciones arquitectónicas en la robustez.
Limitaciones y extensiones
Aunque CIFAR-100-C se utiliza ampliamente, tiene limitaciones. Las corrupciones son sintéticas y pueden no capturar completamente los cambios de distribución del mundo real. Algunos investigadores han propuesto extensiones, como CIFAR-100-P, que incluye corrupciones temporalmente correlacionadas para secuencias similares a video. Otros han utilizado CIFAR-100-C para evaluar la robustez de los modelos de lenguaje grandes cuando se aplican a tareas de visión, aunque tales aplicaciones son menos comunes. El conjunto de datos sigue siendo un recurso valioso para evaluar la robustez, especialmente para modelos a pequeña escala y experimentos rápidos.