ImageNet-Sketch es un conjunto de datos de referencia introducido en 2019 para evaluar la generalización entre dominios de los modelos de aprendizaje automático. Contiene 50,000 imágenes de bocetos en escala de grises, con 50 imágenes para cada una de las 1,000 clases del conjunto de datos original de ImageNet. Los bocetos se recopilan del proyecto QuickDraw de Google y otras fuentes, y representan una representación estilizada y abstracta de objetos, que difiere significativamente de las fotografías naturales. Este conjunto de datos se utiliza ampliamente en la investigación de visión por computadora para probar qué tan bien los modelos entrenados con imágenes naturales pueden reconocer bocetos, una tarea que requiere robustez ante el cambio de dominio.
El conjunto de datos fue creado por investigadores del MIT y Google, y se presentó por primera vez en el artículo 'Learning Robust Representations by Projecting Supervisory Signals' de Haotian Wang, Weichao Qiu y otros. La motivación principal fue proporcionar un conjunto de evaluación desafiante que vaya más allá de los conjuntos de prueba estándar, que a menudo comparten la misma distribución que los datos de entrenamiento. Al usar bocetos, que son visualmente distintos de las fotos, ImageNet-Sketch obliga a los modelos a depender de características semánticas de alto nivel en lugar de señales de textura o color de bajo nivel.
Construcción y Composición
ImageNet-Sketch comprende 50,000 imágenes, con exactamente 50 bocetos por clase en las 1,000 categorías de ImageNet. Los bocetos provienen del conjunto de datos QuickDraw, que contiene millones de garabatos dibujados por usuarios, y se filtran para coincidir con las etiquetas de clase de ImageNet. Cada boceto es un dibujo lineal en blanco y negro, típicamente simple y abstracto, que captura la forma esencial de un objeto. El conjunto de datos evita intencionalmente la información de color y textura, lo que lo convierte en una prueba pura de reconocimiento basado en la forma.
El proceso de construcción implicó emparejar categorías de QuickDraw con synsets de ImageNet y luego seleccionar un subconjunto de bocetos considerados representativos. El conjunto de datos final está disponible públicamente para su descarga y se ha convertido en un estándar de referencia en el campo. Los investigadores a menudo lo usan junto con otros conjuntos de datos, como ImageNet-C o ImageNet-A, para evaluar la robustez ante varios tipos de cambio de distribución.
Uso en la Evaluación de Modelos
ImageNet-Sketch se utiliza principalmente para evaluar la generalización entre dominios de modelos de Deep learning, particularmente redes neuronales convolucionales y arquitecturas más recientes basadas en Transformer (architecture). Cuando un modelo se entrena con ImageNet (imágenes naturales) y se prueba con ImageNet-Sketch, la caída en el rendimiento indica qué tan bien el modelo ha aprendido características transferibles. Los modelos que dependen en gran medida de la textura o las señales de fondo tienden a rendir mal, mientras que aquellos que capturan la forma y la estructura rinden mejor.
Por ejemplo, los modelos ResNet y los transformers de visión se han evaluado en este punto de referencia. Los estudios han demostrado que los transformers de visión a menudo superan a las redes convolucionales en el reconocimiento de bocetos, posiblemente debido a sus mecanismos de atención global. El conjunto de datos también se utiliza en la investigación de Data Augmentation, donde se prueban técnicas como la transferencia de estilo o el entrenamiento adversarial por su capacidad para mejorar la robustez ante el cambio de dominio.
Relación con Otros Puntos de Referencia
ImageNet-Sketch es parte de una familia de puntos de referencia de robustez que incluyen ImageNet-C (corrupciones), ImageNet-A (ejemplos adversariales) e ImageNet-R (representaciones). Mientras que ImageNet-C aplica corrupciones sintéticas a imágenes naturales, ImageNet-Sketch proporciona un estilo visual completamente diferente. Esto lo convierte en una prueba complementaria para evaluar la generalización del modelo. El conjunto de datos se utiliza a menudo en tablas de clasificación y artículos de investigación para informar métricas de robustez junto con la precisión en el conjunto de validación original de ImageNet.
El conjunto de datos también se ha utilizado para estudiar el fenómeno del 'sesgo de textura' en las redes neuronales, donde los modelos tienden a depender de patrones de textura locales en lugar de la forma global. Al presentar bocetos que carecen de textura, ImageNet-Sketch expone este sesgo y fomenta el desarrollo de modelos más conscientes de la forma.
Limitaciones y Críticas
Una limitación de ImageNet-Sketch es que los bocetos no están distribuidos uniformemente en todas las clases; algunas clases pueden tener más o menos de 50 imágenes, aunque el conjunto de datos está diseñado para estar equilibrado. Además, los bocetos son relativamente simples y pueden no capturar la complejidad completa de los bocetos del mundo real, lo que podría limitar la generalización de los hallazgos. Algunos investigadores también han señalado que el conjunto de datos está sesgado hacia clases que son fáciles de dibujar, como animales y objetos comunes, mientras que las clases más abstractas pueden estar subrepresentadas.
A pesar de estas limitaciones, ImageNet-Sketch sigue siendo un recurso valioso para evaluar el rendimiento entre dominios. Se cita ampliamente en la literatura de visión por computadora y continúa utilizándose en estudios sobre robustez, aprendizaje por transferencia e interpretabilidad de modelos.