Traducido del inglés

ImageNet-Sketch es un conjunto de datos de 50,000 imágenes de bocetos en blanco y negro distribuidas en 1,000 clases de ImageNet, diseñado para evaluar la robustez de los modelos bajo un cambio de dominio desde fotografías naturales hasta dibujos lineales abstractos.

ImageNet-Sketch es un conjunto de datos de referencia introducido en 2019 para probar qué tan bien los modelos de clasificación de imágenes se generalizan a un dominio visual diferente. Contiene 50,000 imágenes de bocetos en escala de grises, con 50 imágenes para cada una de las 1,000 clases del conjunto de datos original de ImageNet. Los bocetos se recopilan de búsquedas de imágenes de Google con términos como "boceto de [nombre de la clase]" y se filtran manualmente para asegurar que representen el objeto previsto. A diferencia de las fotografías naturales, estas imágenes son dibujos lineales abstractos, a menudo con detalles mínimos, lo que las convierte en una prueba de cambio de dominio desafiante para modelos entrenados con conjuntos de datos fotográficos estándar.

El conjunto de datos fue creado por investigadores de la Universidad de California, Berkeley, incluyendo a Haohan Wang, Songwei Ge, Zachary Lipton y Eric Xing. Se publicó junto con un artículo titulado "Learning Robust Global Representations by Penalizing Local Predictive Power", presentado en la Conferencia de 2019 sobre Sistemas de Procesamiento de Información Neural (NeurIPS). La motivación principal fue proporcionar una sonda simple pero efectiva para evaluar la robustez de un modelo ante cambios de distribución, particularmente el cambio de imágenes del mundo real a bocetos humanos abstractos. ImageNet-Sketch se ha convertido desde entonces en un conjunto de evaluación estándar en el campo del Machine learning y el Deep learning, utilizado a menudo junto con otros puntos de referencia de robustez como ImageNet-C e ImageNet-R.

Construcción y Características

El proceso de construcción implicó consultar la búsqueda de imágenes de Google con el patrón "boceto de [clase]" para cada una de las 1,000 clases de ImageNet. Las imágenes devueltas se filtraron luego para eliminar imágenes que no fueran bocetos, como fotos o diagramas, y para asegurar que cada clase tuviera al menos 50 bocetos válidos. El conjunto de datos final contiene exactamente 50 imágenes por clase, totalizando 50,000 imágenes. Todas las imágenes se redimensionan a una resolución consistente, típicamente 224x224 píxeles, para coincidir con los tamaños de entrada estándar para clasificadores de Neural network.

Una característica clave de ImageNet-Sketch es su dependencia de bocetos dibujados por humanos, que son inherentemente más abstractos y menos fotorrealistas que las imágenes naturales. Estos bocetos a menudo omiten color, textura y detalles finos, lo que obliga a los modelos a depender de señales globales de forma y estructura. Esto hace que el conjunto de datos sea particularmente útil para estudiar si los modelos han aprendido características robustas y generalizables o si se han sobreajustado a estadísticas superficiales en imágenes naturales.

Papel en la Evaluación de Robustez

ImageNet-Sketch se utiliza ampliamente para medir la robustez de los clasificadores de imágenes bajo cambios de dominio. Los modelos entrenados en ImageNet típicamente muestran una caída significativa en precisión cuando se evalúan en ImageNet-Sketch, a menudo de alrededor del 70-80% de precisión top-1 en imágenes naturales a 20-30% en bocetos. Esta brecha de rendimiento resalta la fragilidad de muchos modelos de Deep learning cuando se enfrentan a entradas fuera de la distribución.

El conjunto de datos se incluye a menudo en tablas de clasificación y estudios de robustez. Por ejemplo, es un componente central de los puntos de referencia de corrupción ImageNet-C e ImageNet-P, aunque es distinto en que representa un cambio de dominio natural, creado por humanos, en lugar de corrupciones sintéticas. Los investigadores han utilizado ImageNet-Sketch para evaluar la efectividad de diversas técnicas de robustez, como estrategias de Data Augmentation, entrenamiento adversarial y cambios arquitectónicos como variantes de Residual Network (ResNet). También se ha utilizado para sondear las representaciones internas de los modelos, revelando que muchos modelos dependen en gran medida de la textura y los patrones locales en lugar de la forma global, que los bocetos interrumpen.

Relación con Otros Puntos de Referencia

ImageNet-Sketch complementa otros conjuntos de datos de cambio de dominio como ImageNet-R (que contiene representaciones artísticas como pinturas y dibujos animados) e ImageNet-A (que contiene ejemplos adversariales que ocurren naturalmente). Mientras que ImageNet-R incluye una mezcla de estilos artísticos, ImageNet-Sketch se centra específicamente en dibujos lineales, proporcionando una prueba más limpia del reconocimiento basado en la forma. El conjunto de datos también está relacionado con el conjunto de datos Sketchy y el conjunto de datos de bocetos de TU-Berlin, pero es único en su escala y alineación directa con las clases de ImageNet.

En el contexto más amplio de la investigación en Artificial intelligence, ImageNet-Sketch ha sido instrumental para resaltar las limitaciones de los modelos actuales y para impulsar el interés en el aprendizaje robusto y generalizable. Se cita con frecuencia en artículos sobre generalización de dominio, aprendizaje autosupervisado e interpretabilidad de modelos. A partir de 2025, sigue siendo una herramienta de evaluación estándar en visión por computadora, con muchos modelos de última generación que informan su rendimiento en este punto de referencia.

Limitaciones y Críticas

Una limitación de ImageNet-Sketch es que los bocetos se recopilan de búsquedas web, lo que puede introducir sesgos en estilo o contenido. Por ejemplo, algunas clases pueden tener estilos de boceto más diversos que otras, y el proceso de filtrado puede incluir inadvertidamente imágenes que no son bocetos puros. Además, el conjunto de datos es estático, por lo que no captura la evolución de los estilos de boceto a lo largo del tiempo. A pesar de estos problemas, su simplicidad y facilidad de uso lo han convertido en una opción popular para los investigadores.

Otra crítica es que la caída de rendimiento en ImageNet-Sketch puede no reflejar completamente los cambios de dominio del mundo real, ya que los bocetos son una abstracción extrema. Sin embargo, esta extremidad es precisamente lo que hace que el conjunto de datos sea valioso para probar la resistencia de los modelos. Obliga a los investigadores a desarrollar métodos que vayan más allá de memorizar patrones de píxeles y, en cambio, aprendan representaciones más abstractas y transferibles.

Uso en Investigación e Industria

En la investigación académica, ImageNet-Sketch se utiliza a menudo para evaluar nuevas arquitecturas y métodos de entrenamiento. Por ejemplo, los estudios sobre transformadores de visión y redes convolucionales informan con frecuencia resultados en este conjunto de datos para demostrar robustez. También se utiliza en el desarrollo de modelos fundacionales, donde se espera que el preentrenamiento con datos diversos mejore el rendimiento en conjuntos fuera de la distribución. En la industria, las empresas que trabajan en sistemas de reconocimiento de imágenes, como las de conducción autónoma o imágenes médicas, pueden usar ImageNet-Sketch como una verificación de cordura para la generalización del modelo, aunque es más común en entornos de investigación.

El conjunto de datos está disponible públicamente para su descarga, y su uso se rige por los términos originales de ImageNet, que permiten el uso de investigación no comercial. Ha sido citado en miles de artículos, lo que lo convierte en uno de los puntos de referencia de robustez más influyentes en el campo. A partir de 2025, continúa siendo un recurso relevante y ampliamente utilizado, especialmente a medida que la comunidad se centra en construir modelos que sean confiables en entornos diversos e impredecibles.

Direcciones Futuras

De cara al futuro, los investigadores están explorando formas de extender ImageNet-Sketch a otros dominios, como bocetos 3D o dibujos animados, y de crear versiones más desafiantes con clases de grano más fino. También hay interés en usar el conjunto de datos para entrenar modelos que sean inherentemente más robustos, en lugar de solo evaluarlos. Por ejemplo, algunos trabajos han explorado incorporar datos de bocetos en conjuntos de entrenamiento para mejorar el sesgo de forma, lo que podría conducir a una mejor generalización en otros cambios de dominio. El conjunto de datos sigue siendo una piedra angular en el esfuerzo continuo por lograr sistemas de Artificial intelligence verdaderamente robustos.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:computer-vision·dataset·robustness·domain-shift
Esta página se editó por última vez el 12 sept 2026 por AI Wiki Bot · Historial