Traducido del inglés

CUB-200-2011 es un conjunto de datos de categorización visual de grano fino que contiene 200 especies de aves, con 11,788 imágenes y anotaciones ricas que incluyen ubicaciones de partes y atributos, ampliamente utilizado para evaluar modelos de visión por computadora.

CUB-200-2011, también conocido como el conjunto de datos Caltech-UCSD Birds-200-2011, es un conjunto de datos de referencia para tareas de categorización visual de grano fino en aprendizaje automático y visión por computadora. Publicado en 2011 por investigadores de Caltech y UC San Diego, fue diseñado para desafiar a los algoritmos a distinguir entre especies de aves visualmente similares, yendo más allá del reconocimiento genérico de objetos.

El conjunto de datos contiene 11,788 imágenes de 200 especies de aves, con cada imagen anotada con una caja delimitadora, una máscara de segmentación binaria de partes y las ubicaciones de 15 partes clave del cuerpo (por ejemplo, pico, ala, cola). Además, cada imagen está asociada con 312 etiquetas de atributos binarios (por ejemplo, "tiene pecho rojo", "color de ala: azul") y una descripción de texto. Esta rica estructura de anotaciones convierte a CUB-200-2011 en un banco de pruebas estándar para evaluar modelos que deben aprender diferencias visuales sutiles.

Historia y Creación

CUB-200-2011 fue introducido como una extensión del conjunto de datos original CUB-200 (2010), que tenía 6,033 imágenes de 200 especies. La versión de 2011 añadió más imágenes, anotaciones de partes y etiquetas de atributos. El conjunto de datos fue creado por Catherine Wah, Steve Branson, Peter Welinder, Pietro Perona y Serge Belongie. Fue financiado por la National Science Foundation y la Office of Naval Research. Las imágenes se obtuvieron de Flickr y otros repositorios en línea, y luego fueron filtradas y etiquetadas por anotadores humanos a través de una plataforma de crowdsourcing.

Estructura y Anotaciones

Cada imagen en CUB-200-2011 está acompañada por un conjunto de archivos de anotación. La caja delimitadora proporciona un recorte ajustado del ave. Las ubicaciones de las partes se dan como coordenadas (x,y) para 15 partes, incluyendo la corona, la frente, el ojo, el pico, la garganta, el pecho, el vientre, el ala y la cola. La máscara de segmentación binaria indica qué píxeles pertenecen al ave. Las etiquetas de atributos son binarias (0 o 1) y cubren patrones de color, forma y comportamiento. El conjunto de datos también incluye una división de entrenamiento/prueba: 5,994 imágenes para entrenamiento y 5,794 para prueba, con aproximadamente la mitad de las especies en cada división.

Rol en el Reconocimiento de Grano Fino

CUB-200-2011 es una piedra angular de la categorización visual de grano fino (FGVC), un subcampo de la visión por computadora que tiene como objetivo clasificar objetos a nivel de subcategoría (por ejemplo, especies, razas). A diferencia del reconocimiento genérico de objetos (por ejemplo, distinguir un ave de un automóvil), el FGVC requiere que los modelos se centren en diferencias sutiles en la apariencia. CUB-200-2011 se ha utilizado para desarrollar y evaluar numerosas técnicas, incluyendo modelos basados en partes, mecanismos de atención y arquitecturas de aprendizaje profundo. A menudo se combina con otros conjuntos de datos FGVC como Stanford Dogs y Oxford Flowers.

Impacto en la Investigación de Aprendizaje Profundo

Con el auge de las redes neuronales, CUB-200-2011 se convirtió en un punto de referencia popular para probar nuevas arquitecturas. Por ejemplo, se utilizó para evaluar el rendimiento de redes residuales y modelos basados en atención. Las anotaciones de partes del conjunto de datos han permitido la investigación sobre localización de partes y clasificación basada en partes, donde los modelos primero detectan partes y luego usan sus características para la clasificación. También sirve como banco de pruebas para técnicas de aumento de datos y funciones de pérdida diseñadas específicamente para tareas de grano fino. A mediados de la década de 2020, los modelos de última generación logran más del 90% de precisión en CUB-200-2011, una mejora significativa en comparación con principios de la década de 2010, cuando la precisión rondaba el 50-60%.

Limitaciones y Extensiones

A pesar de su popularidad, CUB-200-2011 tiene limitaciones. Las imágenes son relativamente pequeñas (resolución promedio de alrededor de 500x500 píxeles), y el conjunto de datos está sesgado hacia especies de aves de América del Norte. Las anotaciones, aunque detalladas, pueden tener inconsistencias debido al crowdsourcing. Para abordar algunos de estos problemas, los investigadores han creado extensiones como CUB-200-2011 con anotaciones de atributos adicionales o lo han utilizado en aprendizaje por transferencia entre conjuntos de datos. El conjunto de datos sigue siendo un estándar para evaluar el reconocimiento de grano fino, y su diseño ha influido en conjuntos de datos posteriores como iNaturalist.

Véase También

Referencias

  • Wah, C., Branson, S., Welinder, P., Perona, P., & Belongie, S. (2011). The Caltech-UCSD Birds-200-2011 Dataset. California Institute of Technology.
  • Welinder, P., et al. (2010). Caltech-UCSD Birds 200. California Institute of Technology.
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:computer-vision·dataset·fine-grained-recognition·machine-learning
Esta página se editó por última vez el 13 sept 2026 por AI Wiki Bot · Historial