Oxford Flowers es un conjunto de datos de referencia para la clasificación visual de grano fino, desarrollado en el Grupo de Geometría Visual de la Universidad de Oxford. El conjunto de datos contiene 8,189 imágenes de 102 categorías de flores que se encuentran comúnmente en el Reino Unido. Cada categoría consta de entre 40 y 258 imágenes, con variaciones en escala, pose y condiciones de iluminación. El conjunto de datos fue presentado en 2008 por Maria-Elena Nilsback y Andrew Zisserman, quienes también proporcionaron un conjunto de datos complementario, el Oxford Flower Dataset de 17 categorías, como precursor más pequeño.
El propósito principal de Oxford Flowers es apoyar la investigación en clasificación de imágenes de grano fino, donde el objetivo es distinguir entre subcategorías visualmente similares dentro de una única categoría de nivel básico. A diferencia de los conjuntos de datos de reconocimiento de objetos generales, como ImageNet, Oxford Flowers se centra en diferencias sutiles en color, forma y textura. El conjunto de datos incluye máscaras de segmentación a nivel de píxel para cada flor, lo que permite la investigación tanto en tareas de clasificación como de segmentación. Las imágenes provienen de varios sitios web de fotografía y no se capturan en condiciones controladas, lo que añade realismo y dificultad.
Estructura del Conjunto de Datos
El conjunto de datos se divide en tres particiones predefinidas: entrenamiento, validación y prueba. El conjunto de entrenamiento contiene 1,020 imágenes (10 por clase), el conjunto de validación contiene 1,020 imágenes (10 por clase) y el conjunto de prueba contiene 6,149 imágenes (el resto). Esta división fija se utiliza comúnmente para una comparación justa entre diferentes modelos. Cada imagen está asociada con una etiqueta del 1 al 102, y las máscaras de segmentación se proporcionan como imágenes binarias. El conjunto de datos también incluye un conjunto de etiquetas y un archivo de texto que lista los nombres de las clases, que corresponden a flores silvestres comunes del Reino Unido, como la campanilla azul, la prímula y la campanilla de invierno.
Impacto en la Investigación
Oxford Flowers ha sido un estándar de referencia en visión por computadora desde su publicación. Se ha utilizado para evaluar una amplia gama de enfoques de Machine learning, desde métodos de características diseñadas manualmente, como histogramas de color y descriptores de forma, hasta modelos modernos de Deep learning. En particular, ha sido fundamental en el desarrollo de técnicas de reconocimiento de grano fino, incluidos modelos basados en partes y mecanismos de atención. El conjunto de datos también se ha utilizado en estudios sobre Data Augmentation, Transfer learning y Few-shot learning, ya que el número limitado de ejemplos de entrenamiento por clase plantea un desafío para la generalización.
Métodos y Resultados Notables
Los primeros trabajos con Oxford Flowers lograron una precisión de clasificación de alrededor del 60-70% utilizando máquinas de vectores de soporte con características diseñadas manualmente. La introducción de las redes neuronales convolucionales (CNNs) mejoró significativamente el rendimiento. Por ejemplo, un modelo ResNet ajustado puede lograr más del 95% de precisión en el conjunto de prueba. El conjunto de datos también se ha utilizado para evaluar mecanismos de atención y arquitecturas basadas en Transformer (architecture), con modelos de última generación que alcanzan una precisión casi perfecta. Sin embargo, el tamaño relativamente pequeño del conjunto de datos en comparación con los estándares modernos significa que a menudo se utiliza como un punto de referencia secundario en lugar de uno principal, y los investigadores reportan resultados junto con conjuntos de datos más grandes como CIFAR-100 o ImageNet.
Extensiones y Variantes
El conjunto de datos original de 102 categorías ha inspirado varias extensiones. El Oxford Flower Dataset (17 categorías) es una versión más pequeña utilizada para la creación rápida de prototipos. Además, el conjunto de datos se ha incorporado en puntos de referencia más grandes, como el desafío Visual Decathlon, que evalúa modelos en múltiples conjuntos de datos diversos. Algunos investigadores también han creado variantes sintéticas o aplicado técnicas de Data Augmentation para aumentar el tamaño efectivo del conjunto de entrenamiento. Las máscaras de segmentación se han utilizado en estudios sobre segmentación de imágenes y modelos generativos, como la síntesis de imágenes condicional.
Limitaciones
A pesar de su popularidad, Oxford Flowers tiene limitaciones. Las imágenes son de resolución relativamente baja (dimensión máxima de alrededor de 500 píxeles), lo que puede no reflejar escenarios de alta resolución del mundo real. El conjunto de datos también está sesgado hacia la flora del Reino Unido, lo que limita su aplicabilidad a otras regiones geográficas. Además, la división fija de entrenamiento/validación/prueba, aunque conveniente, puede llevar a un sobreajuste si los modelos se ajustan repetidamente en el conjunto de validación. A partir de mediados de la década de 2020, el conjunto de datos se considera relativamente pequeño en comparación con los puntos de referencia modernos a gran escala, y su papel ha pasado de ser un desafío principal a una verificación de cordura para algoritmos de clasificación de grano fino.
Véase También
- Computer vision
- clasificación de imágenes
- reconocimiento de grano fino
- grupo de geometría visual