PASCAL VOC 2012 es un conjunto de datos de referencia para la detección de objetos, clasificación y segmentación, parte de la serie de desafíos PASCAL Visual Object Classes (VOC). Proporciona imágenes etiquetadas en 20 categorías de objetos, con anotaciones para tareas de clasificación, detección y segmentación. Publicado en 2012, se convirtió en un conjunto de evaluación estándar para algoritmos de visión por computadora, influyendo en el desarrollo de modelos de aprendizaje profundo como ResNet y U-Net.
El conjunto de datos contiene 11,530 imágenes para entrenamiento y validación, y 10,991 imágenes para pruebas, con anotaciones que cubren 20 clases, incluyendo personas, animales, vehículos y artículos del hogar. El desafío también introdujo una marca de "difícil" para instancias ambiguas y una marca de "truncado" para objetos cortados por los límites de la imagen. Las anotaciones de segmentación se proporcionan como máscaras a nivel de píxel, lo que permite la evaluación tanto semántica como a nivel de instancia.
Historia y Contexto
Los desafíos PASCAL VOC se llevaron a cabo de 2005 a 2012, organizados por la Red de Excelencia PASCAL, un proyecto financiado por la Unión Europea. La edición de 2012 fue la última, y su conjunto de datos se convirtió en un punto de referencia duradero. Antes del auge de conjuntos de datos a gran escala como ImageNet y COCO, VOC 2012 era el principal punto de referencia para la detección de objetos y la segmentación. Su tamaño relativamente pequeño (en comparación con conjuntos de datos posteriores) facilitaba a los investigadores iterar rápidamente, pero también planteaba desafíos para entrenar modelos profundos sin sobreajuste.
El desafío incluía tareas de clasificación (predicción de presencia de objetos), detección (cajas delimitadoras) y segmentación (máscaras a nivel de píxel). Las métricas de evaluación incluían precisión promedio (AP) para detección e intersección sobre unión media (mIoU) para segmentación. El desafío de 2012 atrajo a numerosos equipos académicos e industriales, y las soluciones ganadoras a menudo impulsaban el estado del arte.
Estructura del Conjunto de Datos y Anotaciones
Las imágenes de VOC 2012 provienen de Flickr y otras colecciones públicas, con un enfoque en escenas realistas. Cada imagen puede contener múltiples objetos de diferentes categorías. Las anotaciones se almacenan en archivos XML para detección y clasificación, y en máscaras PNG para segmentación. El conjunto de datos se divide en subconjuntos de entrenamiento, validación y prueba, con etiquetas de prueba retenidas para la evaluación oficial. Los investigadores suelen usar los conjuntos de entrenamiento y validación para el desarrollo, y el conjunto de prueba para informes finales.
Las 20 clases de objetos son: avión, bicicleta, pájaro, barco, botella, autobús, coche, gato, silla, vaca, mesa de comedor, perro, caballo, motocicleta, persona, planta en maceta, oveja, sofá, tren y televisor/monitor. La marca de "difícil" indica objetos que son demasiado pequeños o ambiguos, y estos generalmente se excluyen de la evaluación. La marca de "truncado" señala objetos parcialmente fuera del marco de la imagen.
Impacto en la Visión por Computadora
VOC 2012 desempeñó un papel crucial en el desarrollo de métodos modernos de detección de objetos y segmentación. Los primeros detectores de aprendizaje profundo, como R-CNN y sus variantes, se evaluaron en VOC 2012 y mostraron mejoras significativas sobre los métodos tradicionales basados en características. El conjunto de datos también popularizó el uso de la precisión promedio media (mAP) como métrica estándar, que sigue siendo común en el campo.
Para la segmentación, VOC 2012 fue un punto de referencia clave para modelos como U-Net y posteriores redes totalmente convolucionales. Las anotaciones a nivel de píxel permitieron a los investigadores desarrollar y comparar técnicas de segmentación semántica. El tamaño moderado del conjunto de datos fomentó el uso de aumento de datos y aprendizaje por transferencia desde conjuntos de datos más grandes como ImageNet.
Legado y Uso Continuado
Aunque el desafío PASCAL VOC terminó en 2012, el conjunto de datos sigue siendo ampliamente utilizado para investigación y educación. Muchos artículos aún informan resultados en VOC 2012, a menudo en combinación con otros puntos de referencia. Sirve como una verificación de cordura para nuevos modelos y como un terreno común para comparar métodos. El conjunto de datos también se utiliza en cursos académicos para enseñar detección de objetos y segmentación.
Conjuntos de datos posteriores, como COCO, tienen mayor escala y más categorías, pero VOC 2012 conserva su importancia debido a su simplicidad y su protocolo de evaluación bien definido. El servidor de evaluación oficial, mantenido por la Universidad de Oxford, aún permite envíos para el conjunto de prueba, lo que garantiza una comparación consistente a lo largo de los años.
Limitaciones y Críticas
VOC 2012 ha sido criticado por su número limitado de categorías e imágenes en comparación con conjuntos de datos modernos. Las imágenes también son de resolución relativamente baja, lo que puede dificultar el entrenamiento de modelos de alta resolución. La calidad de las anotaciones es generalmente alta, pero algunas etiquetas contienen errores o inconsistencias. Además, el conjunto de datos presenta sesgos comunes en imágenes obtenidas de la web, como la sobrerrepresentación de ciertas poses y contextos de objetos.
A pesar de estas limitaciones, VOC 2012 sigue siendo un recurso valioso. Su pequeño tamaño permite una creación rápida de prototipos, y sus métricas bien comprendidas facilitan comparaciones claras. Los investigadores a menudo lo usan como punto de partida antes de escalar a conjuntos de datos más grandes.