PASCAL VOC 2012 é um conjunto de dados de referência para detección de objetos, classificação e segmentação, parte da série de desafios PASCAL Visual Object Classes (VOC). Fornece imagens rotuladas em 20 categorias de objetos, com anotações para tarefas de classificação, detección e segmentação. Lançado em 2012, tornou-se um conjunto de avaliação padrão para algoritmos de visão computacional, influenciando o desenvolvimento de modelos de aprendizado profundo como ResNet e U-Net.
O conjunto de dados contém 11.530 imagens para treinamento e validação, e 10.991 imagens para teste, com anotações que cobren 20 classes, incluindo pessoa, animal, vehículo e artículos domésticos. O desafio também introdujo uma marca "difícil" para instancias ambíguas e uma marca "truncada" para objetos cortados pelos límites da imagem. As anotações de segmentação são fornecidas como máscaras a nível de píxel, permitindo tanto a avaliação semántica como a de nível de instancia.
História e Contexto
Os desafios PASCAL VOC foram realizados de 2005 a 2012, organizados pela PASCAL Network of Excellence, um projeto financiado pela Unión Europea. A edición de 2012 foi a última, e seu conjunto de dados se converteu em um ponto de referencia duradeiro. Antes do surgimiento de conjuntos de dados em grande escala como ImageNet e COCO, VOC 2012 era o principal benchmark para detección de objetos e segmentación. Seu tamaño relativamente pequeño (em comparação com conjuntos de dados posteriores) fez que fosse viável para os investigadores iterar rapidamente, mas também apresentou desafíos para o treinamento de modelos profundos sem sobreajuste.
O desafío incluía tarefas de classificação (predicción da presencia de objetos), detección (caixas delimitadoras) e segmentación (máscaras a nível de píxel). As métricas de avaliação incluían precisión média (AP) para detección e intersección sobre unión média (mIoU) para segmentación. O desafío de 2012 atrajo numerosos equipos académicos e industriales, e as soluções vencedoras frequentemente empujaban o estado da arte.
Estrutura do Conjunto de Dados e Anotações
As imagens de VOC 2012 provienen de Flickr e outras colecciones públicas, com foco em escenas realistas. Cada imagem pode conter múltiples objetos de diferentes categorías. As anotações são almacenadas em arquivos XML para detección e classificação, e em máscaras PNG para segmentación. O conjunto de dados é dividido em subconjuntos de treinamento, validação e teste, com rótulos de teste retirados para a avaliação oficial. Os investigadores frequentemente usan os conjuntos de treinamento e validação para o desenvolvimento, e o conjunto de teste para o reporte final.
As 20 classes de objetos são: aeroplano, bicicleta, pájaro, barco, botella, autobús, carro, gato, cadeira, vaca, mesa de jantar, cão, caballo, motocicleta, persona, planta en maceta, oveja, sofá, tren e tv/monitor. A marca "difícil" indica objetos que são demasiado pequeños ou ambíguos, e estes são tipicamente excluídos da avaliação. A marca "truncada" marca objetos parcialmente fora do marco da imagem.
Impacto na Visão Computacional
VOC 2012 desempeñou um papel crucial no desenvolvimento de métodos modernos de detección de objetos e segmentación. Os primeiros detectores de aprendizado profundo, como R-CNN e suas variantes, foram avaliados em VOC 2012 e mostraram melhoras significativas sobre os métodos tradicionais baseados em características. O conjunto de dados também popularizó o uso da precisión média média (mAP) como métrica padrão, que segue sendo comum no campo.
Para segmentación, VOC 2012 foi um benchmark clave para modelos como U-Net e posteriores redes totalmente convolucionales. As anotações a nível de píxel permitieron aos investigadores desenvolver e comparar técnicas de segmentación semántica. O tamaño moderado do conjunto de dados incentivó o uso de aumento de datos e aprendizado por transferencia de conjuntos de datos maiores como ImageNet.
Legado e Uso Continuado
Aunque o desafío PASCAL VOC terminó em 2012, o conjunto de dados segue sendo amplamente utilizado para pesquisa e educação. Muitos artículos ainda reportan resultados em VOC 2012, frequentemente em combinação com outros benchmarks. Serve como uma verificación de sanidade para novos modelos e como um terreno comum para comparar métodos. O conjunto de dados também é usado em cursos académicos para ensinar detección de objetos e segmentación.
Conjuntos de datos posteriores, como COCO, têm maior escala e más categorías, pero VOC 2012 conserva sua importancia devido à sua simplicidade e ao protocolo de avaliação bem definido. O servidor de avaliação oficial, mantido pela Universidade de Oxford, ainda permite envios para o conjunto de teste, garantindo uma comparación consistente ao longo dos anos.
Limitaciones e Críticas
VOC 2012 tem sido criticado por seu número limitado de categorías e imágenes em comparação com conjuntos de datos modernos. As imágenes também são de resolución relativamente baixa, o que pode dificultar o treinamento de modelos de alta resolución. A qualidade das anotações é geralmente alta, pero alguns rótulos contienen erros ou inconsistencias. Adicionalmente, o conjunto de datos exhibe sesgos comuns em imágenes provenientes da web, como a sobre-representación de certas poses e contextos de objetos.
A pesar destas limitaciones, VOC 2012 segue sendo um recurso valioso. Seu tamaño pequeño permite una prototipagem rápida, e suas métricas bem compreendidas facilitan comparaciones claras. Os investigadores frequentemente o usan como ponto de partida antes de escalar a conjuntos de datos maiores.