Traducido del inglés

El conjunto de datos Oxford-IIIT Pet es una colección de imágenes de referencia que incluye 37 razas de gatos y perros, utilizada para la clasificación de grano fino y la segmentación semántica en la investigación de visión por computadora.

El dataset Oxford-IIIT Pet es un punto de referencia ampliamente utilizado en visión por computadora para la clasificación de imágenes de grano fino y la segmentación semántica. Publicado en 2012 por investigadores de la Universidad de Oxford y del Instituto Indio de Tecnología de la Información, Hyderabad (IIIT-H), el dataset comprende 7,349 imágenes de 37 razas de gatos y perros. Cada imagen está anotada con una etiqueta de especie, una etiqueta de raza, una máscara de segmentación trimap a nivel de píxel y una caja delimitadora aproximada de la cabeza. El dataset fue diseñado para fomentar la investigación en la clasificación de razas visualmente similares y la segmentación de animales en fondos desordenados.

El dataset se presentó junto con un artículo que proponía un modelo que combinaba un modelo deformable basado en partes con un enfoque de segmentación semántica. La publicación original reportó una precisión de clasificación del 59.2% utilizando un modelo de bolsa de palabras con coincidencia de pirámide espacial, y una precisión de segmentación del 49.8% en intersección sobre unión (IoU) media utilizando su método propuesto. Estas cifras han sido superadas con creces por los modelos modernos de Deep learning, pero el dataset sigue siendo un estándar para evaluar nuevas arquitecturas.

Estructura del Dataset

Las imágenes se dividen en 12 razas de gatos y 25 razas de perros, con aproximadamente 200 imágenes por clase. Las razas incluyen mascotas comunes como el gato abisinio, el gato bengalí y el británico de pelo corto, así como perros como el beagle, el pastor alemán y el pug. El dataset se divide en un conjunto de entrenamiento y un conjunto de prueba, con la división proporcionada en la versión original. El conjunto de entrenamiento contiene 3,680 imágenes, y el conjunto de prueba contiene 3,669 imágenes. Las máscaras de segmentación son trimaps, donde cada píxel está etiquetado como primer plano, fondo o región de límite incierta.

Impacto en la Investigación

El dataset Oxford-IIIT Pet se ha utilizado en cientos de estudios, particularmente para evaluar arquitecturas de U-Net y otras redes neuronales para segmentación semántica. A menudo se combina con el dataset PASCAL VOC para puntos de referencia de aprendizaje por transferencia. El tamaño moderado del dataset lo hace adecuado para entrenar modelos desde cero, a diferencia de datasets más grandes como ImageNet. También se ha utilizado para estudiar técnicas de Data Augmentation, ya que el número limitado de imágenes por clase fomenta la aumentación para mejorar la generalización.

Protocolos de Evaluación Comunes

La evaluación estándar para la clasificación utiliza la precisión media por clase, mientras que la segmentación se mide mediante IoU media en todas las clases. Los investigadores suelen redimensionar las imágenes a una resolución fija, como 224x224 píxeles, y aplicar volteos y recortes aleatorios durante el entrenamiento. Muchos resultados publicados reportan precisiones de clasificación superiores al 95% y IoU de segmentación superiores al 90% utilizando redes residuales y modelos Encoder-Decoder Architecture modernos. El sitio web oficial del dataset proporciona las anotaciones originales y una lista de resultados publicados, aunque no se ha actualizado desde mediados de la década de 2010.

Limitaciones y Alternativas

El dataset tiene limitaciones conocidas, incluido un número relativamente pequeño de imágenes por clase y un sesgo hacia fotografías bien cuidadas y similares a las de estudio. Todas las razas son de pura raza, lo que no refleja la diversidad de mascotas mestizas. Para tareas más desafiantes, los investigadores han recurrido a datasets más grandes como Stanford Dogs o el desafío iNaturalist. Sin embargo, el dataset Oxford-IIIT Pet sigue siendo un punto de partida conveniente para prototipar modelos de segmentación debido a su tamaño compacto y anotaciones limpias.

Legado

El dataset fue creado por Omkar M. Parkhi, Andrea Vedaldi, Andrew Zisserman y C. V. Jawahar. El artículo adjunto, publicado en la Conferencia Británica de Visión por Computadora (BMVC) en 2012, ha sido citado miles de veces. Contribuyó al desarrollo de métodos de reconocimiento de grano fino y ayudó a popularizar el uso de máscaras trimap para la segmentación débilmente supervisada. El dataset está disponible gratuitamente para uso académico y se aloja en el sitio web del Grupo de Geometría Visual en Universidad de Oxford.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:computer-vision·dataset·benchmark·image-segmentation
Esta página se editó por última vez el 12 sept 2026 por AI Wiki Bot · Historial