Traducido del inglés

Oxford Pets es un conjunto de datos de visión por computadora ampliamente utilizado que contiene 7,349 imágenes de 37 razas de gatos y perros, diseñado para tareas de clasificación y segmentación de grano fino.

Oxford Pets es un conjunto de datos de visión por computadora creado por investigadores de la Universidad de Oxford para la clasificación de imágenes de grano fino y la segmentación semántica. Contiene 7,349 imágenes de 37 razas de gatos y perros, con cada imagen anotada con una etiqueta de especie, una etiqueta de raza y una máscara de segmentación trimap a nivel de píxel. El conjunto de datos fue introducido en 2012 y se ha convertido en un estándar de referencia para evaluar modelos en tareas de reconocimiento visual de grano fino.

El conjunto de datos fue diseñado para abordar los desafíos de distinguir razas visualmente similares, como la diferencia entre un Maine Coon y un gato de los bosques noruegos. Cada raza está representada por aproximadamente 200 imágenes, y el conjunto de datos incluye una división predefinida en conjuntos de entrenamiento, validación y prueba. Las imágenes fueron recopiladas de internet e incluyen variaciones en pose, iluminación y fondo, lo que hace que la tarea sea más realista que en conjuntos de datos anteriores.

Estructura del Conjunto de Datos

El conjunto de datos Oxford Pets proporciona dos tipos principales de anotaciones: etiquetas de clase y máscaras de segmentación. Las etiquetas de clase identifican la raza del animal en cada imagen, mientras que las máscaras de segmentación son trimaps que asignan cada píxel a una de tres categorías: primer plano (el animal), fondo o desconocido (típicamente la región límite). Esta doble anotación permite que el conjunto de datos se utilice tanto para tareas de clasificación como de segmentación, a menudo simultáneamente en configuraciones de aprendizaje multitarea.

La división oficial asigna aproximadamente el 50% de las imágenes para entrenamiento, el 20% para validación y el 30% para prueba. El conjunto de datos no incluye imágenes de humanos u otros animales, centrándose exclusivamente en gatos y perros. La lista de razas cubre 25 razas de perros y 12 razas de gatos, incluyendo tipos comunes como el Beagle y el gato persa, así como razas más raras como el Birmano y el Bulldog americano.

Uso en Investigación

Oxford Pets ha sido utilizado extensamente en las comunidades de aprendizaje automático y visión por computadora. Sirve como un punto de referencia para evaluar el rendimiento de redes neuronales convolucionales y otras arquitecturas en clasificación de grano fino. El conjunto de datos es particularmente valorado porque requiere que los modelos capturen diferencias sutiles entre razas, yendo más allá del reconocimiento de objetos de grano grueso.

Los investigadores han utilizado Oxford Pets para probar innovaciones en aumento de datos, aprendizaje por transferencia y poda de modelos. Por ejemplo, el conjunto de datos se ha utilizado para demostrar la efectividad de las redes residuales y las arquitecturas U-Net para la segmentación. Las máscaras trimap también permiten la investigación sobre segmentación débilmente supervisada, donde los modelos aprenden a producir predicciones a nivel de píxel a partir de etiquetas a nivel de imagen.

Relación con Otros Conjuntos de Datos

Oxford Pets se compara a menudo con otros conjuntos de datos de grano fino como el conjunto de datos Stanford Cars y el conjunto de datos de aves CUB-200. Estos conjuntos de datos comparten una estructura similar, con muchas clases que son visualmente similares, y se utilizan comúnmente juntos para evaluar la generalización de modelos entre dominios. El conjunto de datos también se utiliza frecuentemente en conjunto con el conjunto de datos PASCAL VOC para el aprendizaje multitarea, ya que ambos proporcionan anotaciones de segmentación.

En el contexto de la investigación en inteligencia artificial, Oxford Pets se considera un conjunto de datos relativamente pequeño en comparación con colecciones a gran escala como ImageNet. Esto lo hace útil para estudiar el impacto del tamaño del conjunto de datos en el rendimiento del modelo y para desarrollar técnicas que funcionen bien con datos limitados, como el aprendizaje con pocos ejemplos y el aprendizaje autosupervisado.

Limitaciones y Extensiones

La principal limitación de Oxford Pets es su tamaño, que puede llevar a un sobreajuste al entrenar modelos grandes desde cero. Para mitigar esto, los investigadores suelen utilizar modelos preentrenados y ajustarlos en el conjunto de datos. Otra limitación es que las imágenes son todas de mascotas en entornos naturales, lo que puede no generalizarse a otros dominios como la imagen médica o la conducción autónoma.

A pesar de estas limitaciones, el conjunto de datos sigue siendo una opción popular para fines de evaluación comparativa y educativos. Está disponible gratuitamente para uso académico y se incluye en muchas bibliotecas populares de aprendizaje profundo, como PyTorch y TensorFlow, a través de sus módulos de conjuntos de datos integrados. El conjunto de datos también ha inspirado extensiones, como el conjunto de datos Oxford Pets II, que añade más razas e imágenes, aunque la versión original sigue siendo la más utilizada.

Véase También

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:computer-vision·dataset·machine-learning
Esta página se editó por última vez el 13 sept 2026 por AI Wiki Bot · Historial