O dataset Oxford-IIIT Pet é um benchmark amplamente utilizado em visão computacional para classificação de imagens de granulação fina e segmentação semântica. Lançado em 2012 por pesquisadores da Universidade de Oxford e do Instituto Indiano de Tecnologia da Informação, Hyderabad (IIIT-H), o dataset compreende 7.349 imagens de 37 raças de cães e gatos. Cada imagem é anotada com um rótulo de espécie, um rótulo de raça, uma máscara de segmentação trimap em nível de pixel e uma caixa delimitadora aproximada da cabeça. O dataset foi projetado para incentivar pesquisas sobre a classificação de raças visualmente semelhantes e a segmentação de animais em fundos desordenados.
O dataset foi introduzido juntamente com um artigo que propôs um modelo combinando um modelo baseado em partes deformáveis com uma abordagem de segmentação semântica. A publicação original relatou uma precisão de classificação de 59,2% usando um modelo bag-of-words com correspondência de pirâmide espacial, e uma precisão de segmentação de 49,8% em interseção sobre união (IoU) média usando o método proposto. Esses números foram amplamente superados por modelos modernos de Deep learning, mas o dataset permanece um padrão para avaliar novas arquiteturas.
Estrutura do Dataset
As imagens são divididas em 12 raças de gatos e 25 raças de cães, com aproximadamente 200 imagens por classe. As raças incluem animais de estimação comuns, como o gato abissínio, o gato de Bengala e o British Shorthair, bem como cães como o Beagle, o Pastor Alemão e o Pug. O dataset é dividido em um conjunto de treinamento e um conjunto de teste, com a divisão fornecida na versão original. O conjunto de treinamento contém 3.680 imagens, e o conjunto de teste contém 3.669 imagens. As máscaras de segmentação são trimaps, onde cada pixel é rotulado como primeiro plano, fundo ou região de borda incerta.
Impacto na Pesquisa
O dataset Oxford-IIIT Pet tem sido usado em centenas de estudos, particularmente para avaliar arquiteturas U-Net e outras redes neurais para segmentação semântica. Ele é frequentemente combinado com o dataset PASCAL VOC para benchmarks de transferência de aprendizado. O tamanho moderado do dataset o torna adequado para treinar modelos do zero, ao contrário de datasets maiores, como o ImageNet. Ele também tem sido usado para estudar técnicas de Data Augmentation, já que o número limitado de imagens por classe incentiva a aumento de dados para melhorar a generalização.
Protocolos de Avaliação Comuns
A avaliação padrão para classificação usa precisão média por classe, enquanto a segmentação é medida pela IoU média em todas as classes. Pesquisadores geralmente redimensionam as imagens para uma resolução fixa, como 224x224 pixels, e aplicam flips e cortes aleatórios durante o treinamento. Muitos resultados publicados relatam precisões de classificação acima de 95% e IoU de segmentação acima de 90% usando redes residuais e modelos Encoder-Decoder Architecture modernos. O site oficial do dataset fornece as anotações originais e uma lista de resultados publicados, embora não tenha sido atualizado desde meados da década de 2010.
Limitações e Alternativas
O dataset tem limitações conhecidas, incluindo um número relativamente pequeno de imagens por classe e um viés para fotografias bem cuidadas, semelhantes a estúdio. As raças são todas de raça pura, o que não reflete a diversidade de animais de estimação mestiços. Para tarefas mais desafiadoras, pesquisadores recorreram a datasets maiores, como Stanford Dogs ou o desafio iNaturalist. No entanto, o dataset Oxford-IIIT Pet permanece um ponto de partida conveniente para prototipagem de modelos de segmentação devido ao seu tamanho compacto e anotações limpas.
Legado
O dataset foi criado por Omkar M. Parkhi, Andrea Vedaldi, Andrew Zisserman e C. V. Jawahar. O artigo que o acompanha, publicado na British Machine Vision Conference (BMVC) em 2012, foi citado milhares de vezes. Ele contribuiu para o desenvolvimento de métodos de reconhecimento de granulação fina e ajudou a popularizar o uso de máscaras trimap para segmentação fracamente supervisionada. O dataset está disponível gratuitamente para uso acadêmico e é hospedado no site do Visual Geometry Group em Universidade de Oxford.