CUB-200-2011, também conhecido como conjunto de dados Caltech-UCSD Birds-200-2011, é um conjunto de dados de referência para tarefas de categorização visual de granularidade fina em aprendizado de máquina e visão computacional. Lançado em 2011 por pesquisadores da Caltech e da UC San Diego, foi projetado para desafiar algoritmos a distinguir entre espécies de aves visualmente semelhantes, indo além do reconhecimento genérico de objetos.
O conjunto de dados contém 11.788 imagens de 200 espécies de aves, com cada imagem anotada com uma caixa delimitadora, uma máscara binária de segmentação de partes e as localizações de 15 partes principais do corpo (por exemplo, bico, asa, cauda). Além disso, cada imagem está associada a 312 rótulos binários de atributos (por exemplo, "tem peito vermelho", "cor da asa: azul") e uma descrição em texto. Essa estrutura rica de anotações torna o CUB-200-2011 um ambiente de teste padrão para avaliar modelos que devem aprender diferenças visuais sutis.
História e Criação
O CUB-200-2011 foi introduzido como uma extensão do conjunto de dados original CUB-200 (2010), que tinha 6.033 imagens de 200 espécies. A versão de 2011 adicionou mais imagens, anotações de partes e rótulos de atributos. O conjunto de dados foi criado por Catherine Wah, Steve Branson, Peter Welinder, Pietro Perona e Serge Belongie. Foi financiado pela National Science Foundation e pelo Office of Naval Research. As imagens foram obtidas do Flickr e de outros repositórios online, depois filtradas e rotuladas por anotadores humanos por meio de uma plataforma de crowdsourcing.
Estrutura e Anotações
Cada imagem no CUB-200-2011 é acompanhada por um conjunto de arquivos de anotação. A caixa delimitadora fornece um recorte preciso da ave. As localizações das partes são fornecidas como coordenadas (x,y) para 15 partes, incluindo coroa, testa, olho, bico, garganta, peito, barriga, asa e cauda. A máscara binária de segmentação indica quais pixels pertencem à ave. Os rótulos de atributos são binários (0 ou 1) e cobrem padrões de cor, forma e comportamento. O conjunto de dados também inclui uma divisão de treino/teste: 5.994 imagens para treinamento e 5.794 para teste, com aproximadamente metade das espécies em cada divisão.
Papel no Reconhecimento de Granularidade Fina
O CUB-200-2011 é uma pedra angular da categorização visual de granularidade fina (FGVC), um subcampo da visão computacional que visa classificar objetos no nível de subcategoria (por exemplo, espécies, raças). Diferentemente do reconhecimento genérico de objetos (por exemplo, distinguir uma ave de um carro), a FGVC exige que os modelos se concentrem em diferenças sutis na aparência. O CUB-200-2011 tem sido usado para desenvolver e avaliar inúmeras técnicas, incluindo modelos baseados em partes, mecanismos de atenção e arquiteturas de aprendizado profundo. Ele é frequentemente combinado com outros conjuntos de dados de FGVC, como Stanford Dogs e Oxford Flowers.
Impacto na Pesquisa em Aprendizado Profundo
Com o avanço das redes neurais, o CUB-200-2011 se tornou um benchmark popular para testar novas arquiteturas. Por exemplo, foi usado para avaliar o desempenho de redes residuais e modelos baseados em atenção. As anotações de partes do conjunto de dados permitiram pesquisas sobre localização de partes e classificação baseada em partes, onde os modelos primeiro detectam partes e depois usam suas características para classificação. Ele também serve como um ambiente de teste para técnicas de aumento de dados e funções de perda especificamente projetadas para tarefas de granularidade fina. Em meados da década de 2020, os modelos de última geração alcançam mais de 90% de precisão no CUB-200-2011, uma melhoria significativa em relação ao início dos anos 2010, quando a precisão era de cerca de 50-60%.
Limitações e Extensões
Apesar de sua popularidade, o CUB-200-2011 tem limitações. As imagens são relativamente pequenas (resolução média em torno de 500x500 pixels), e o conjunto de dados é tendencioso para espécies de aves da América do Norte. As anotações, embora detalhadas, podem ter inconsistências devido ao crowdsourcing. Para abordar alguns desses problemas, pesquisadores criaram extensões, como o CUB-200-2011 com anotações adicionais de atributos, ou o usaram em aprendizado por transferência entre conjuntos de dados. O conjunto de dados continua sendo um padrão para avaliar o reconhecimento de granularidade fina, e seu design influenciou conjuntos de dados posteriores, como o iNaturalist.
Ver Também
Referências
- Wah, C., Branson, S., Welinder, P., Perona, P., & Belongie, S. (2011). The Caltech-UCSD Birds-200-2011 Dataset. California Institute of Technology.
- Welinder, P., et al. (2010). Caltech-UCSD Birds 200. California Institute of Technology.