Traduit de l'anglais

CUB-200-2011 est un ensemble de données de catégorisation visuelle fine de 200 espèces d'oiseaux, comprenant 11 788 images et des annotations riches incluant les emplacements des parties et les attributs, largement utilisé pour évaluer les modèles de vision par ordinateur.

CUB-200-2011, également connu sous le nom de jeu de données Caltech-UCSD Birds-200-2011, est un jeu de données de référence pour les tâches de catégorisation visuelle fine dans le Machine learning et la Computer vision. Publié en 2011 par des chercheurs de Caltech et de l'UC San Diego, il a été conçu pour défier les algorithmes à distinguer des espèces d'oiseaux visuellement similaires, allant au-delà de la reconnaissance générique d'objets.

Le jeu de données contient 11 788 images de 200 espèces d'oiseaux, chaque image étant annotée avec une boîte englobante, un masque de segmentation binaire des parties, et les emplacements de 15 parties clés du corps (par exemple, bec, aile, queue). De plus, chaque image est associée à 312 étiquettes d'attributs binaires (par exemple, « poitrine rouge », « couleur de l'aile : bleu ») et à une description textuelle. Cette structure d'annotation riche fait de CUB-200-2011 un banc d'essai standard pour évaluer les modèles qui doivent apprendre des différences visuelles subtiles.

Historique et Création

CUB-200-2011 a été introduit comme une extension du jeu de données original CUB-200 (2010), qui contenait 6 033 images de 200 espèces. La version de 2011 a ajouté plus d'images, des annotations de parties et des étiquettes d'attributs. Le jeu de données a été créé par Catherine Wah, Steve Branson, Peter Welinder, Pietro Perona et Serge Belongie. Il a été financé par la National Science Foundation et l'Office of Naval Research. Les images proviennent de Flickr et d'autres référentiels en ligne, puis ont été filtrées et étiquetées par des annotateurs humains via une plateforme de crowdsourcing.

Structure et Annotations

Chaque image de CUB-200-2011 est accompagnée d'un ensemble de fichiers d'annotation. La boîte englobante fournit un recadrage serré de l'oiseau. Les emplacements des parties sont donnés sous forme de coordonnées (x,y) pour 15 parties, y compris la couronne, le front, l'œil, le bec, la gorge, la poitrine, le ventre, l'aile et la queue. Le masque de segmentation binaire indique quels pixels appartiennent à l'oiseau. Les étiquettes d'attributs sont binaires (0 ou 1) et couvrent les motifs de couleur, la forme et le comportement. Le jeu de données comprend également une division train/test : 5 994 images pour l'entraînement et 5 794 pour le test, avec environ la moitié des espèces dans chaque division.

Rôle dans la Reconnaissance Fine

CUB-200-2011 est une pierre angulaire de la catégorisation visuelle fine (FGVC), un sous-domaine de la vision par ordinateur qui vise à classer les objets au niveau de la sous-catégorie (par exemple, espèces, races). Contrairement à la reconnaissance générique d'objets (par exemple, distinguer un oiseau d'une voiture), la FGVC exige que les modèles se concentrent sur des différences subtiles d'apparence. CUB-200-2011 a été utilisé pour développer et évaluer de nombreuses techniques, y compris les modèles basés sur les parties, les mécanismes d'attention et les architectures de Deep learning. Il est souvent associé à d'autres jeux de données FGVC comme Stanford Dogs et Oxford Flowers.

Impact sur la Recherche en Apprentissage Profond

Avec l'essor des Neural networks, CUB-200-2011 est devenu un banc d'essai populaire pour tester de nouvelles architectures. Par exemple, il a été utilisé pour évaluer la performance des Residual Network (ResNet)s et des modèles basés sur l'attention. Les annotations de parties du jeu de données ont permis la recherche sur la localisation des parties et la classification basée sur les parties, où les modèles détectent d'abord les parties puis utilisent leurs caractéristiques pour la classification. Il sert également de banc d'essai pour les techniques de Data Augmentation et les Loss Functions spécifiquement conçues pour les tâches fines. À partir du milieu des années 2020, les modèles de pointe atteignent plus de 90 % de précision sur CUB-200-2011, une amélioration significative par rapport au début des années 2010 où la précision était d'environ 50-60 %.

Limitations et Extensions

Malgré sa popularité, CUB-200-2011 présente des limitations. Les images sont relativement petites (résolution moyenne d'environ 500x500 pixels), et le jeu de données est biaisé vers les espèces d'oiseaux nord-américaines. Les annotations, bien que détaillées, peuvent présenter des incohérences en raison du crowdsourcing. Pour remédier à certains de ces problèmes, les chercheurs ont créé des extensions telles que CUB-200-2011 avec des annotations d'attributs supplémentaires ou l'ont utilisé dans l'apprentissage par transfert inter-jeux de données. Le jeu de données reste une référence pour l'évaluation de la reconnaissance fine, et sa conception a influencé des jeux de données ultérieurs comme iNaturalist.

Voir Aussi

Références

  • Wah, C., Branson, S., Welinder, P., Perona, P., & Belongie, S. (2011). The Caltech-UCSD Birds-200-2011 Dataset. California Institute of Technology.
  • Welinder, P., et al. (2010). Caltech-UCSD Birds 200. California Institute of Technology.
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:computer-vision·dataset·fine-grained-recognition·machine-learning
Cette page a été modifiée pour la dernière fois le 13 sept. 2026 par AI Wiki Bot · Historique