ADE20K est un jeu de données à grande échelle pour le parsing de scènes, une tâche de vision par ordinateur qui consiste à étiqueter chaque pixel d'une image avec une catégorie sémantique, comme « personne », « voiture », « mur » ou « ciel ». Publié en 2016 par des chercheurs du MIT Computer Science and Artificial Intelligence Laboratory, ce jeu de données a été créé pour répondre aux limitations des jeux de données antérieurs qui couvraient moins de catégories d'objets ou fournissaient des annotations plus grossières. ADE20K contient plus de 20 000 images pour l'entraînement et 2 000 images pour la validation, avec un ensemble de test supplémentaire utilisé pour l'évaluation comparative. Les images proviennent d'une gamme diversifiée de scènes du monde réel, y compris des environnements intérieurs comme les cuisines et les salons, ainsi que des environnements extérieurs tels que les rues, les parcs et les plages.
Le jeu de données fournit des annotations denses au niveau du pixel pour 150 catégories sémantiques, qui incluent à la fois des classes « matière » (par exemple, ciel, route, herbe) et des classes « objet » (par exemple, personne, chaise, chien). Les annotations ont été créées par des annotateurs humains utilisant un protocole d'étiquetage détaillé, et chaque image peut contenir plusieurs instances de la même catégorie, permettant également une segmentation au niveau des instances. ADE20K inclut également des attributs supplémentaires pour certains objets, tels que l'occlusion et l'ordre de profondeur, qui soutiennent des tâches de compréhension de scène plus avancées. Le jeu de données est souvent utilisé comme référence standard pour la segmentation sémantique, la segmentation d'instances et le parsing de scènes, et il a été intégré dans les principaux défis de vision par ordinateur, y compris les compétitions annuelles de reconnaissance de la communauté IA.
Construction et annotation
Le jeu de données ADE20K a été construit à partir d'une collection d'images provenant du jeu de données LabelMe et d'autres référentiels d'images publics. Le processus d'annotation a impliqué une équipe d'annotateurs formés qui ont utilisé un outil web personnalisé pour tracer des polygones autour de chaque objet et attribuer une étiquette sémantique. Pour garantir la cohérence, le jeu de données comprend un guide d'annotation détaillé qui définit chacune des 150 catégories, y compris les cas ambigus et les conditions limites. L'effort d'annotation a abouti à plus de 500 000 instances d'objets étiquetées dans les ensembles d'entraînement et de validation. Le jeu de données a été publié sous une licence permissive pour la recherche académique, et il a depuis été largement adopté par la communauté de la vision par ordinateur.
Rôle dans la recherche sur le parsing de scènes
Le parsing de scènes est un problème fondamental en vision par ordinateur qui nécessite de comprendre le contexte complet d'une image, et pas seulement de détecter des objets individuels. ADE20K a été conçu pour soutenir cet objectif en fournissant un ensemble riche de catégories qui couvrent à la fois les objets courants et les éléments d'arrière-plan. Le jeu de données a été utilisé pour entraîner et évaluer une large gamme de modèles, des premiers réseaux entièrement convolutifs aux architectures modernes basées sur les transformers. Par exemple, le modèle SegFormer, introduit en 2021, a rapporté des performances de pointe sur ADE20K, atteignant un score moyen d'intersection sur union (mIoU) de plus de 51 % sur l'ensemble de validation. Le jeu de données a également été utilisé pour étudier l'adaptation de domaine, l'apprentissage en quelques exemples et la segmentation à vocabulaire ouvert, où les modèles sont tenus de segmenter des objets non vus pendant l'entraînement.
Impact sur la vision par ordinateur
ADE20K est devenu une référence de facto pour l'évaluation des algorithmes de parsing de scènes, aux côtés d'autres jeux de données comme Cityscapes et COCO. Son grand nombre de catégories et la diversité de ses types de scènes en font une référence difficile qui repousse les limites des performances des modèles. Le jeu de données a également influencé le développement de ressources connexes, telles que le sous-ensemble ADE20K Places365, qui se concentre sur la classification de scènes, et le MIT Scene Parsing Benchmark, qui fournit un classement pour comparer différentes méthodes. Les chercheurs ont utilisé ADE20K pour étudier la relation entre le contexte de scène et la reconnaissance d'objets, ce qui a conduit à des perspectives sur la manière dont les modèles peuvent exploiter les informations globales de la scène pour améliorer les prédictions locales.
Limitations et extensions
Malgré son succès, ADE20K présente des limitations. Le jeu de données est relativement petit par rapport aux jeux de données à grande échelle plus récents, et ses catégories sont fixes, ce qui peut limiter la généralisation à de nouveaux types d'objets. La qualité des annotations, bien qu'élevée, peut encore contenir des erreurs, en particulier pour les objets petits ou fortement occlus. Pour remédier à ces problèmes, les chercheurs ont proposé des extensions telles que ADE20K-Full, qui inclut des images et des catégories supplémentaires, et ADE20K-OutOfContext, qui teste la robustesse des modèles face à des placements d'objets inhabituels. Le jeu de données a également été utilisé comme source de pré-entraînement pour des modèles ensuite affinés sur d'autres tâches, démontrant son utilité au-delà du parsing de scènes.
Directions futures
Au milieu des années 2020, ADE20K reste une référence pertinente, mais le domaine évolue vers des jeux de données plus grands et plus diversifiés, tels que ceux utilisés pour entraîner les grands modèles de langage et les systèmes multimodaux. L'intégration du parsing de scènes avec d'autres tâches, telles que la génération d'images basée sur l'apprentissage profond et l'IA générative, a ouvert de nouvelles voies pour utiliser ADE20K comme banc d'essai pour évaluer la compréhension des scènes visuelles par les modèles. L'utilisation continue du jeu de données dans la recherche académique et les applications industrielles souligne son importance en tant que ressource fondamentale pour la vision par ordinateur.
Voir aussi
Références
Le jeu de données ADE20K a été introduit dans l'article « Semantic Understanding of Scenes through the ADE20K Dataset » de Bolei Zhou et al., publié en 2017. Le jeu de données est disponible en téléchargement sur le site web du MIT CSAIL, et sa documentation officielle fournit des informations détaillées sur les directives d'annotation et les protocoles d'évaluation.