COCO-Stuff 164K est un jeu de données à grande échelle pour la segmentation sémantique et la compréhension de scènes, conçu comme une extension du jeu de données Microsoft Common Objects in Context (COCO). Il fournit des annotations denses au niveau des pixels pour les classes « stuff » (régions d'arrière-plan amorphes telles que le ciel, l'herbe et la route) et les classes « thing » (objets comptables tels que les personnes, les voitures et les chiens). Le jeu de données contient 164 000 images, chacune annotée avec l'une des 172 catégories sémantiques, ce qui en fait l'une des ressources les plus complètes pour l'entraînement et l'évaluation de modèles dans des tâches de vision par ordinateur comme la segmentation sémantique, la segmentation d'instances et l'analyse de scènes.
Le jeu de données a été introduit en 2018 par des chercheurs de l'Université de Fribourg, notamment Holger Caesar, Jasper Uijlings et Vittorio Ferrari, et a été publié dans l'article « COCO-Stuff: Thing and Stuff Classes in Context ». Il s'appuie sur le jeu de données original COCO-Stuff, qui contenait 10 000 images, en l'étendant aux divisions complètes d'entraînement et de validation de COCO. Les 172 classes sont divisées en 80 classes « thing » (identiques aux catégories « thing » de COCO) et 92 classes « stuff », qui incluent des éléments d'arrière-plan naturels et artificiels.
Construction et annotation
Le processus d'annotation pour COCO-Stuff 164K implique des étapes automatiques et manuelles. Les annotations initiales de « stuff » ont été générées en combinant des modèles d'apprentissage profond et un raffinement humain. Le jeu de données exploite les annotations COCO existantes pour les classes « thing », créées par des travailleurs de la foule, et ajoute des masques au niveau des pixels pour les classes « stuff ». Les annotations finales ont été validées par une série de contrôles de qualité pour garantir la cohérence et la précision sur les 164 000 images.
Chaque image du jeu de données est annotée avec une seule étiquette par pixel, et les annotations sont fournies dans un format compact d'encodage par longueur de plage pour réduire les besoins de stockage. Le jeu de données est divisé en un ensemble d'entraînement de 118 000 images et un ensemble de validation de 5 000 images, les images restantes étant réservées aux tests (les annotations pour l'ensemble de test ne sont pas publiées publiquement).
Applications en apprentissage profond
COCO-Stuff 164K est devenu une référence standard pour la segmentation sémantique, une tâche en apprentissage automatique et apprentissage profond où un modèle attribue une étiquette de classe à chaque pixel d'une image. Il est largement utilisé pour évaluer les performances des architectures de réseaux de neurones, y compris les modèles basés sur réseaux résiduels et U-Net, ainsi que les approches basées sur les transformeurs. La diversité du jeu de données en classes « stuff » et « thing » met au défi les modèles de comprendre à la fois les limites fines des objets et les régions contextuelles à grande échelle.
Le jeu de données est également utilisé pour la segmentation panoptique, une tâche qui unifie la segmentation sémantique et la segmentation d'instances en exigeant que les modèles prédisent simultanément les étiquettes « stuff » et « thing ». Cela a stimulé la recherche sur des architectures unifiées capables de gérer les deux types de classes en une seule passe avant.
Référence et métriques d'évaluation
La métrique d'évaluation principale pour COCO-Stuff 164K est l'Intersection sur Union moyenne (mIoU), qui mesure le chevauchement entre les masques de segmentation prédits et ceux de vérité terrain, moyenné sur toutes les classes. Les chercheurs rapportent également l'IoU par classe et la précision par pixel. Le serveur d'évaluation officiel du jeu de données permet une comparaison équitable des modèles, et les classements suivent l'état de l'art au fil du temps.
Depuis sa publication, le jeu de données a été utilisé dans des centaines d'articles de recherche, et les modèles les plus performants ont atteint des scores mIoU supérieurs à 50 sur l'ensemble de validation, avec des progrès significatifs motivés par les avancées dans les architectures basées sur transformeurs et les mécanismes d'attention.
Relation avec d'autres jeux de données
COCO-Stuff 164K fait partie d'une famille de jeux de données dérivés de COCO, y compris COCO-Stuff 10K et le jeu de données COCO original. Il complète d'autres jeux de données de compréhension de scènes tels que Cityscapes, qui se concentre sur les scènes de conduite urbaine, et ADE20K, qui couvre une gamme plus large de scènes intérieures et extérieures. L'accent mis par le jeu de données sur le contexte et les classes « stuff » le rend particulièrement utile pour des applications en conduite autonome, robotique et réalité augmentée, où la compréhension des régions d'arrière-plan est aussi importante que la détection d'objets.
Le jeu de données est publiquement disponible à des fins de recherche et est hébergé sur le site officiel de COCO. Il est couramment utilisé avec des modèles pré-entraînés provenant de laboratoires de recherche en intelligence artificielle et de plateformes cloud, et il reste une ressource clé pour faire progresser le domaine de la vision par ordinateur.