LabelMe est un projet issu du MIT Computer Science and Artificial Intelligence Laboratory qui propose un ensemble de données d'images numériques en accès libre et en évolution constante, accompagné d'annotations générées par les utilisateurs. Conçu principalement pour la recherche en vision par ordinateur, il permet d'étiqueter plusieurs objets dans des scènes arbitraires à l'aide de contours polygonaux. Au 31 octobre 2010, l'ensemble de données comprenait 187 240 images, dont 62 197 annotées, contenant 658 992 objets étiquetés. Le projet est ouvert aux contributions publiques, permettant à chacun d'ajouter ou de modifier des annotations, ce qui en fait une ressource dynamique pour la communauté de recherche.
L'initiative LabelMe a vu le jour pour remédier aux lacunes des ensembles de données antérieurs en vision par ordinateur, souvent adaptés à des problèmes de recherche spécifiques et manquant de diversité dans l'apparence des objets et le contexte des scènes. Contrairement aux ensembles de données traditionnels qui présentaient des images recadrées et normalisées d'objets uniques, LabelMe prend en charge la reconnaissance de classes d'objets dans des scènes complexes et non modifiées, offrant plusieurs angles, tailles et orientations. Il fournit également une large gamme de classes d'objets et permet aux utilisateurs d'en créer facilement de nouvelles.
Outil d'annotation
L'outil d'annotation basé sur le web de LabelMe permet aux utilisateurs de contribuer à l'ensemble de données sans logiciel spécialisé. Accessible via tout navigateur web prenant en charge JavaScript, l'outil affiche une image choisie aléatoirement dans la collection, superposant les annotations polygonales existantes en couleurs distinctes. Les utilisateurs peuvent dessiner de nouveaux polygones en cliquant sur des points le long du contour d'un objet, puis attribuer une étiquette textuelle via une interface contextuelle. Les étiquettes sont définies par l'utilisateur, ce qui entraîne des variations telles que « chien », « canidé » ou « toutou ». Les annotateurs peuvent également modifier ou supprimer des polygones existants, et les changements sont immédiatement enregistrés et rendus disponibles publiquement pour téléchargement, favorisant ainsi un ensemble de données communautaire en mise à jour continue.
Motivation et principes de conception
Le projet a été motivé par les limites des ensembles de données antérieurs en vision par ordinateur, souvent adaptés à des problèmes de recherche spécifiques et obligeant les nouveaux chercheurs à collecter des données supplémentaires. LabelMe a été conçu pour soutenir la reconnaissance de classes d'objets plutôt que d'instances uniques, englobant des objets à plusieurs angles, tailles et orientations dans des scènes arbitraires. Contrairement aux ensembles de données avec des images recadrées ou normalisées, LabelMe permet l'annotation de plusieurs objets par image via des contours polygonaux, permettant une compréhension de scènes complexes. Il prend également en charge un ensemble large et croissant de classes d'objets, inclut des images diverses et propose des images non soumises au droit d'auteur avec des contributions publiques ouvertes.
Outil d'annotation
L'outil d'annotation fonctionne dans un navigateur web standard avec prise en charge de JavaScript, et les utilisateurs peuvent y accéder de manière anonyme ou avec un compte gratuit. Une fois chargé, l'outil sélectionne aléatoirement une image de l'ensemble de données et affiche les étiquettes d'objets existantes sous forme de polygones colorés superposés à l'image, chaque étiquette distincte étant associée à une couleur différente. Pour ajouter une annotation, un utilisateur dessine un polygone en cliquant sur des points le long du contour d'un objet et ferme la forme pour déclencher une invite demandant la saisie d'une étiquette. Les utilisateurs peuvent choisir toute étiquette textuelle qu'ils jugent appropriée, et peuvent également modifier ou supprimer des polygones existants en cliquant sur leurs contours et en modifiant le texte de l'étiquette. Les changements sont enregistrés immédiatement et rendus disponibles publiquement dans l'ensemble de données, contribuant à une collection en évolution continue. L'interface comprend un lien « Montrez-moi une autre image » pour passer à l'image aléatoire suivante.
Caractéristiques de l'ensemble de données
Au 31 octobre 2010, LabelMe contenait 187 240 images, dont 62 197 annotées, avec un total de 658 992 objets étiquetés. La nature dynamique de l'ensemble de données signifie que ces chiffres ont augmenté depuis. Les images proviennent d'une grande variété de scènes, principalement capturées par des photographes humains, ce qui entraîne des distributions inégales des tailles et des positions des objets dans les cadres. Le modèle de contribution ouverte introduit une variabilité dans le style d'annotation : les annotateurs décident quels objets étiqueter (par exemple, s'il faut délimiter les objets occultés), la précision des contours polygonaux et le texte exact utilisé pour les étiquettes. Cette variabilité est intentionnelle, car les créateurs estiment qu'elle reflète les habitudes naturelles d'étiquetage et aide les chercheurs à développer des algorithmes robustes à de telles incohérences.
Travaux connexes et impact
LabelMe s'est appuyé sur des efforts antérieurs dans les ensembles de données de vision par ordinateur, tels que PASCAL VOC et les ensembles de données Caltech, mais s'est distingué par son échelle et son ouverture. Sa nature dynamique et son approche communautaire ont influencé les plateformes et ensembles de données d'annotation ultérieurs dans le domaine. Le projet a été largement utilisé pour entraîner et évaluer des algorithmes de détection d'objets et de segmentation, et il a contribué au mouvement plus large vers des données à grande échelle et publiquement disponibles dans le apprentissage automatique et l'intelligence artificielle.
Problèmes liés aux données
L'ensemble de données présente une variabilité due à la liberté accordée aux annotateurs, ce qui introduit certains défis. Les objets peuvent varier en taille et en position dans l'image, car les sujets intéressants sont souvent centrés. Les utilisateurs peuvent choisir quels objets étiqueter, ce qui entraîne des incohérences, comme la question de savoir s'il faut étiqueter les objets occultés ou le ciel. La précision des annotations varie également, car les utilisateurs décident du niveau de détail des polygones. Les étiquettes textuelles sont sans restriction, de sorte que le même objet peut recevoir différents noms, tels que « personne », « homme » ou « piéton ». Les créateurs ont intentionnellement laissé ces décisions aux annotateurs, estimant que la variabilité naturelle de l'étiquetage aide les chercheurs à développer des algorithmes robustes aux incohérences du monde réel.
Intégration de WordNet
Pour remédier à la variabilité des étiquettes textuelles, les créateurs ont intégré WordNet dans la base de données. WordNet organise les mots dans une hiérarchie sémantique structurée, attribuant chaque mot à un « sens ». L'attribution automatique des sens s'est avérée peu fiable, donc les étiquettes ont été manuellement mappées aux sens de WordNet. Cet effort, bien que laborieux, est resté gérable car le nombre de mots distincts croissait lentement par rapport au nombre de polygones. Grâce à l'intégration de WordNet, les recherches sont devenues plus efficaces : interroger « animal » pouvait récupérer des objets étiquetés tels que des chiens, des chats et des serpents, tout en excluant les correspondances non pertinentes comme « promenade de chien » ou des objets étiquetés avec des phrases complexes. Le système prenait également en charge l'identification des relations de parties, comme les roues en tant que parties de véhicules, améliorant l'utilité de l'ensemble de données pour la recherche en reconnaissance d'objets.
Impact et applications
LabelMe a été largement utilisé dans la recherche en vision par ordinateur, servant de référence pour des tâches telles que la détection d'objets, la segmentation et la compréhension de scènes. Sa nature ouverte et dynamique le distingue des ensembles de données statiques, permettant une expansion et un affinement continus. Le projet a inspiré des efforts d'annotation participative similaires et reste une ressource fondamentale dans le domaine. Les chercheurs ont exploité LabelMe pour entraîner et évaluer des algorithmes de reconnaissance d'objets dans des contextes réels divers, contribuant aux avancées dans la compréhension d'images et les domaines connexes de machine learning et intelligence artificielle.