Places365 est un ensemble de données à grande échelle pour la reconnaissance de scènes, contenant plus de 1,8 million d'images provenant de 365 catégories de scènes distinctes. Il a été introduit en 2016 par des chercheurs du Massachusetts Institute of Technology (MIT), notamment Bolei Zhou, Aditya Khosla, Aude Oliva et Antonio Torralba. L'ensemble de données est conçu pour faire progresser le domaine de la vision par ordinateur, en particulier dans le domaine de la compréhension de scènes, qui consiste à identifier le contexte ou l'environnement dans lequel une image a été capturée. Places365 est devenu une référence standard pour évaluer les performances des modèles de apprentissage profond sur les tâches de classification de scènes, complétant les ensembles de données centrés sur les objets comme ImageNet.
L'ensemble de données est organisé en deux versions : Places365-Standard et Places365-Challenge. Places365-Standard contient environ 1,8 million d'images d'entraînement, chaque catégorie comportant entre 3 000 et 5 000 images. Places365-Challenge est une version plus grande avec plus de 8 millions d'images d'entraînement, utilisée pour le concours Places Challenge organisé lors de la Conférence sur la vision par ordinateur et la reconnaissance de formes (CVPR) en 2016. Les images proviennent du web et sont annotées avec l'une des 365 catégories de scènes, allant de scènes naturelles comme « montagne » et « plage » à des environnements intérieurs comme « cuisine » et « bureau ». Les catégories sont dérivées de l'ensemble de données Places2, qui est lui-même une extension de l'ensemble de données antérieur Places205.
Développement et motivation
Places365 a été créé pour répondre au besoin d'un ensemble de données complet pour la reconnaissance de scènes. Alors que la reconnaissance d'objets avait connu des progrès significatifs avec des ensembles de données comme ImageNet, la compréhension de scènes restait relativement sous-développée. L'équipe du MIT visait à fournir un ensemble de données vaste, diversifié et bien annoté qui pourrait soutenir l'entraînement de modèles de réseau neuronal pour la classification de scènes. L'ensemble de données a été construit en collectant des images sur le web, puis en utilisant une combinaison de processus d'annotation automatisés et humains. L'ensemble final de 365 catégories a été choisi pour couvrir une large gamme d'environnements quotidiens, garantissant que les modèles entraînés sur Places365 puissent généraliser à des applications réelles telles que la conduite autonome, la robotique et la recherche d'images.
La création de Places365 faisait partie d'un effort plus large visant à construire la base de données Places, qui comprend également l'ensemble de données Places205 et l'ensemble de données Places2. Places205, introduit en 2014, contenait 205 catégories de scènes et était utilisé comme référence préliminaire. Places365 a étendu cela à 365 catégories, offrant une couverture plus complète des types de scènes. L'ensemble de données a été largement adopté par la communauté de recherche, et sa publication a stimulé de nombreuses avancées dans les algorithmes de reconnaissance de scènes.
Architecture et contenu
Places365 se compose d'images avec des résolutions variables, généralement autour de 224×224 pixels après prétraitement. Chaque image est étiquetée avec une seule catégorie de scène, ce qui en fait une tâche de classification à étiquette unique. L'ensemble de données comprend un ensemble d'entraînement, un ensemble de validation et un ensemble de test. Les ensembles de validation et de test contiennent 50 images par catégorie, tandis que l'ensemble d'entraînement contient des milliers d'images par catégorie. Les images sont stockées au format JPEG et sont organisées en répertoires par catégorie.
Un aspect notable de Places365 est son accent sur le contexte au niveau de la scène plutôt que sur les objets individuels. Cela le distingue des ensembles de données de reconnaissance d'objets, car les modèles doivent apprendre à reconnaître l'environnement global. L'ensemble de données comprend également une hiérarchie sémantique, regroupant les 365 catégories en 16 super-catégories telles que « intérieur », « extérieur naturel » et « extérieur artificiel ». Cette hiérarchie permet une évaluation et une analyse plus structurées des performances des modèles.
Applications et impact
Places365 a été largement utilisé dans la recherche en apprentissage automatique, en particulier pour l'entraînement de réseaux neuronaux convolutifs (CNN) pour la classification de scènes. De nombreux modèles de pointe, tels que ResNet et DenseNet, ont été évalués sur Places365, et l'ensemble de données a servi de référence pour comparer différentes architectures. Au-delà de la classification, Places365 a été utilisé pour des tâches telles que l'analyse de scènes, la segmentation sémantique et l'apprentissage par transfert. Par exemple, des modèles pré-entraînés sur Places365 ont été affinés pour d'autres tâches de vision, notamment la détection d'objets et le sous-titrage d'images.
L'ensemble de données a également influencé le développement de systèmes d'intelligence artificielle dans l'industrie. Des entreprises comme Google DeepMind et OpenAI ont intégré des capacités de compréhension de scènes dans leurs modèles, et Places365 a été utilisé pour évaluer les performances des modèles de vision à grande échelle. En outre, l'ensemble de données a été utilisé dans des études sur la perception humaine des scènes, fournissant des informations sur la manière dont les humains catégorisent les environnements.
Limites et orientations futures
Malgré son succès, Places365 présente plusieurs limites. L'ensemble de données est biaisé vers les contextes occidentaux et anglophones, car les images ont été collectées sur le web, ce qui peut ne pas représenter également tous les environnements mondiaux. De plus, le format à étiquette unique ne capture pas la complexité des scènes réelles, qui contiennent souvent plusieurs contextes qui se chevauchent. Les chercheurs ont proposé des extensions et des alternatives, telles que des ensembles de données de scènes multi-étiquettes et des ensembles de données avec une couverture géographique plus diversifiée. Alors que la IA générative et les grands modèles de langage continuent de progresser, il existe un intérêt croissant pour l'utilisation de la compréhension de scènes pour améliorer les modèles multimodaux, et Places365 reste une ressource pertinente pour l'entraînement et l'évaluation de tels systèmes.