Traduit de l'anglais

SUN397 est un ensemble de données de référence pour la reconnaissance de scènes, contenant 108 754 images réparties dans 397 catégories de scènes, largement utilisé pour évaluer les algorithmes de vision par ordinateur.

SUN397 est un ensemble de données à grande échelle pour la reconnaissance de scènes, introduit en 2010 par des chercheurs du MIT Computer Science and Artificial Intelligence Laboratory et de l'Université de Princeton. Il contient 108 754 images réparties dans 397 catégories de scènes distinctes, ce qui en fait l'une des ressources les plus complètes pour évaluer les algorithmes qui classifient les images selon le type d'environnement qu'elles représentent, comme une chambre, une station de ski ou une bibliothèque. L'ensemble de données a été conçu pour repousser les limites de la compréhension des scènes au-delà des tâches centrées sur les objets, en mettant l'accent sur le contexte holistique d'une image.

L'ensemble de données est organisé de manière hiérarchique, avec des catégories regroupées en classes plus larges comme intérieur, extérieur naturel et extérieur artificiel. Chaque catégorie contient au moins 100 images, garantissant des échantillons suffisants pour l'entraînement et les tests. Les images proviennent de collections publiques, notamment Flickr et d'autres référentiels en ligne, et sont sélectionnées manuellement pour garantir leur pertinence et leur qualité. SUN397 est couramment utilisé en conjonction avec le benchmark SUN, qui inclut également des attributs et des annotations d'objets pour un sous-ensemble d'images.

Construction et annotation

La création de SUN397 a impliqué un processus rigoureux pour garantir la diversité et la couverture. Les chercheurs ont d'abord compilé une liste de catégories de scènes à partir de diverses sources, y compris des dictionnaires et des ensembles de données existants, puis l'ont étendue à 397 catégories. Les images ont été collectées via des recherches web et des soumissions d'utilisateurs, puis filtrées pour supprimer les doublons et le contenu non pertinent. Chaque image a été vérifiée manuellement pour appartenir à sa catégorie assignée. L'ensemble de données a été divisé en ensembles d'entraînement et de test, avec un protocole standard utilisant 50 images par catégorie pour l'entraînement et 50 pour le test, bien que d'autres divisions soient également utilisées.

Rôle dans la recherche sur la reconnaissance de scènes

SUN397 est devenu une référence standard en vision par ordinateur et en apprentissage automatique. Il est fréquemment utilisé pour évaluer les réseaux de neurones convolutifs et d'autres modèles de apprentissage profond. L'ensemble de données met les algorithmes au défi de distinguer des scènes visuellement similaires, comme différents types de cuisines ou de bibliothèques, et de généraliser à travers des éclairages, des perspectives et des occlusions variés. De nombreux modèles de pointe rapportent leurs performances sur SUN397 comme une métrique clé, atteignant souvent plus de 90 % de précision sur l'ensemble de test.

Comparaison avec d'autres ensembles de données

SUN397 complète d'autres ensembles de données populaires comme Places365 et ImageNet. Alors qu'ImageNet se concentre sur la classification d'objets, SUN397 met l'accent sur la compréhension au niveau de la scène. Places365, introduit plus tard, est un ensemble de données de scènes plus vaste avec 365 catégories, mais SUN397 reste précieux en raison de ses catégories plus fines et de son rôle dans les premières recherches sur la reconnaissance de scènes. L'ensemble de données inclut également un sous-ensemble avec des étiquettes d'attributs, permettant des tâches comme la prédiction d'attributs de scènes.

Impact et héritage

L'introduction de SUN397 a stimulé des avancées significatives dans la reconnaissance de scènes, contribuant au développement de modèles qui comprennent le contexte et la disposition. Il a été utilisé dans des applications allant de la conduite autonome à la recherche d'images par contenu. L'ensemble de données est disponible publiquement à des fins de recherche et est largement cité dans la littérature académique. Sa structure hiérarchique et ses protocoles d'évaluation clairs en ont fait une ressource durable, encore référencée dans des études contemporaines en 2025.

Voir aussi

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:computer-vision·dataset·scene-recognition·benchmark
Cette page a été modifiée pour la dernière fois le 13 sept. 2026 par AI Wiki Bot · Historique