NUS-WIDE est un ensemble de données d'images multi-étiquettes construit à partir d'images téléchargées sur la plateforme de partage de photos Flickr. Il a été publié en 2009 par des chercheurs de l'Université nationale de Singapour, dont Tat-Seng Chua et ses collègues. L'ensemble de données a été conçu pour soutenir la recherche en annotation d'images, en recherche d'images et en classification multi-étiquettes, offrant une collection à grande échelle et réelle avec un contenu visuel diversifié et des métadonnées textuelles associées.
L'ensemble de données comprend 269 648 images, chacune annotée avec un ou plusieurs des 81 concepts (étiquettes) qui couvrent une large gamme de scènes et d'objets quotidiens, tels que « ciel », « eau », « personnes », « animal » et « bâtiments ». Ces étiquettes ont été dérivées des tags que les utilisateurs ont initialement attribués à leurs photos sur Flickr, mais ont ensuite été nettoyées et standardisées par les créateurs de l'ensemble de données. En plus des étiquettes de concepts, NUS-WIDE fournit des caractéristiques de sac de mots de 500 dimensions basées sur les descripteurs SIFT, des histogrammes de couleurs de 64 dimensions et des corrélogrammes de couleurs de 144 dimensions, ainsi que des moments de couleur par blocs de 225 dimensions. Ces caractéristiques précalculées permettent aux chercheurs d'évaluer des algorithmes sans avoir à traiter les images brutes.
Construction et annotation
L'ensemble de données a été construit en téléchargeant un grand nombre d'images depuis Flickr, en se concentrant sur celles qui avaient été taguées avec un ensemble de 81 concepts prédéfinis. Le processus de sélection a assuré une distribution équilibrée entre les concepts, chaque concept ayant un nombre minimal d'images. Les étiquettes de vérité terrain ont été vérifiées manuellement par des annotateurs humains pour garantir leur exactitude, distinguant NUS-WIDE des ensembles de données qui reposent uniquement sur des tags générés par les utilisateurs. La collection finale comprend à la fois les images originales et les vecteurs de caractéristiques précalculés, ce qui la rend accessible pour une large gamme de tâches de Machine learning.
Utilisation dans la recherche
NUS-WIDE est devenu une référence standard dans le domaine de la vision par ordinateur et de l'intelligence artificielle, en particulier pour les tâches impliquant la classification multi-étiquettes et la recherche d'images. Les chercheurs l'ont utilisé pour évaluer des méthodes de taggage automatique d'images, où l'objectif est de prédire un ensemble d'étiquettes pertinentes pour une image donnée. Il a également été employé dans des études sur la augmentation de données et les architectures de apprentissage profond, telles que les variantes de réseau résiduel et de U-Net, bien que ce dernier soit plus courant dans les tâches de segmentation. La nature multi-étiquettes de l'ensemble de données en fait un banc d'essai difficile pour les algorithmes qui doivent gérer les corrélations entre concepts, comme « ciel » qui apparaît souvent avec « nuages ».
Caractéristiques et références
Les ensembles de caractéristiques fournis permettent une expérimentation rapide sans prétraitement extensif. Les caractéristiques de sac de mots de 500 dimensions capturent les motifs visuels locaux, tandis que les histogrammes de couleurs et les corrélogrammes fournissent des informations globales sur les couleurs. De nombreux articles publiés rapportent des résultats de référence sur NUS-WIDE en utilisant des méthodes traditionnelles comme les machines à vecteurs de support et les k-plus proches voisins, ainsi que des approches plus récentes de réseaux de neurones. L'ensemble de données comprend également une division en ensembles d'entraînement et de test, généralement avec 161 789 images pour l'entraînement et 107 859 pour le test, bien que certaines études utilisent des partitions différentes.
Impact et héritage
NUS-WIDE a influencé le développement d'ensembles de données ultérieurs, tels que Microsoft COCO et Visual Genome, qui offrent des annotations plus riches mais sont de plus petite échelle. Son accent sur le contenu réel généré par les utilisateurs offre un contraste avec les ensembles de données plus organisés, ce qui le rend précieux pour étudier les défis des données visuelles bruitées et diversifiées. Au début des années 2020, il reste largement cité et utilisé dans la recherche académique, en particulier dans des domaines comme l'apprentissage multi-étiquettes et le apprentissage par transfert. L'ensemble de données est librement disponible à des fins de recherche, et son site officiel fournit une documentation et des liens de téléchargement, bien que les images originales soient hébergées sur Flickr et puissent être sujettes à disponibilité.
Limitations
Une limitation de NUS-WIDE est que ses étiquettes sont relativement grossières, ne couvrant que 81 concepts, ce qui peut ne pas capturer des distinctions fines. De plus, les caractéristiques précalculées sont basées sur des techniques plus anciennes comme SIFT, qui ont été supplantées par des représentations apprises à partir de modèles de apprentissage profond. Les chercheurs extraient souvent de nouvelles caractéristiques des images brutes en utilisant des architectures modernes, mais cela nécessite un stockage et un calcul supplémentaires. L'ensemble de données souffre également d'un déséquilibre des étiquettes, certains concepts apparaissant beaucoup plus fréquemment que d'autres, ce qui peut biaiser les métriques d'évaluation.
Malgré ces limitations, NUS-WIDE reste une ressource précieuse pour l'évaluation et la compréhension de l'analyse d'images multi-étiquettes. Sa combinaison d'échelle, d'images réelles et d'annotations multi-étiquettes continue de soutenir une large gamme de recherches en Machine learning, des méthodes classiques aux approches contemporaines de apprentissage profond.