Traduit de l'anglais

ImageNet-21K est l'ensemble de données ImageNet complet, comprenant plus de 21 000 catégories visuelles (synsets) et 14 millions d'images annotées manuellement, utilisé pour l'entraînement et l'évaluation de modèles de reconnaissance d'objets visuels en apprentissage automatique.

ImageNet-21K fait référence à l'ensemble de données ImageNet complet, une grande base de données visuelles conçue pour la recherche sur les logiciels de reconnaissance d'objets visuels. Elle contient plus de 14 millions d'images annotées manuellement, organisées en plus de 21 000 catégories, appelées synsets, dérivées de la base de données lexicale WordNet. L'ensemble de données est librement disponible sous forme d'annotations d'URL d'images tierces, bien que les images réelles ne soient pas la propriété d'ImageNet. Depuis 2010, ImageNet héberge un concours annuel, le ImageNet Large Scale Visual Recognition Challenge (ILSVRC), qui utilise un sous-ensemble réduit de 1 000 classes sans chevauchement, communément appelé ImageNet-1K.

Historique

La chercheuse en IA Fei-Fei Li a commencé à développer l'idée d'ImageNet en 2006, visant à élargir les données disponibles pour l'entraînement des algorithmes d'IA. En 2007, elle a rencontré la professeure de Princeton Christiane Fellbaum, une créatrice de WordNet, et a ensuite construit ImageNet à partir d'environ 22 000 noms de WordNet. Li a également été inspirée par une estimation de 1987 selon laquelle une personne moyenne reconnaît environ 30 000 types d'objets.

En tant que professeure adjointe à Princeton, Li a réuni une équipe et a utilisé Amazon Mechanical Turk pour la classification des images. L'étiquetage a commencé en juillet 2008 et s'est terminé en avril 2010, impliquant 49 000 travailleurs de 167 pays qui ont filtré et étiqueté plus de 160 millions d'images candidates. Chacune des 14 millions d'images a été étiquetée trois fois. Le plan initial prévoyait 10 000 images par catégorie sur 40 000 catégories, soit un total de 400 millions d'images, mais cela n'a pas été atteint. La première présentation publique a été un poster à la conférence sur la vision par ordinateur et la reconnaissance des formes (CVPR) de 2009 en Floride.

En 2009, Alex Berg a suggéré d'ajouter la localisation d'objets, ce qui a conduit à une collaboration avec le concours PASCAL Visual Object Classes et au lancement de l'ILSVRC en 2010, qui comportait 1 000 classes et la localisation d'objets, contre 20 classes pour PASCAL VOC.

Importance pour l'apprentissage profond

Le 30 septembre 2012, un réseau neuronal convolutif (CNN) appelé AlexNet a atteint une erreur top-5 de 15,3 % dans le défi ImageNet 2012, soit plus de 10,8 points de pourcentage de moins que le finaliste. Ce succès a été rendu possible par l'utilisation d'unités de traitement graphique (GPU) pendant l'entraînement, un facteur clé de la révolution de l'apprentissage-profond. Selon The Economist, « Soudain, les gens ont commencé à prêter attention, non seulement au sein de la communauté de l'IA, mais dans toute l'industrie technologique. »

En 2015, AlexNet a été surpassé par le CNN très profond de Microsoft avec plus de 100 couches, qui a remporté le concours ImageNet 2015 avec un taux d'erreur de 3,57 %. Andrej Karpathy a estimé en 2014 qu'avec un effort concentré, il pourrait atteindre 5,1 % d'erreur, et environ 10 personnes de son laboratoire ont atteint environ 12 à 13 % avec moins d'effort. Il a été estimé qu'avec un effort maximal, un humain pourrait atteindre 2,4 % d'erreur.

Ensemble de données

ImageNet externalise son processus d'annotation. Les annotations au niveau de l'image indiquent la présence ou l'absence d'une classe d'objets, tandis que les annotations au niveau de l'objet fournissent des boîtes englobantes autour des objets visibles. L'ensemble de données utilise une variante du schéma WordNet, augmentée de 120 catégories de races de chiens pour la classification fine. En 2012, ImageNet était le plus grand utilisateur académique de Mechanical Turk au monde, avec des travailleurs identifiant en moyenne 50 images par minute.

Au 30 avril 2010, l'ensemble de données comptait 21 841 synsets non vides, 14 197 122 images, 1 034 908 images avec annotations de boîtes englobantes, et 1,2 million d'images avec caractéristiques SIFT (pour 1 000 synsets).

Catégories

Les catégories ont été filtrées à partir des concepts de WordNet, chacune appelée un « synset » (ensemble de synonymes). WordNet 3.0 contient plus de 100 000 synsets, principalement des noms (plus de 80 000), et ImageNet a filtré ceux-ci à 21 841 noms comptables pouvant être illustrés visuellement. Chaque synset a un identifiant WordNet (wnid), commençant par « n » car seuls les noms sont inclus ; par exemple, le wnid pour « chien, chien domestique, Canis familiaris » est « n02084071 ». Les catégories s'étendent sur 9 niveaux, du niveau 1 (par exemple, « mammifère ») au niveau 9 (par exemple, « berger allemand »).

Format des images

Les images ont été extraites des moteurs de recherche en ligne (Google, Picsearch, MSN, Yahoo, Flickr) en utilisant des synonymes dans plusieurs langues. Elles sont au format RVB avec des résolutions variables ; par exemple, dans la version 2012, la catégorie « poisson » varie de 4288 x 2848 à 75 x 56 pixels. En apprentissage-automatique, les images sont généralement prétraitées à une résolution constante et blanchies. Dans PyTorch, les images ImageNet sont normalisées en divisant les valeurs de pixels à [0,1], en soustrayant [0,485, 0,456, 0,406], et en divisant par [0,229, 0,224, 0,225], qui sont la moyenne et les écarts types de l'ensemble de données.

Étiquettes et annotations

Chaque image est étiquetée avec exactement un wnid. Les caractéristiques SIFT denses (descripteurs bruts, mots de code quantifiés et coordonnées) sont disponibles pour ImageNet-1K, conçues pour les modèles de sac de mots visuels. Des boîtes englobantes sont disponibles pour environ 3 000 synsets populaires, avec une moyenne de 150 images par synset. Certaines images ont également des annotations d'attributs.

Impact et héritage

ImageNet-21K a joué un rôle déterminant dans l'avancement de la recherche en intelligence-artificielle et en vision-par-ordinateur. Le défi ILSVRC, en particulier le résultat d'AlexNet en 2012, a catalysé l'adoption généralisée des méthodes de réseau-neuronal et d'apprentissage-profond. L'échelle et la structure hiérarchique de l'ensemble de données ont permis l'entraînement de grands modèles, influençant les développements ultérieurs dans l'ia-generative et d'autres domaines. Bien que l'ensemble complet de 21K soit moins couramment utilisé que le sous-ensemble 1K pour l'évaluation comparative, il reste une ressource précieuse pour le pré-entraînement et la recherche sur la classification fine.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:computer-vision·dataset·deep-learning·machine-learning
Cette page a été modifiée pour la dernière fois le 12 sept. 2026 par AI Wiki Bot · Historique