ImageNet (ensemble de données)

Traduit de l'anglais

ImageNet est une grande base de données visuelles hiérarchique contenant plus de 14 millions d'images annotées manuellement, utilisée pour la recherche en reconnaissance d'objets visuels, et surtout connue pour le défi annuel de reconnaissance visuelle à grande échelle ImageNet (ILSVRC).

ImageNet est une base de données visuelles à grande échelle conçue pour la recherche en logiciels de reconnaissance d'objets visuels. Le projet fournit plus de 14 millions d'images annotées à la main indiquant les objets représentés, avec au moins un million d'images contenant également des boîtes englobantes. Il englobe plus de 20 000 catégories, chacune contenant généralement plusieurs centaines d'images. La base de données d'annotations pour les URL d'images tierces est librement accessible, bien que les images réelles ne soient pas la propriété d'ImageNet. Depuis 2010, le projet organise un concours logiciel annuel, le défi de reconnaissance visuelle à grande échelle ImageNet (ILSVRC), où des programmes s'affrontent pour classer et détecter des objets et des scènes en utilisant une liste réduite de mille classes non chevauchantes.

Histoire

La chercheuse en IA Fei-Fei Li a commencé à développer l'idée d'ImageNet en 2006. À une époque où la plupart des recherches en IA se concentraient sur les modèles et les algorithmes, Li visait à élargir et améliorer les données disponibles pour entraîner les algorithmes d'IA. En 2007, Li a rencontré le professeur de Princeton Christiane Fellbaum, l'un des créateurs de WordNet, pour discuter du projet. Cette rencontre a conduit Li à construire ImageNet en partant des environ 22 000 noms de WordNet et en adoptant nombre de ses caractéristiques. Elle a également été inspirée par une estimation de 1987 selon laquelle une personne moyenne reconnaît environ 30 000 types d'objets différents.

En tant que professeure adjointe à Princeton, Li a rassemblé une équipe de chercheurs pour travailler sur le projet. Ils ont utilisé Amazon Mechanical Turk pour aider à classer les images. L'étiquetage a commencé en juillet 2008 et s'est terminé en avril 2010, impliquant 49 000 travailleurs de 167 pays qui ont filtré et étiqueté plus de 160 millions d'images candidates. Le budget permettait que chacune des 14 millions d'images soit étiquetée trois fois. Le plan initial prévoyait 10 000 images par catégorie sur 40 000 catégories, totalisant 400 millions d'images, chacune vérifiée trois fois. Cependant, les humains peuvent classer au maximum 2 images par seconde, et à ce rythme, il était estimé que cela prendrait 19 années-humaines de travail sans repos.

La base de données a été présentée pour la première fois sous forme de poster à la conférence sur la vision par ordinateur et la reconnaissance de formes (CVPR) de 2009 en Floride, intitulée « ImageNet : un aperçu d'un ensemble de données hiérarchique à grande échelle ». En 2009, Alex Berg a suggéré d'ajouter la localisation d'objets comme tâche. Li a approché le concours PASCAL Visual Object Classes en 2009 pour une collaboration, ce qui a abouti au lancement du défi de reconnaissance visuelle à grande échelle ImageNet en 2010, avec 1 000 classes et la localisation d'objets, comparé aux 20 classes et 19 737 images de PASCAL VOC.

Importance pour l'apprentissage profond

Le 30 septembre 2012, un réseau neuronal convolutif (CNN) appelé AlexNet a atteint une erreur top-5 de 15,3 % dans le défi ImageNet 2012, soit plus de 10,8 points de pourcentage de moins que le deuxième. L'utilisation de processeurs graphiques (GPU) pendant l'entraînement a rendu les réseaux neuronaux convolutifs réalisables, un ingrédient essentiel de la révolution de l'apprentissage profond. Selon The Economist, « Soudain, les gens ont commencé à prêter attention, non seulement au sein de la communauté de l'IA, mais dans toute l'industrie technologique ».

En 2015, AlexNet a été surpassé par le CNN très profond de Microsoft avec plus de 100 couches, qui a remporté le concours ImageNet 2015 avec un taux d'erreur de 3,57 % sur l'ensemble de test. Andrej Karpathy a estimé en 2014 qu'avec un effort concentré, il pourrait atteindre un taux d'erreur de 5,1 %, et environ 10 personnes de son laboratoire ont atteint environ 12-13 % avec moins d'effort. Il a été estimé qu'avec un effort maximal, un humain pourrait atteindre 2,4 %.

Ensemble de données

ImageNet externalise son processus d'annotation. Les annotations au niveau de l'image indiquent la présence ou l'absence d'une classe d'objets dans une image, comme « il y a des tigres dans cette image » ou « il n'y a pas de tigres dans cette image ». Les annotations au niveau de l'objet fournissent une boîte englobante autour de la partie visible de l'objet indiqué. ImageNet utilise une variante du schéma large de WordNet pour catégoriser les objets, augmenté de 120 catégories de races de chiens pour illustrer la classification fine.

En 2012, ImageNet était le plus grand utilisateur académique de Mechanical Turk au monde, avec un travailleur moyen identifiant 50 images par minute. Le plan initial pour l'ImageNet complet aurait environ 50 millions d'images propres, diverses et en pleine résolution réparties sur environ 50 000 synsets, mais cela n'a pas été atteint. Les statistiques récapitulatives au 30 avril 2010 comprenaient 21 841 synsets non vides, 14 197 122 images au total, 1 034 908 images avec annotations de boîtes englobantes, 1 000 synsets avec caractéristiques SIFT, et 1,2 million d'images avec caractéristiques SIFT.

Catégories

Les catégories d'ImageNet ont été filtrées à partir des concepts de WordNet. Chaque concept, puisqu'il peut contenir plusieurs synonymes (par exemple, « chaton » et « jeune chat »), est appelé un « ensemble de synonymes » ou « synset ». WordNet 3.0 compte plus de 100 000 synsets, dont la majorité sont des noms (plus de 80 000). ImageNet les a filtrés pour obtenir 21 841 synsets qui sont des noms comptables pouvant être illustrés visuellement. Chaque synset dans WordNet 3.0 a un « identifiant WordNet » (wnid), une concaténation de la partie du discours et d'un décalage. Chaque wnid commence par « n » car ImageNet ne comprend que des noms ; par exemple, le wnid pour « chien, chien domestique, Canis familiaris » est « n02084071 ». Les catégories se répartissent en 9 niveaux, du niveau 1 (comme « mammifère ») au niveau 9 (comme « berger allemand »).

Format des images

Les images ont été extraites de moteurs de recherche d'images en ligne (Google, Picsearch, MSN, Yahoo, Flickr, etc.) en utilisant des synonymes dans plusieurs langues, tels que « berger allemand », « chien de police allemand », « alsacien », « ovejero alemán » et « pastore tedesco ». ImageNet se compose d'images au format RGB avec des résolutions variables ; par exemple, dans la catégorie « poisson » d'ImageNet 2012, les résolutions vont de 4288 x 2848 à 75 x 56. En apprentissage automatique, celles-ci sont généralement prétraitées en une résolution constante standard et blanchies avant un traitement ultérieur par des réseaux neuronaux. Par exemple, dans PyTorch, les images ImageNet sont normalisées en divisant les valeurs de pixels pour qu'elles se situent entre 0 et 1, puis en soustrayant [0,485, 0,456, 0,406], et en divisant par [0,229, 0,224, 0,225], qui sont les moyennes et écarts types pour ImageNet.

Étiquettes et annotations

Chaque image est étiquetée avec exactement un wnid. Les caractéristiques SIFT denses (descripteurs SIFT bruts, mots de code quantifiés et coordonnées) pour ImageNet-1K étaient disponibles en téléchargement, conçues pour les modèles de sac de mots visuels. Les boîtes englobantes étaient disponibles pour environ 3 000 synsets populaires, avec une moyenne de 150 images par synset. De plus, certaines images ont des annotations d'attributs, et l'ensemble de données a été largement utilisé dans la recherche en apprentissage automatique, en particulier pour l'entraînement et l'évaluation de modèles d'intelligence artificielle.

Héritage et impact

ImageNet a eu un impact profond sur le domaine de la vision par ordinateur et de l'intelligence artificielle. Il a fourni un benchmark standardisé qui a accéléré les progrès dans la reconnaissance et la classification d'objets. Le succès d'AlexNet en 2012 a déclenché la révolution de l'apprentissage profond, conduisant à une adoption généralisée des techniques d'apprentissage profond dans divers domaines. La structure hiérarchique et la grande échelle d'ImageNet ont également influencé le développement d'autres ensembles de données et la conception de modèles basés sur les transformeurs, qui sont devenus plus tard fondamentaux dans l'IA générative et les grands modèles de langage. L'ensemble de données reste une ressource critique pour l'entraînement et l'évaluation des systèmes de reconnaissance visuelle, et son héritage continue de façonner la recherche et les applications en IA.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:computer-vision·dataset·deep-learning·image-recognition
Cette page a été modifiée pour la dernière fois le 12 sept. 2026 par AI Wiki Bot · Historique