Traduit de l'anglais

ImageNet est une base de données visuelles à grande échelle créée par Fei-Fei Li et ses collègues, contenant plus de 14 millions d'images annotées, utilisées pour entraîner et évaluer des algorithmes de reconnaissance d'objets visuels. Lancée en 2009, elle est devenue centrale dans la révolution de l'apprentissage profond après le succès d'AlexNet en 2012.

ImageNet est une base de données visuelle à grande échelle conçue pour la recherche en logiciels de reconnaissance d'objets visuels. Le projet comprend plus de 14 millions d'images annotées manuellement indiquant les objets représentés, avec au moins un million d'images fournissant également des boîtes englobantes. Il contient plus de 20 000 catégories, chacune comprenant généralement plusieurs centaines d'images. La base de données d'URLs d'images tierces et leurs annotations est librement accessible, bien que les images elles-mêmes ne soient pas la propriété d'ImageNet. Depuis 2010, ImageNet héberge une compétition annuelle, le défi de reconnaissance visuelle à grande échelle ImageNet (ILSVRC), où des programmes logiciels s'affrontent pour classifier et détecter des objets et des scènes à l'aide d'une liste réduite de mille classes non chevauchantes.

Le projet est né de la vision de la chercheuse en IA Fei-Fei Li, qui a commencé à travailler sur l'idée en 2006, visant à élargir et améliorer les données disponibles pour l'entraînement des algorithmes d'IA. À cette époque, la plupart des recherches en IA se concentraient sur les modèles et les algorithmes, mais Li cherchait à résoudre le goulot d'étranglement des données. En 2007, Li a rencontré Christiane Fellbaum, professeure à Princeton et créatrice de WordNet, puis a construit ImageNet à partir des quelque 22 000 noms de WordNet, en incorporant nombre de ses caractéristiques. Li s'est également inspirée d'une estimation de 1987 selon laquelle une personne moyenne reconnaît environ 30 000 types d'objets différents. En tant que professeure adjointe à Princeton, Li a constitué une équipe de recherche et a utilisé Amazon Mechanical Turk pour faciliter la classification des images. L'annotation a commencé en juillet 2008 et s'est achevée en avril 2010, avec 49 000 travailleurs de 167 pays qui ont filtré et annoté plus de 160 millions d'images candidates, avec un budget suffisant pour que chacune des 14 millions d'images soit annotée trois fois.

La base de données a été présentée pour la première fois sous forme de poster lors de la conférence sur la vision par ordinateur et la reconnaissance de formes (CVPR) de 2009 en Floride, intitulé « ImageNet : A Preview of a Large-scale Hierarchical Dataset ». En 2009, Alex Berg a suggéré d'ajouter la localisation d'objets comme tâche, ce qui a conduit à une collaboration avec le concours PASCAL Visual Object Classes et au lancement du défi de reconnaissance visuelle à grande échelle ImageNet en 2010, qui propose 1 000 classes et la localisation d'objets, bien plus que les 20 classes et 19 737 images de PASCAL VOC en 2010.

Construction de la base de données

ImageNet externalise son processus d'annotation. Les annotations au niveau de l'image indiquent la présence ou l'absence d'une classe d'objets dans une image, par exemple « il y a des tigres dans cette image » ou « il n'y a pas de tigres dans cette image ». Les annotations au niveau de l'objet fournissent une boîte englobante autour de la partie visible de l'objet indiqué. ImageNet utilise une variante du schéma large de WordNet pour catégoriser les objets, enrichi de 120 catégories de races de chiens pour une classification fine. En 2012, ImageNet était le plus grand utilisateur académique de Mechanical Turk au monde, où le travailleur moyen identifiait 50 images par minute. Le plan initial pour ImageNet complet était d'environ 50 millions d'images propres, diverses et en pleine résolution, réparties sur environ 50 000 synsets, mais cet objectif n'a pas été atteint.

Statistiques résumées au 30 avril 2010 :

  • Nombre total de synsets non vides : 21 841
  • Nombre total d'images : 14 197 122
  • Nombre d'images avec annotations de boîtes englobantes : 1 034 908
  • Nombre de synsets avec caractéristiques SIFT : 1 000
  • Nombre d'images avec caractéristiques SIFT : 1,2 million

Catégories et format des images

Les catégories d'ImageNet ont été filtrées à partir des concepts de WordNet. Chaque concept, pouvant contenir des synonymes, est appelé un « ensemble de synonymes » ou « synset ». Bien que WordNet 3.0 compte plus de 100 000 synsets, principalement des noms (plus de 80 000), ImageNet a réduit le nombre de noms comptables à 21 841 synsets pouvant être illustrés visuellement. Chaque synset possède un identifiant WordNet (wnid), une concaténation de la partie du discours et d'un décalage ; tous les wnids commencent par « n » car ImageNet n'inclut que des noms. Par exemple, le wnid pour « chien, chien domestique, Canis familiaris » est « n02084071 ». Les catégories s'étendent sur 9 niveaux, du niveau 1 (comme « mammifère ») au niveau 9 (comme « berger allemand »).

Les images ont été récupérées à partir de recherches en ligne utilisant des synonymes multilingues. Elles sont au format RVB avec des résolutions variées. Par exemple, dans la catégorie « poisson » d'ImageNet 2012, la résolution varie de 4288 x 2848 à 75 x 56. En apprentissage automatique, ces images sont généralement prétraitées à une résolution constante standard et blanchies avant l'entraînement. Par exemple, dans PyTorch, les images sont normalisées en divisant les valeurs de pixels entre 0 et 1, puis en soustrayant la moyenne [0,485, 0,456, 0,406] et en divisant par l'écart type [0,229, 0,224, 0,225]. Ces statistiques sont dérivées d'ImageNet.

Annotations

Chaque image est annotée avec un seul wnid. Les caractéristiques SIFT denses (y compris les descripteurs SIFT bruts, les mots codés quantifiés et les coordonnées) pour ImageNet-1K étaient disponibles en téléchargement, conçues pour une approche de sac de mots. Les boîtes englobantes pour les objets étaient disponibles pour environ 3 000 synsets, avec une moyenne de 150 images chacun. Certaines images comportent des annotations d'attributs, bien que les détails ne soient pas entièrement spécifiés. La base de données inclut également certains synsets avec des caractéristiques SIFT pour 1,2 million d'images.

Importance pour l'apprentissage profond

ImageNet a joué un rôle central dans la révolution de l'apprentissage profond. Le 30 septembre 2012, un réseau de neurones convolutif appelé AlexNet a atteint un taux d'erreur top-5 de 15,3 % lors du défi ImageNet 2012, soit plus de 10,8 points de pourcentage sous le finaliste suivant. Ce succès a été rendu possible par l'utilisation d'unités de traitement graphique (GPU) lors de l'entraînement, qui sont devenues un ingrédient essentiel de la révolution de l'apprentissage profond. Selon The Economist, « Soudain, les gens ont commencé à prêter attention, non seulement au sein de la communauté de l'IA, mais dans toute l'industrie technologique ». En 2015, AlexNet a été surpassé par le réseau neuronal très profond de Microsoft, avec plus de 100 couches, qui a remporté le défi ImageNet 2015 avec un taux d'erreur de 3,57 %. En 2014, Andrej Karpathy a estimé qu'avec un effort concentré, il pouvait atteindre un taux d'erreur de 5,1 %, et qu'environ 10 personnes de son laboratoire atteignaient environ 12 à 13 % avec moins d'effort. On estimait qu'avec un effort maximal, un humain pouvait atteindre environ 2,4 % d'erreur.

L'impact d'ImageNet s'étend bien au-delà de la compétition elle-même. La disponibilité d'un ensemble de données vaste, structuré et annoté a permis aux chercheurs d'entraîner et d'évaluer des modèles à une échelle et une variété sans précédent. Cela a stimulé l'adoption d'innovations en apprentissage profond telles que les réseaux de neurones, les réseaux résiduels, et des techniques comme l'augmentation de données et la normalisation par lots. Cela a également accéléré les progrès en apprentissage automatique et en intelligence artificielle, et ses tâches de référence, comme la classification et la localisation, sont devenues fondamentales pour évaluer les systèmes de vision par ordinateur. L'organisation des données via WordNet a influencé d'autres ensembles de données à grande échelle et les flux de travail standard dans PyTorch et d'autres frameworks.

La disponibilité publique d'ImageNet a également eu un impact plus large. Il a été utilisé par de nombreux groupes de recherche et entreprises, notamment Google DeepMind, OpenAI et Microsoft, pour entraîner et évaluer des modèles. Son influence s'étend au développement des architectures de transformeurs, devenues depuis standard dans la modélisation du langage. Ces dernières années, ImageNet reste une référence essentielle pour la recherche en vision par ordinateur, bien que l'ensemble de données ait également suscité des débats sur le droit d'auteur et la vie privée, en raison de l'utilisation d'images tierces. Malgré ces préoccupations, l'échelle et la structure d'ImageNet continuent d'inspirer des ensembles de données similaires dans d'autres domaines, comme ImageNet, mais l'accent reste sur l'ImageNet original et son rôle dans l'avancement de la reconnaissance visuelle.

Sources et impact

En résumé, la création d'ImageNet a été un événement marquant dans l'histoire de l'intelligence artificielle. Il a fourni un ensemble de données complet et évolutif qui a mis en lumière l'importance des approches axées sur les données. Son influence sur l'essor de l'apprentissage profond ne peut être surestimée, car il a permis des percées dans les algorithmes et le matériel qui ont abouti à l'ère actuelle de l'IA générative et des grands modèles. En 2025, ImageNet sert toujours de référence pour évaluer de nouvelles méthodes et théories, notamment celles impliquant les transformeurs, les grands modèles de langage et les modèles de fondation. L'approche participative du projet - l'annotation externalisée via une communauté mondiale - a également établi des modèles pour de nombreux ensembles de données et initiatives ultérieurs.

Le succès d'ImageNet a démontré que les ensembles de données de haute qualité à grande échelle ne sont pas seulement bénéfiques, mais souvent essentiels aux progrès de l'IA. Il a stimulé des avancées dans le calcul distribué et les services cloud tels que Amazon Web Services et Google Cloud, ainsi que des améliorations matérielles de la part d'entreprises comme NVIDIA et AMD. La compétition elle-même, le défi de reconnaissance visuelle à grande échelle ImageNet, reste une institution pour mesurer les progrès en vision par ordinateur. Malgré l'évolution continue de l'IA, l'héritage d'ImageNet perdure, de la recherche académique aux déploiements pratiques dans les véhicules autonomes, l'imagerie médicale et les systèmes multimodaux, façonnant la trajectoire du domaine de l'IA symbolique vers les réseaux de neurones et l'apprentissage automatique. Dans les années suivant sa publication, ImageNet a influencé la conception d'ensembles de données ultérieurs comme COCO et Flickr, qui visent également à fournir des données annotées à grande échelle pour faire progresser la frontière de l'intelligence machine.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:computer-vision·deep-learning·ai·dataset
Cette page a été modifiée pour la dernière fois le 9 sept. 2026 par AI Wiki Bot · Historique