Traduit de l'anglais

ImageNet LSVRC 2012 était le défi annuel de reconnaissance visuelle à grande échelle ImageNet, où AlexNet, un réseau de neurones convolutif, a atteint une erreur top-5 de 15,3 %, surpassant toutes les autres entrées de plus de 10,8 points de pourcentage et déclenchant l'essor de l'apprentissage profond.

Le défi de reconnaissance visuelle à grande échelle ImageNet (ILSVRC) 2012 était la troisième édition d'un concours logiciel annuel dans lequel des programmes s'affrontent pour classer et détecter correctement des objets et des scènes issus de la base de données ImageNet. Le défi de 2012 est largement considéré comme un tournant dans l'histoire de l'intelligence artificielle, car l'entrée gagnante, un réseau de neurones nommé AlexNet, a atteint une erreur top-5 de 15,3 % sur l'ensemble de test, soit plus de 10,8 points de pourcentage de moins que le finaliste. Cette amélioration spectaculaire a démontré la puissance des techniques de apprentissage profond et de apprentissage automatique, déclenchant une vague de recherche et d'investissement qui continue de façonner le domaine.

Le projet ImageNet lui-même a été initié par la chercheuse en IA Fei-Fei Li en 2006, avec pour objectif d'élargir les données disponibles pour l'entraînement des algorithmes d'IA. Li a rencontré le professeur de Princeton Christiane Fellbaum, l'un des créateurs de WordNet, en 2007, et a ensuite construit ImageNet en utilisant les quelque 22 000 noms de WordNet comme point de départ. La base de données a été construite avec l'aide d'une annotation participative via Amazon Mechanical Turk, l'étiquetage commençant en juillet 2008 et se terminant en avril 2010. L'effort a impliqué 49 000 travailleurs de 167 pays qui ont filtré et étiqueté plus de 160 millions d'images candidates, résultant en plus de 14 millions d'images annotées manuellement dans plus de 20 000 catégories.

Histoire et développement

L'idée d'ImageNet est née de l'observation de Li selon laquelle la plupart des recherches en IA à l'époque se concentraient sur les modèles et les algorithmes plutôt que sur les données. Elle a été inspirée par une estimation de 1987 selon laquelle une personne moyenne reconnaît environ 30 000 types d'objets différents. En 2007, Li a rencontré Christiane Fellbaum pour discuter du projet, et la réunion a conduit à la décision de construire ImageNet à partir des synsets nominaux de WordNet. Li a rassemblé une équipe de chercheurs à Princeton, où elle était professeure adjointe, et ils ont utilisé Amazon Mechanical Turk pour classer les images.

Le plan initial prévoyait 10 000 images par catégorie, pour 40 000 catégories à 400 millions d'images, chacune vérifiée trois fois. Cependant, les humains peuvent classer au maximum 2 images par seconde, et à ce rythme, il était estimé qu'il faudrait 19 années-humaines de travail sans repos. L'équipe a présenté la base de données pour la première fois sous forme de poster à la Conférence sur la vision par ordinateur et la reconnaissance de formes (CVPR) 2009 en Floride, intitulé « ImageNet : A Preview of a Large-scale Hierarchical Dataset ».

En 2009, Alex Berg a suggéré d'ajouter la localisation d'objets comme tâche. Li a approché le concours PASCAL Visual Object Classes pour une collaboration, ce qui a abouti au lancement du défi de reconnaissance visuelle à grande échelle ImageNet en 2010. Le défi utilise une liste réduite de 1 000 classes non chevauchantes, comparée aux 20 classes et 19 737 images de PASCAL VOC en 2010.

Importance pour l'apprentissage profond

Le 30 septembre 2012, AlexNet, un réseau de neurones convolutif (CNN), a atteint une erreur top-5 de 15,3 % dans le défi ImageNet 2012. Cela représentait plus de 10,8 points de pourcentage de moins que le finaliste. L'utilisation de réseaux de neurones convolutifs a été rendue possible par l'emploi d'unités de traitement graphique (GPU) pendant l'entraînement, ce qui a été un ingrédient essentiel de la révolution de l'apprentissage profond. Selon The Economist, « Soudainement, les gens ont commencé à prêter attention, non seulement au sein de la communauté de l'IA, mais dans toute l'industrie technologique ».

La victoire d'AlexNet est souvent citée comme le déclencheur de l'essor de l'apprentissage profond. Elle a démontré que les réseaux de neurones pouvaient atteindre des résultats de pointe sur des tâches visuelles complexes, conduisant à une adoption rapide des techniques d'apprentissage profond dans divers domaines, y compris l'IA générative et les grands modèles de langage. En 2015, AlexNet a été surpassé par le réseau de neurones convolutif très profond de Microsoft avec plus de 100 couches, qui a remporté le concours ImageNet 2015 avec un taux d'erreur de 3,57 % sur l'ensemble de test.

Andrej Karpathy a estimé en 2014 qu'avec un effort concentré, il pourrait atteindre un taux d'erreur de 5,1 %, et environ 10 personnes de son laboratoire ont atteint environ 12-13 % avec moins d'effort. Il a été estimé qu'avec un effort maximal, un humain pourrait atteindre une erreur de 2,4 %.

Composition de l'ensemble de données

ImageNet externalise son processus d'annotation. Les annotations au niveau de l'image indiquent la présence ou l'absence d'une classe d'objets dans une image, comme « il y a des tigres dans cette image » ou « il n'y a pas de tigres dans cette image ». Les annotations au niveau de l'objet fournissent une boîte englobante autour de la partie visible de l'objet indiqué. ImageNet utilise une variante du schéma WordNet élargi pour catégoriser les objets, augmenté de 120 catégories de races de chiens pour illustrer la classification fine.

En 2012, ImageNet était le plus grand utilisateur académique de Mechanical Turk au monde, avec un travailleur moyen identifiant 50 images par minute. Les statistiques récapitulatives données le 30 avril 2010 montraient un total de 21 841 synsets non vides, 14 197 122 images, 1 034 908 images avec annotations de boîtes englobantes et 1,2 million d'images avec caractéristiques SIFT.

Les catégories d'ImageNet ont été filtrées à partir des concepts de WordNet. Chaque concept est appelé un « synset » (ensemble de synonymes), et il y avait plus de 100 000 synsets dans WordNet 3.0, la majorité étant des noms (80 000+). ImageNet a filtré ces synsets pour obtenir 21 841 synsets qui sont des noms comptables pouvant être illustrés visuellement. Chaque synset a un identifiant WordNet (wnid), qui commence par « n » car ImageNet n'inclut que des noms. Les catégories se répartissent en 9 niveaux, du niveau 1 (comme « mammifère ») au niveau 9 (comme « berger allemand »).

Format d'image et prétraitement

Les images ont été extraites de moteurs de recherche d'images en ligne (Google, Picsearch, MSN, Yahoo, Flickr) en utilisant des synonymes dans plusieurs langues. ImageNet se compose d'images au format RVB avec des résolutions variables. Par exemple, dans ImageNet 2012, la catégorie « poisson » a des résolutions allant de 4288 x 2848 à 75 x 56. En apprentissage automatique, celles-ci sont généralement prétraitées en une résolution constante standard et blanchies avant un traitement ultérieur par les réseaux de neurones.

Par exemple, dans PyTorch, les images ImageNet sont par défaut normalisées en divisant les valeurs de pixels pour qu'elles se situent entre 0 et 1, puis en soustrayant [0,485, 0,456, 0,406], puis en divisant par [0,229, 0,224, 0,225]. Ce sont les moyennes et écarts-types pour ImageNet, donc cela blanchit les données d'entrée.

Étiquettes et annotations

Chaque image est étiquetée avec exactement un wnid. Les caractéristiques SIFT denses (descripteurs SIFT bruts, mots de code quantifiés et coordonnées de chaque descripteur/mot de code) pour ImageNet-1K étaient disponibles en téléchargement, conçues pour le sac de mots visuels. Les boîtes englobantes des objets étaient disponibles pour environ 3 000 synsets populaires avec en moyenne 150 images dans chaque synset. Certaines images ont également des annotations d'attributs, bien que les détails complets de celles-ci ne soient pas spécifiés dans les sources disponibles.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:artificial-intelligence·deep-learning·computer-vision·machine-learning
Cette page a été modifiée pour la dernière fois le 13 sept. 2026 par AI Wiki Bot · Historique