Traduit de l'anglais

Le défi ImageNet, officiellement nommé ImageNet Large Scale Visual Recognition Challenge (ILSVRC), est une compétition logicielle annuelle de classification d'images et de détection d'objets, organisée depuis 2010, et un moteur clé des avancées en apprentissage profond.

Le défi ImageNet, officiellement connu sous le nom de ImageNet Large Scale Visual Recognition Challenge (ILSVRC), est un concours logiciel annuel où des programmes s'affrontent pour classer et détecter correctement des objets et des scènes dans des images. Lancé en 2010, il utilise une liste réduite de mille classes non chevauchantes issues de la base de données ImageNet, qui contient plus de 14 millions d'images annotées manuellement réparties dans plus de 20 000 catégories. Le défi est devenu une référence essentielle en vision par ordinateur, catalysant la révolution de l'apprentissage profond après 2012.

Historique

La chercheuse en IA Fei-Fei Li a commencé à développer le concept d'ImageNet en 2006, visant à élargir les données disponibles pour entraîner les algorithmes d'IA à une époque où la recherche se concentrait principalement sur les modèles. En 2007, Li a rencontré la professeure de Princeton Christiane Fellbaum, une créatrice de WordNet, et a construit ImageNet à partir d'environ 22 000 noms de WordNet. Elle s'est inspirée d'une estimation de 1987 selon laquelle une personne moyenne reconnaît environ 30 000 types d'objets.

En tant que professeure adjointe à Princeton, Li a constitué une équipe qui a utilisé Amazon Mechanical Turk pour la classification des images. L'étiquetage a duré de juillet 2008 à avril 2010, impliquant 49 000 travailleurs de 167 pays qui ont filtré et étiqueté plus de 160 millions d'images candidates. Chacune des 14 millions d'images a été étiquetée trois fois. Le plan initial prévoyait 10 000 images par catégorie sur 40 000 catégories, mais cela n'a pas été atteint.

La base de données a été présentée pour la première fois sous forme de poster à la conférence sur la vision par ordinateur et la reconnaissance de formes (CVPR) de 2009 en Floride, intitulé « ImageNet: A Preview of a Large-scale Hierarchical Dataset ». En 2009, Alex Berg a suggéré d'ajouter la localisation d'objets comme tâche, ce qui a conduit à une collaboration avec le concours PASCAL Visual Object Classes. Le premier défi ImageNet en 2010 comportait 1 000 classes et la localisation d'objets, contre 20 classes et 19 737 images pour PASCAL VOC.

Importance pour l'apprentissage profond

Le 30 septembre 2012, un réseau de neurones convolutif (CNN) appelé AlexNet a atteint une erreur top-5 de 15,3 % lors du défi ImageNet 2012, soit plus de 10,8 points de pourcentage de moins que le deuxième. Ce succès a été rendu possible par l'entraînement sur des unités de traitement graphique (GPU), un ingrédient essentiel de la révolution de l'apprentissage profond. Selon The Economist, « Soudain, les gens ont commencé à prêter attention, non seulement au sein de la communauté de l'IA, mais dans toute l'industrie technologique ».

En 2015, AlexNet a été surpassé par le CNN très profond de Microsoft avec plus de 100 couches, qui a remporté le concours ImageNet 2015 avec un taux d'erreur de 3,57 % sur l'ensemble de test. Andrej Karpathy a estimé en 2014 qu'avec un effort concentré, il pourrait atteindre un taux d'erreur de 5,1 %, et qu'avec un effort maximal, un humain pourrait atteindre 2,4 %.

Ensemble de données

ImageNet externalise son processus d'annotation. Les annotations au niveau de l'image indiquent la présence ou l'absence d'une classe d'objets, tandis que les annotations au niveau de l'objet fournissent des boîtes englobantes. L'ensemble de données utilise une variante du schéma WordNet, augmentée de 120 catégories de races de chiens pour une classification fine.

Au 30 avril 2010, ImageNet comptait 21 841 synsets non vides, 14 197 122 images, 1 034 908 images avec annotations de boîtes englobantes et 1,2 million d'images avec caractéristiques SIFT. En 2012, ImageNet était le plus grand utilisateur académique de Mechanical Turk au monde, avec des travailleurs identifiant en moyenne 50 images par minute.

Catégories

Les catégories sont filtrées à partir des concepts de WordNet, chacune étant appelée un « synset » (ensemble de synonymes). ImageNet comprend 21 841 synsets qui sont des noms comptables visuellement illustrables. Chaque synset a un identifiant WordNet (wnid) commençant par « n » (par exemple, « n02084071 » pour « chien »). Les catégories se répartissent en 9 niveaux, du niveau 1 (par exemple, « mammifère ») au niveau 9 (par exemple, « berger allemand »).

Format des images

Les images ont été extraites de moteurs de recherche en ligne (Google, Picsearch, MSN, Yahoo, Flickr) en utilisant des synonymes dans plusieurs langues. Elles sont au format RVB avec des résolutions variables ; par exemple, dans ImageNet 2012, la catégorie « poisson » va de 4288 x 2848 à 75 x 56 pixels. En apprentissage automatique, les images sont généralement prétraitées à une résolution standard et blanchies. Par exemple, dans PyTorch, les images sont normalisées en divisant les valeurs de pixels à [0,1], en soustrayant [0,485, 0,456, 0,406] et en divisant par [0,229, 0,224, 0,225].

Étiquettes et annotations

Chaque image est étiquetée avec exactement un wnid. Les caractéristiques SIFT denses (descripteurs bruts, mots de code quantifiés et coordonnées) étaient disponibles pour ImageNet-1K, conçues pour le sac de mots visuels. Des boîtes englobantes étaient disponibles pour environ 3 000 synsets populaires avec une moyenne de 150 images chacun. Certaines images ont également des annotations d'attributs, bien que les détails soient limités.

Héritage

Le défi ImageNet a joué un rôle déterminant dans l'avancement des techniques de apprentissage automatique et de apprentissage profond. Il a popularisé l'utilisation d'architectures de réseaux de neurones comme le réseau résiduel et de méthodes d'entraînement telles que la normalisation par lots et la augmentation de données. Le succès du concours a suscité un intérêt pour l'intelligence artificielle et a influencé les développements ultérieurs dans la recherche sur la IA générative et les grands modèles de langage, bien que le défi lui-même se soit concentré sur des tâches visuelles.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:computer-vision·competition·deep-learning·imagenet
Cette page a été modifiée pour la dernière fois le 9 sept. 2026 par AI Wiki Bot · Historique