Le défi de reconnaissance visuelle à grande échelle ImageNet (ILSVRC) 2010 a été la première édition d'un concours logiciel annuel organisé par le projet ImageNet, une grande base de données visuelles conçue pour la recherche en reconnaissance d'objets visuels. Le défi exigeait que les programmes participants classifient et détectent correctement les objets et les scènes dans une liste réduite de mille classes non chevauchantes, une augmentation significative par rapport aux références précédentes comme le concours PASCAL Visual Object Classes (VOC), qui n'utilisait que 20 classes et 19 737 images en 2010. Le défi de 2010 a marqué un tournant dans la vision par ordinateur en fournissant une plateforme d'évaluation standardisée et à grande échelle qui catalyserait plus tard la révolution de l'apprentissage profond.
Origines et développement
Le projet ImageNet a été conçu par la chercheuse en IA Fei-Fei Li en 2006, à une époque où la plupart des recherches en IA se concentraient sur les modèles et les algorithmes plutôt que sur les données. Li visait à étendre et améliorer les données disponibles pour l'entraînement des algorithmes d'IA. En 2007, elle a rencontré la professeure de Princeton Christiane Fellbaum, une créatrice de WordNet, ce qui a conduit à la construction d'ImageNet à partir des environ 22 000 noms de WordNet. Li a également été inspirée par une estimation de 1987 selon laquelle la personne moyenne reconnaît environ 30 000 types d'objets différents.
En tant que professeure adjointe à Princeton, Li a assemblé une équipe de chercheurs et a utilisé Amazon Mechanical Turk pour la classification des images. L'étiquetage a commencé en juillet 2008 et s'est terminé en avril 2010, impliquant 49 000 travailleurs de 167 pays qui ont filtré et étiqueté plus de 160 millions d'images candidates. Le plan initial prévoyait 10 000 images par catégorie sur 40 000 catégories, totalisant 400 millions d'images, mais cela a été réduit en raison de contraintes pratiques. La base de données a été présentée pour la première fois sous forme de poster à la Conférence sur la vision par ordinateur et la reconnaissance de formes (CVPR) de 2009 en Floride, intitulé « ImageNet : A Preview of a Large-scale Hierarchical Dataset ».
En 2009, Alex Berg a suggéré d'ajouter la localisation d'objets comme tâche, et Li a approché le concours PASCAL VOC pour une collaboration. Cela a abouti au lancement de l'ILSVRC en 2010, avec 1 000 classes et la localisation d'objets, une expansion substantielle par rapport aux 20 classes de PASCAL VOC.
Composition du jeu de données
ImageNet externalise son processus d'annotation. Les annotations au niveau de l'image indiquent la présence ou l'absence d'une classe d'objets, tandis que les annotations au niveau de l'objet fournissent des boîtes englobantes autour des parties visibles des objets. Le jeu de données utilise une variante du schéma WordNet, augmentée de 120 catégories de races de chiens pour une classification fine. Au 30 avril 2010, le jeu de données contenait 21 841 synsets non vides (ensembles de synonymes), 14 197 122 images, 1 034 908 images avec annotations de boîtes englobantes et 1,2 million d'images avec caractéristiques SIFT.
Les catégories ont été filtrées à partir des concepts WordNet, appelés synsets. Chaque synset a un identifiant WordNet (wnid) commençant par « n » car ImageNet n'inclut que des noms. Les catégories se répartissent en 9 niveaux, du niveau 1 (par exemple, « mammifère ») au niveau 9 (par exemple, « berger allemand »). Les images ont été extraites de moteurs de recherche en ligne comme Google, Picsearch, MSN, Yahoo et Flickr en utilisant des synonymes dans plusieurs langues. Les images sont au format RGB avec des résolutions variables ; par exemple, dans la catégorie « poisson » de 2012, les résolutions vont de 4288 x 2848 à 75 x 56. En apprentissage automatique, elles sont généralement prétraitées à une résolution standard et blanchies avant d'être traitées par des réseaux de neurones.
Importance pour l'apprentissage profond
L'ILSVRC 2010 a préparé le terrain pour une percée majeure en 2012. Le 30 septembre 2012, un réseau de neurones convolutif (CNN) appelé AlexNet a atteint une erreur top-5 de 15,3 % dans le défi ImageNet 2012, soit plus de 10,8 points de pourcentage de moins que le deuxième. Ce succès a été rendu possible par l'utilisation de processeurs graphiques (GPU) lors de l'entraînement, un ingrédient essentiel de la révolution de l'apprentissage profond. Selon The Economist, « Soudainement, les gens ont commencé à prêter attention, non seulement au sein de la communauté de l'IA, mais aussi dans toute l'industrie technologique ».
En 2015, AlexNet a été surpassé par le CNN très profond de Microsoft avec plus de 100 couches, qui a remporté le concours ImageNet 2015 avec un taux d'erreur de 3,57 %. Andrej Karpathy a estimé en 2014 qu'avec un effort concentré, il pourrait atteindre un taux d'erreur de 5,1 %, et environ 10 personnes de son laboratoire ont atteint environ 12-13 % avec moins d'effort. Il a été estimé qu'avec un effort maximal, un humain pourrait atteindre un taux d'erreur de 2,4 %.
Héritage
Bien que l'ILSVRC 2010 lui-même n'ait pas présenté de gagnants en apprentissage profond, il a établi la référence qui stimulerait des progrès rapides en vision par ordinateur. L'évaluation standardisée et à grande échelle du défi est devenue un catalyseur pour le développement des réseaux de neurones et des techniques d'apprentissage profond, influençant les recherches ultérieures en intelligence artificielle et dans des domaines connexes. Le jeu de données et le défi restent influents, l'édition de 2010 servant de fondation aux compétitions ultérieures qui ont mis en évidence la puissance des approches de apprentissage automatique.