COCO 2020 désigne l'édition 2020 du défi Common Objects in Context (COCO), une série de benchmarks et de compétitions de longue durée en vision par ordinateur. Organisé par un consortium de chercheurs académiques et industriels, le défi évalue les algorithmes sur des tâches telles que la détection d'objets, la segmentation d'instances et la génération de légendes d'images. L'édition 2020 s'est tenue en conjonction avec la Conférence sur la vision par ordinateur et la reconnaissance de formes (CVPR) en juin 2020, mais en raison de la pandémie de COVID-19, l'événement physique a été remplacé par un format virtuel. Le défi a attiré la participation de groupes de recherche de premier plan et d'entreprises technologiques, avec des résultats annoncés en ligne.
Le jeu de données COCO lui-même, publié pour la première fois en 2014, contient plus de 200 000 images annotées couvrant 80 catégories d'objets, avec plus de 1,5 million d'instances d'objets. Le défi 2020 a utilisé la version 2017 du jeu de données, qui divise les images en ensembles d'entraînement (118 000), de validation (5 000) et de test (20 000). Les principales métriques d'évaluation pour la détection et la segmentation sont la précision moyenne (AP) à différents seuils d'intersection sur union (IoU), avec comme métrique principale l'AP à IoU 0,50:0,95. Pour la génération de légendes, les métriques incluent BLEU, METEOR, ROUGE, CIDEr et SPICE.
Tâches du défi et gagnants
Le défi 2020 comprenait plusieurs pistes : détection, segmentation d'instances, détection de points clés et génération de légendes d'images. Dans la tâche de détection, l'équipe gagnante a atteint une AP de 0,617 sur l'ensemble test-dev, une amélioration significative par rapport aux 0,493 du gagnant de 2019. Les meilleures solutions ont employé des architectures avancées de apprentissage profond, y compris des variantes de réseaux résiduels et de réseaux neuronaux avec des techniques de normalisation par lots et de abandon. Le gagnant de la segmentation d'instances a atteint une AP de 0,582, tandis que le gagnant de la détection de points clés a obtenu une AP de 0,764. Pour la génération de légendes, le meilleur modèle a obtenu un CIDEr de 1,302, en utilisant des architectures transformers basées sur séquence à séquence avec attention multi-têtes et encodage positionnel.
Innovations techniques
Les participants à COCO 2020 ont repoussé l'état de l'art dans plusieurs directions. De nombreuses entrées de premier plan ont employé des stratégies de augmentation de données, y compris le recadrage aléatoire, la mise à l'échelle et la variation de couleur, pour améliorer la généralisation. Les techniques de planification du taux d'apprentissage, telles que l'annealing cosinus et l'échauffement, ont été largement adoptées. Certaines équipes ont utilisé le élagage de modèles pour réduire le coût computationnel tout en maintenant la précision. L'utilisation de variantes de SGD comme Adam et optimiseur Adam était courante, souvent combinée avec le écrêtage de gradient pour stabiliser l'entraînement. La normalisation de couche et la normalisation par lots ont toutes deux été appliquées dans différentes parties des réseaux. La compétition a également vu une utilisation accrue des mécanismes de attention croisée dans les têtes de détection, s'appuyant sur les innovations transformers issues de la recherche en traitement du langage naturel.
Impact et héritage
Les résultats de COCO 2020 ont influencé les recherches ultérieures en vision par ordinateur. Les architectures gagnantes et les recettes d'entraînement ont été adoptées dans de nombreux projets ultérieurs, y compris ceux en intelligence artificielle pour la conduite autonome, la robotique et l'imagerie médicale. Le défi a souligné l'importance de l'apprentissage automatique à grande échelle et le rôle de la conception de réseaux neuronaux dans l'obtention d'une haute précision. Le benchmark COCO reste un outil d'évaluation standard, et l'édition 2020 a établi une nouvelle référence pour les compétitions futures. L'événement a également favorisé la collaboration entre des institutions académiques comme MIT CSAIL, Stanford AI Lab et Berkeley AI Research, ainsi que des laboratoires industriels tels que Google DeepMind et OpenAI, bien que les affiliations exactes des équipes gagnantes aient varié.
Comparaison avec d'autres benchmarks
Alors que COCO 2020 se concentrait sur la compréhension au niveau des objets, d'autres benchmarks comme ImageNet ciblent la classification d'images. L'accent mis par COCO sur la segmentation d'instances et la génération de légendes le rendait plus difficile et plus proche de la compréhension de scènes réelles. L'édition 2020 a vu un écart notable entre les meilleures performances et la moyenne, indiquant une marge d'amélioration. Contrairement aux benchmarks de jeu d'échecs, qui sont déterministes, les tâches COCO nécessitent de gérer la variabilité visuelle et l'ambiguïté. La compétition différait également des évaluations de grands modèles de langage, car elle se centrait sur la perception visuelle plutôt que sur la génération de texte. Malgré ces différences, des techniques de COCO 2020, telles que le échantillonnage top-k dans la génération de légendes, ont trouvé des parallèles dans les modèles de IA générative.
Directions futures
Après COCO 2020, la communauté s'est orientée vers des benchmarks plus complets, tels que LVIS et Open Images, qui incluent plus de catégories et des distributions à longue traîne. L'accent mis par le défi 2020 sur l'efficacité a également stimulé la recherche sur des modèles légers déployables sur des appareils de périphérie comme ceux de ARM Holdings et Qualcomm. L'utilisation de détecteurs basés sur transformers, popularisée en 2020, est devenue courante dans les années suivantes. Le jeu de données et les résultats de COCO 2020 continuent d'être utilisés pour le pré-entraînement et l'évaluation dans de nombreux cadres de apprentissage profond. En 2025, COCO reste un point de référence, bien que de nouveaux jeux de données avec une résolution plus élevée et des données vidéo émergent.