COCO 2018 fait référence à l'édition 2018 du défi Common Objects in Context (COCO), une compétition annuelle organisée par un consortium de chercheurs académiques et industriels pour évaluer les méthodes de pointe en vision par ordinateur. Le défi s'appuie sur l'ensemble de données COCO, qui contient plus de 200 000 images annotées couvrant 80 catégories d'objets, et est largement utilisé pour évaluer les modèles de détection d'objets, de segmentation d'instances et de génération de légendes d'images. L'édition 2018 a poursuivi la tradition des années précédentes, attirant des soumissions de groupes de recherche du monde entier et servant de référence clé pour les progrès dans le domaine.
La série de défis COCO a débuté en 2014 et a été organisée chaque année, chaque édition introduisant des raffinements dans les tâches et les métriques d'évaluation. COCO 2018 a maintenu les tâches principales de détection et de segmentation d'objets dans des scènes complexes, tout en incluant une tâche de génération de légendes où les modèles produisent des descriptions en langage naturel des images. La compétition est étroitement liée au domaine plus large du apprentissage automatique, en particulier aux approches de apprentissage profond qui reposent sur des réseaux de neurones. Les solutions gagnantes en 2018 utilisaient généralement des réseaux de neurones convolutifs avec des architectures avancées telles que les réseaux résiduels et les réseaux de pyramide de caractéristiques, souvent améliorés par des techniques comme la normalisation par lots et la augmentation de données.
Tâches et évaluation
COCO 2018 comportait trois tâches principales : la détection d'objets, la segmentation d'instances et la génération de légendes d'images. Pour la détection, les modèles devaient localiser les objets avec des boîtes englobantes et les classer dans l'une des 80 catégories. La segmentation d'instances exigeait des masques au niveau du pixel pour chaque objet, une tâche plus difficile qui teste la compréhension spatiale fine. La génération de légendes impliquait de produire une phrase décrivant le contenu de l'image, évaluée avec des métriques comme CIDEr et BLEU.
L'évaluation pour la détection et la segmentation utilisait les métriques COCO standard, y compris la précision moyenne (AP) à différents seuils d'intersection sur union (IoU), avec la métrique principale étant l'AP à IoU 0,50:0,95. Le défi fournissait un ensemble de validation pour le réglage des modèles et un ensemble de test pour le classement final, avec des résultats soumis à un serveur d'évaluation. Ce protocole rigoureux garantissait une comparaison équitable entre les soumissions, une pratique qui a influencé d'autres références en intelligence artificielle.
Résultats notables et tendances
Lors de COCO 2018, les modèles de détection les plus performants ont atteint une AP d'environ 0,50 sur l'ensemble test-dev, une amélioration significative par rapport aux années précédentes. Pour la segmentation d'instances, les meilleurs modèles ont atteint des valeurs d'AP proches de 0,42. Ces résultats ont été motivés par des innovations dans la conception des réseaux, telles que l'utilisation de convolutions déformables et d'entraînement multi-échelles, ainsi que par l'adoption de programmes de taux d'apprentissage et de limitation de gradient pour un entraînement stable.
La compétition a mis en évidence le rôle croissant des transformeurs dans les tâches de vision, bien que leur domination soit venue plus tard. En 2018, la plupart des soumissions étaient basées sur des architectures convolutives, souvent combinées avec des modèles séquence à séquence pour la génération de légendes. L'écart entre les performances humaines et celles des machines sur COCO restait substantiel, en particulier pour les petits objets et les scènes encombrées, motivant des recherches supplémentaires dans des domaines comme les mécanismes d'attention et l'élagage de modèles.
Impact et héritage
Le défi COCO 2018 a contribué à l'avancement rapide de la vision par ordinateur en fournissant une référence commune pour comparer les méthodes. Son ensemble de données et ses outils d'évaluation sont devenus des ressources standard dans le domaine, utilisés non seulement dans les compétitions, mais aussi pour l'entraînement et la validation de modèles dans des contextes académiques et industriels. De nombreuses techniques affinées lors du défi, comme les réseaux de pyramide de caractéristiques et les têtes de segmentation basées sur des masques, ont ensuite été intégrées dans des systèmes de production pour des applications telles que la conduite autonome et l'imagerie médicale.
Le défi a également favorisé la collaboration entre le monde académique et l'industrie, avec des équipes d'universités et d'entreprises comme Google Cloud et Amazon Web Services participant. Les résultats ont informé le développement de modèles et d'ensembles de données à plus grande échelle, ouvrant la voie aux éditions suivantes et à l'essor ultérieur de l'IA générative en vision. En 2025, COCO reste une référence largement citée, et l'édition 2018 est considérée comme un tournant où les méthodes d'apprentissage profond ont solidifié leur domination dans la reconnaissance d'objets.
Orientations futures
Après COCO 2018, la communauté s'est tournée vers des références plus exigeantes, comme LVIS et Open Images, qui incluent plus de catégories et des distributions à longue traîne. Les leçons de COCO 2018, en particulier l'importance d'une évaluation robuste et de données d'entraînement diversifiées, continuent de façonner la recherche en vision par ordinateur et en apprentissage profond. Le défi a également inspiré des efforts similaires dans d'autres domaines, notamment la compréhension vidéo et l'analyse de scènes 3D, étendant les principes de l'ensemble de données COCO à de nouveaux contextes de problèmes.