COCO 2023 est l'édition 2023 du défi Common Objects in Context (COCO), une compétition annuelle qui évalue les méthodes de pointe en détection d'objets, segmentation d'instances et génération de légendes d'images. Organisé par un consortium de chercheurs académiques et industriels, le défi utilise le jeu de données COCO, qui contient plus de 200 000 images annotées couvrant 80 catégories d'objets. L'édition 2023 a introduit des protocoles d'évaluation mis à jour et a encouragé la participation d'équipes du monde entier, reflétant les avancées continues en apprentissage automatique et apprentissage profond.
Le défi COCO est une référence en vision par ordinateur depuis sa création en 2015. L'édition 2023 a poursuivi cette tradition, avec des participants en compétition sur plusieurs pistes, notamment la détection, la segmentation et l'estimation de points clés. Le défi est connu pour ses métriques d'évaluation rigoureuses, telles que la précision moyenne (mAP) à différents seuils d'Intersection sur Union (IoU), et son accent sur le contexte réel, avec des images représentant des scènes complexes avec plusieurs objets.
Pistes et Tâches du Défi
COCO 2023 a proposé plusieurs pistes, chacune axée sur une tâche spécifique. La piste principale était la détection d'objets, où les modèles doivent localiser et classer les objets dans une image. La segmentation d'instances exigeait des masques au niveau du pixel pour chaque objet, tandis que la segmentation panoptique unifiait la segmentation sémantique et d'instances. De plus, une piste de détection de points clés se concentrait sur l'estimation de la pose humaine, et une piste de légendage évaluait la génération de descriptions en langage naturel pour les images. Chaque piste avait son propre classement, avec des gagnants annoncés lors de l'atelier associé organisé en conjonction avec une grande conférence en vision par ordinateur.
Jeu de Données et Annotations
Le jeu de données COCO, publié pour la première fois en 2014, a fait l'objet de mises à jour périodiques. Pour 2023, les organisateurs ont fourni une répartition fixe d'entraînement et de validation, avec des images de test retenues pour l'évaluation. Les annotations comprenaient des boîtes englobantes, des masques de segmentation et des légendes, toutes organisées par des annotateurs humains. La diversité du jeu de données, avec des images issues de scènes quotidiennes, en fait un benchmark exigeant. En 2023, le jeu de données contenait plus de 330 000 images, avec plus de 2,5 millions d'instances annotées. Le défi comprenait également un ensemble « test-dev » à des fins de développement, tandis que les résultats finaux étaient calculés sur un ensemble de test caché.
Métriques d'Évaluation
L'évaluation dans COCO 2023 utilisait les métriques COCO standard : la précision moyenne (AP) moyennée sur des seuils IoU de 0,5 à 0,95 avec un pas de 0,05, ainsi que l'AP à IoU=0,50 et IoU=0,75. Pour la segmentation, l'AP était calculée sur la base de l'IoU des masques. Pour la détection de points clés, la similarité de points clés d'objets (OKS) était utilisée. Le légendage était évalué avec des métriques comme CIDEr, BLEU et METEOR. Ces métriques fournissent une évaluation complète des performances des modèles, encourageant des méthodes qui équilibrent précision et rappel à travers les échelles et catégories d'objets.
Participants Notables et Résultats
Bien que les équipes gagnantes spécifiques de COCO 2023 ne soient pas documentées dans les sources publiques, le défi attire généralement des inscriptions de grandes institutions de recherche et d'entreprises, notamment Google DeepMind, OpenAI et diverses universités. Les années précédentes, les meilleurs performers utilisaient souvent des architectures réseaux résiduels, des mécanismes attention multi-têtes et des techniques d'entraînement avancées comme augmentation de données et élagage de modèles. L'édition 2023 a probablement vu des améliorations continues de la précision, portées par des innovations dans les détecteurs basés sur transformers et IA générative pour le légendage. Cependant, sans enregistrements officiels, les gagnants spécifiques restent non confirmés.
Impact et Héritage
Le défi COCO a considérablement influencé la recherche en vision par ordinateur, établissant des références qui stimulent le progrès dans la reconnaissance d'objets et la compréhension de scènes. COCO 2023, comme ses prédécesseurs, a fourni une plateforme commune pour comparer les méthodes, favoriser la collaboration et mettre en évidence des tendances émergentes telles que l'intégration de grands modèles de langage pour les tâches vision-langage. L'accent mis sur la complexité du monde réel a conduit à des modèles plus robustes applicables dans des domaines comme la conduite autonome, la robotique et la recherche d'images. Alors que le domaine évolue, COCO continue de s'adapter, avec des éditions futures intégrant probablement de nouvelles tâches et des jeux de données plus vastes.