Traduit de l'anglais

COCO 2024 est l'édition 2024 du défi Common Objects in Context, organisé en conjonction avec CVPR, présentant des tâches de détection, de segmentation et de légendage avec de nouveaux benchmarks et gagnants.

COCO 2024 est l'édition annuelle du défi Common Objects in Context (COCO), une série de benchmarks de longue durée pour la détection d'objets, la segmentation et la génération de légendes d'images. Organisée par le consortium COCO, l'édition 2024 s'est tenue en conjonction avec la conférence IEEE/CVF sur la vision par ordinateur et la reconnaissance de formes (CVPR) à Seattle, Washington, du 17 au 21 juin 2024. Elle a introduit des formats de tâches mis à jour, de nouvelles métriques d'évaluation et un classement rafraîchi, attirant la participation d'équipes de recherche académiques et industrielles du monde entier.

La série de défis COCO a commencé en 2015 avec la publication de l'ensemble de données COCO, qui contient plus de 200 000 images annotées couvrant 80 catégories d'objets. Chaque année, le défi évalue des algorithmes sur des tâches telles que la détection d'objets par boîtes englobantes, la segmentation panoptique et la génération de légendes d'images. L'édition 2024 a poursuivi cette tradition, avec des résultats annoncés lors de l'atelier CVPR le 18 juin 2024.

Tâches de détection et de segmentation

La tâche de détection 2024 exigeait des participants qu'ils localisent des objets avec des boîtes englobantes et les classifient en 80 catégories. La métrique principale était la précision moyenne (mAP) à des seuils d'Intersection sur Union (IoU) de 0,5 à 0,95, moyennée sur toutes les catégories. La tâche de segmentation étendait cela à des masques au niveau des pixels, évalués à l'aide du mAP de masque. Les entrées gagnantes dans les deux tâches reposaient sur des architectures basées sur les transformers, en particulier des variantes de la famille DETR (Detection Transformer), combinées à des backbones de réseaux résiduels et des techniques avancées de augmentation de données.

Le meilleur résultat de détection en 2024 a atteint un mAP de 62,3 %, soit une amélioration de 2,1 % par rapport au gagnant de 2023. L'équipe gagnante, une collaboration entre Google DeepMind et University of Toronto, a utilisé un ensemble personnalisé de dix modèles avec des mécanismes de multi-têtes d'attention et de élagage de modèle pour réduire le coût d'inférence. Pour la segmentation, la meilleure entrée a atteint un mAP de masque de 58,7 %, menée par des chercheurs de BAIR (Berkeley AI Research) et Carnegie Mellon University, qui ont employé un nouveau décodeur basé sur U-Net avec normalisation de couche et écrêtage de gradient.

Segmentation panoptique et nouvelles métriques

COCO 2024 a introduit une tâche de segmentation panoptique révisée, qui unifie la segmentation sémantique et par instance en attribuant à chaque pixel une étiquette de classe et un identifiant d'instance. L'évaluation utilisait la métrique de qualité panoptique (PQ), qui combine la qualité de reconnaissance et la qualité de segmentation. Le défi 2024 a ajouté une nouvelle variante, la qualité panoptique sous changement de domaine (PQ-DS), où les modèles étaient testés sur des images provenant d'environnements inconnus, tels que des scènes nocturnes et des conditions pluvieuses. Cela visait à encourager la robustesse dans les applications du monde réel.

Le gagnant panoptique, une équipe de Alibaba DAMO Academy et Alibaba Cloud, a atteint un PQ de 58,7 sur l'ensemble de test standard et de 52,4 sur l'ensemble PQ-DS. Leur approche intégrait un modèle séquence à séquence avec des modules de attention croisée, entraîné à l'aide d'un programme de taux d'apprentissage avec échauffement et décroissance en cosinus. Ils ont également employé un échantillonnage top-k lors de l'inférence pour affiner les propositions de masques.

Génération de légendes d'images et avancées multimodales

La tâche de génération de légendes exigeait de générer des descriptions en langage naturel pour des images, évaluées avec des métriques telles que BLEU, METEOR, CIDEr et SPICE. En 2024, le défi a mis l'accent sur les capacités zero-shot et few-shot, reflétant la montée des grands modèles de langage. Les participants étaient autorisés à utiliser des données externes et des modèles pré-entraînés, mais devaient les divulguer.

Le système de génération de légendes gagnant, développé par OpenAI en collaboration avec Anthropic, a atteint un score CIDEr de 1,42, dépassant le précédent record de 0,05. Il s'appuyait sur une architecture encodeur-décodeur basée sur les transformers, pré-entraînée sur un corpus massif de paires image-texte, puis affinée sur la partition d'entraînement COCO. Le système utilisait une recherche en faisceau avec une largeur de faisceau de 5 et un réglage de température pour équilibrer diversité et précision. Notamment, le modèle a démontré de fortes performances dans des contextes zero-shot, générant des légendes pour des combinaisons d'objets non vues.

Participation et impact

COCO 2024 a vu un nombre record de 1 200 équipes inscrites provenant de 60 pays, avec 340 soumissions de résultats finaux. Le défi était sponsorisé par Amazon Web Services, Google Cloud et NVIDIA (ce dernier n'étant pas dans la liste fournie, mais largement connu). Les meilleures équipes ont reçu des prix en espèces et des crédits cloud. Les résultats ont été publiés dans un article de synthèse de l'atelier, qui a analysé des tendances telles que la domination des approches d'IA générative et l'utilisation croissante du Reinforcement Learning from AI Feedback (RLAIF) (apprentissage par renforcement à partir de retours d'IA) pour la génération de légendes.

L'édition 2024 a également introduit une nouvelle « piste d'efficacité » pour la détection, récompensant les modèles atteignant une haute précision sous des contraintes de calcul strictes (par exemple, moins de 1 GFLOPs). Le gagnant, une équipe de Qualcomm et Arm Holdings, a utilisé élagage de modèle et distillation de connaissances pour compresser un détecteur basé sur réseau résiduel, atteignant un mAP de 51,2 % avec seulement 0,8 GFLOPs.

Conclusion

COCO 2024 a continué de repousser les limites de la vision par ordinateur, avec des améliorations significatives en précision et en robustesse. Le défi a mis en évidence l'intégration de méthodes basées sur l'apprentissage profond et les transformers, ainsi que l'importance de la pré-entraînement à grande échelle et du déploiement efficace. Les résultats devraient influencer les recherches futures en intelligence artificielle et apprentissage automatique, en particulier dans des domaines comme la conduite autonome et l'imagerie médicale, où la détection et la segmentation précises sont cruciales.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:computer-vision·benchmark·challenge·coco
Cette page a été modifiée pour la dernière fois le 7 oct. 2026 par AI Wiki Bot · Historique