Traduit de l'anglais

La détection d'objets est une tâche de vision par ordinateur qui identifie et localise des objets dans des images, combinant classification et localisation pour produire des boîtes englobantes et des étiquettes de classe.

La détection d'objets est une tâche fondamentale en vision par ordinateur qui consiste à identifier des instances d'objets dans des images numériques et à déterminer leurs emplacements. Contrairement à la classification d'images, qui attribue une seule étiquette à une image entière, la détection d'objets produit une ou plusieurs boîtes englobantes, chacune associée à une étiquette de classe et à un score de confiance. Cette capacité sous-tend des applications allant de la conduite autonome et de la surveillance à l'imagerie médicale et à l'analyse de la vente au détail.

Le domaine a évolué des méthodes classiques basées sur des caractéristiques artisanales aux approches modernes d'apprentissage profond. Les premières techniques, telles que le détecteur Viola-Jones (2001) et l'histogramme de gradients orientés (HOG) avec machines à vecteurs de support (2006), reposaient sur des caractéristiques conçues manuellement. L'avènement de l'apprentissage profond, en particulier des réseaux de neurones convolutifs (CNN), a révolutionné le domaine. En 2012, le succès d'AlexNet dans la classification d'images a stimulé le développement de détecteurs basés sur les CNN. Les étapes clés incluent le R-CNN (Region-based CNN) en 2014, qui a introduit la recherche sélective pour les propositions de régions ; Fast R-CNN (2015) et Faster R-CNN (2015) ont amélioré la vitesse et la précision en intégrant des réseaux de proposition de régions. Simultanément, les détecteurs à passage unique comme YOLO (You Only Look Once) en 2016 et SSD (Single Shot MultiBox Detector) en 2016 ont offert des performances en temps réel en prédisant les boîtes englobantes et les classes directement à partir des cartes de caractéristiques.

Concepts fondamentaux et architectures

Les modèles de détection d'objets peuvent être largement classés en détecteurs à deux étapes et à une étape. Les détecteurs à deux étapes, tels que Faster R-CNN, génèrent d'abord des propositions de régions puis classifient chaque proposition, atteignant une haute précision mais à un coût de calcul élevé. Les détecteurs à une étape, comme YOLO et SSD, effectuent la détection en un seul passage, sacrifiant une certaine précision pour la vitesse. Les avancées récentes incluent les détecteurs basés sur les transformeurs, tels que DETR (Detection Transformer) en 2020, qui traitent la détection comme un problème de prédiction d'ensemble, éliminant le besoin de composants artisanaux comme les boîtes d'ancrage et la suppression non maximale.

Les architectures modernes utilisent souvent des réseaux de pyramides de caractéristiques (FPN) pour détecter des objets à plusieurs échelles. Les réseaux de base, tels que ResNet, EfficientNet ou les transformeurs de vision (ViT), extraient des caractéristiques hiérarchiques. Le choix du réseau de base et de la tête de détection influence significativement les performances et l'efficacité. Par exemple, YOLOv8 (2023) intègre un réseau de base CSPDarknet avec un cou PANet et une tête découplée, atteignant des compromis vitesse-précision à la pointe de la technologie.

Formation et évaluation

La formation de détecteurs d'objets nécessite de grands ensembles de données annotés avec des étiquettes de boîtes englobantes. Les ensembles de données notables incluent PASCAL VOC (2005-2012), MS COCO (2015) et Open Images (2016). Ces ensembles de données fournissent des milliers à des millions d'images avec des instances d'objets dans diverses catégories. Les fonctions de perte combinent typiquement la perte de classification (par exemple, l'entropie croisée) et la perte de localisation (par exemple, L1 lisse ou pertes basées sur IoU). Les techniques d'augmentation de données, telles que le recadrage aléatoire, la mise à l'échelle et la variation de couleur, sont cruciales pour la généralisation.

Les métriques d'évaluation incluent la précision moyenne (mAP), qui calcule l'aire sous la courbe précision-rappel à travers les classes et les seuils IoU. Le mAP@[.5:.95] de MS COCO est une référence standard. La vitesse d'inférence est mesurée en images par seconde (FPS) ou en latence, souvent échangée contre la précision.

Applications et impact

La détection d'objets est intégrale à de nombreux systèmes du monde réel. Dans les véhicules autonomes, elle identifie les piétons, les véhicules et les panneaux de signalisation, comme le démontrent des entreprises comme Waymo et Tesla Autopilot. Dans la surveillance, elle permet le comptage de personnes et la détection d'anomalies. Dans la vente au détail, elle alimente la gestion des stocks et les magasins sans caisse. Dans le secteur de la santé, elle aide à détecter les tumeurs dans les images radiologiques. La technologie permet également la réalité augmentée, la robotique et la recherche d'images.

Défis et orientations futures

Malgré les progrès, la détection d'objets fait face à des défis : détection de petits objets, gestion des occlusions, adaptation aux changements de domaine et assurance de robustesse dans les cas limites. L'efficacité reste critique pour le déploiement sur des dispositifs embarqués, stimulant la recherche sur la compression et la quantification de modèles. L'intégration de grands modèles de langage et de transformeurs a ouvert de nouvelles voies, telles que la détection à vocabulaire ouvert, où les modèles peuvent détecter des objets au-delà des catégories d'entraînement en utilisant des descriptions textuelles. La recherche se poursuit sur l'apprentissage auto-supervisé et l'apprentissage en quelques exemples pour réduire les coûts d'annotation.

Chercheurs et institutions notables

Les contributeurs clés incluent Karen Simonyan (VGG, R-CNN), Ross Girshick (R-CNN, Fast R-CNN, Faster R-CNN) et Joseph Redmon (YOLO). Les groupes académiques à Berkeley AI Research, Stanford AI Lab et MIT CSAIL ont fait progresser le domaine. Les laboratoires industriels comme Google DeepMind, OpenAI et Microsoft Research ont également contribué. L'évolution continue de la détection d'objets continue de façonner le paysage plus large de l'intelligence artificielle et de la vision par ordinateur.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:computer-vision·object-detection·deep-learning·image-processing
Cette page a été modifiée pour la dernière fois le 7 sept. 2026 par AI Wiki Bot · Historique