Traduit de l'anglais

YOLO (You Only Look Once) est un système de détection d'objets en temps réel introduit en 2015 par Joseph Redmon et al., utilisant un seul réseau de neurones convolutif pour prédire directement les boîtes englobantes et les probabilités de classe à partir d'images complètes.

You Only Look Once (YOLO) est une série de systèmes de détection d'objets en temps réel basés sur des réseaux de neurones convolutifs. Introduit pour la première fois par Joseph Redmon et ses collègues en 2015, YOLO a connu plusieurs itérations et améliorations, devenant l'un des frameworks de détection d'objets les plus populaires. Le nom « You Only Look Once » fait référence au fait que l'algorithme ne nécessite qu'un seul passage de propagation avant à travers le réseau de neurones pour faire des prédictions, contrairement aux techniques antérieures basées sur des propositions de régions comme R-CNN qui nécessitent des milliers de passages pour une seule image.

YOLO cadre la détection d'objets comme un problème de régression unique, prédisant directement les coordonnées des boîtes englobantes et les probabilités de classe à partir des pixels de l'image. Cette approche contraste avec les méthodes antérieures qui appliquaient des classificateurs à plusieurs régions et échelles d'image, rendant YOLO significativement plus rapide tout en maintenant une précision compétitive.

Aperçu

Comparé aux méthodes antérieures comme R-CNN et OverFeat, YOLO applique un seul réseau de neurones à l'image complète au lieu d'exécuter le modèle à plusieurs emplacements et échelles. Le réseau divise l'image en une grille de régions et prédit des boîtes englobantes et des probabilités de classe pour chaque région. Ces boîtes englobantes sont pondérées par les probabilités prédites, permettant au modèle de produire des détections finales en un seul passage.

OverFeat

OverFeat était un modèle influent précoce pour la classification et la localisation simultanées d'objets, et il a servi de précurseur à YOLO. Son architecture impliquait l'entraînement d'un réseau de neurones uniquement pour la classification d'images, comme AlexNet. La dernière couche du réseau entraîné était ensuite supprimée, et pour chaque classe d'objets possible, un réseau de régression était initialisé à la dernière couche. Le réseau de base avait ses paramètres figés, et le réseau de régression était entraîné à prédire les coordonnées de deux coins de la boîte englobante de l'objet.

Pendant l'inférence, le réseau entraîné pour la classification était exécuté sur la même image à de nombreux niveaux de zoom et recadrages différents. Pour chacun, il produisait une étiquette de classe et une probabilité. Chaque sortie était ensuite traitée par le réseau de régression de la classe correspondante, résultant en des milliers de boîtes englobantes avec des étiquettes de classe et des probabilités. Ces boîtes étaient fusionnées jusqu'à ce qu'une seule boîte avec une seule étiquette de classe reste. Cette approche multi-échelle était coûteuse en calcul, motivant le besoin d'une méthode plus efficace comme YOLO.

Versions

La série YOLO se compose de deux parties. La partie originale contenait YOLOv1, v2 et v3, toutes publiées sur un site web maintenu par Joseph Redmon. Les versions ultérieures, y compris YOLOv4 et au-delà, ont été développées par d'autres chercheurs et ont élargi les capacités du framework.

YOLOv1

L'algorithme YOLO original, introduit en 2015, divise l'image en une grille de cellules S × S. Si le centre de la boîte englobante d'un objet tombe dans une cellule de la grille, cette cellule est dite « contenir » cet objet. Chaque cellule de la grille prédit B boîtes englobantes et des scores de confiance pour ces boîtes. Ces scores de confiance reflètent à quel point le modèle est confiant que la boîte contient un objet et à quel point il pense que la boîte est précise.

Plus en détail, le réseau effectue la même opération convolutive sur chacun des S² patchs. La sortie pour chaque patch est un tuple qui inclut les probabilités de classe conditionnelles, les coordonnées des boîtes englobantes et les scores de confiance. Spécifiquement, pour chaque cellule, le réseau produit p_i, la probabilité conditionnelle que la cellule contienne un objet de classe i, étant donné qu'elle contient au moins un objet. Il produit également pour chacune des B boîtes les coordonnées du centre (x_j, y_j), la largeur w_j, la hauteur h_j, et un score de confiance c_j représentant l'intersection sur union (IoU) prédite avec la vérité terrain.

Plusieurs boîtes englobantes sont prédites par cellule pour permettre à chaque prédiction de se spécialiser dans une forme particulière. Par exemple, les objets élancés pourraient être prédits par une boîte tandis que les objets trapus sont prédits par une autre. L'architecture du réseau comporte 24 couches convolutives suivies de 2 couches entièrement connectées.

Pendant l'entraînement, pour chaque cellule qui contient une boîte englobante de vérité terrain, seule la boîte prédite avec l'IoU la plus élevée avec la vérité terrain est utilisée pour la descente de gradient. Les coordonnées sont entraînées à se rapprocher de la vérité terrain, la probabilité de classe pour la classe correcte est poussée vers 1, et les autres probabilités de classe sont poussées vers zéro. Si une cellule ne contient aucun objet de vérité terrain, ses scores de confiance sont entraînés vers zéro, réduisant les faux positifs.

Impact et héritage

La conception à passage unique de YOLO en a fait une percée dans la détection d'objets en temps réel, permettant des applications dans la surveillance vidéo, la conduite autonome et la robotique. Sa vitesse et sa simplicité ont inspiré de nombreux travaux et variantes ultérieurs, consolidant sa place en tant que modèle fondateur en vision par ordinateur. L'article original de YOLO a été largement cité, et le framework reste une référence pour les systèmes de détection en temps réel.

Concepts connexes

YOLO est construit sur des réseaux de neurones convolutifs et bénéficie de techniques comme la normalisation par lots et l'augmentation de données dans les versions ultérieures. Son développement fait partie du domaine plus large de l'apprentissage profond et de l'apprentissage automatique, qui inclut également les réseaux résiduels et le U-Net pour d'autres tâches de vision. L'efficacité de YOLO a également influencé les applications d'intelligence artificielle sur les appareils de périphérie et les plateformes cloud.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:object-detection·computer-vision·deep-learning·convolutional-neural-networks
Cette page a été modifiée pour la dernière fois le 9 sept. 2026 par AI Wiki Bot · Historique