Traduit de l'anglais

Focal loss est une fonction de perte pour l'entraînement de réseaux de neurones qui traite le déséquilibre extrême des classes en réduisant le poids des exemples faciles et en se concentrant sur les exemples difficiles et mal classés. Elle a été introduite en 2017 pour la détection d'objets.

La perte focale est une fonction de perte utilisée en apprentissage profond pour entraîner des réseaux de neurones sur des tâches présentant un déséquilibre de classes sévère, comme la détection d'objets dans les images. Elle modifie la perte d'entropie croisée standard en ajoutant un facteur de modulation qui réduit la contribution à la perte des exemples bien classés, permettant au modèle de se concentrer sur les exemples difficiles et mal classés. Cette approche a été introduite en 2017 par Tsung-Yi Lin, Priya Goyal, Ross Girshick, Kaiming He et Piotr Dollár dans l'article « Focal Loss for Dense Object Detection ».

Le problème central que la perte focale aborde est le déséquilibre entre les classes de premier plan et d'arrière-plan dans les tâches de prédiction dense. Dans une image typique de détection d'objets, la grande majorité des emplacements candidats sont en arrière-plan, et seuls quelques-uns contiennent des objets. La perte d'entropie croisée standard peut être submergée par les exemples d'arrière-plan faciles et abondants, ce qui rend le modèle biaisé vers la prédiction de l'arrière-plan et néglige les classes d'objets rares.

Formulation mathématique

La perte focale s'appuie sur la perte d'entropie croisée binaire (CE). Pour une classification binaire avec une probabilité prédite p pour la classe réelle, la CE est définie comme CE(p) = -log(p). La perte focale introduit un paramètre de focalisation gamma (γ) et un facteur de pondération alpha (α). La formule est :

FL(p) = -α(1 - p)^γ log(p)

Ici, (1 - p)^γ est le facteur de modulation. Lorsque p est proche de 1 (un exemple facile, bien classé), ce facteur tend vers 0, réduisant drastiquement la perte. Lorsque p est petit (un exemple difficile), le facteur est proche de 1, préservant la perte. Le paramètre γ contrôle le taux auquel les exemples faciles sont pondérés à la baisse ; les valeurs typiques sont 2,0, avec 0 correspondant à l'entropie croisée standard. Le paramètre alpha équilibre l'importance des exemples positifs et négatifs, souvent défini comme l'inverse de la fréquence des classes ou ajusté sur un ensemble de validation.

Application en détection d'objets

La motivation principale de la perte focale était de permettre aux détecteurs d'objets à une étape d'atteindre la précision des détecteurs à deux étapes. Les détecteurs à deux étapes, comme Faster R-CNN, utilisent un réseau de proposition de régions pour filtrer les boîtes candidates, réduisant naturellement le déséquilibre de classes. Les détecteurs à une étape, comme YOLO et SSD, évaluent directement tous les emplacements, faisant face à un déséquilibre beaucoup plus important. La perte focale a permis aux détecteurs à une étape, en particulier RetinaNet, d'atteindre une précision de pointe tout en maintenant la vitesse. RetinaNet, introduit dans le même article, utilisait un réseau de pyramide de caractéristiques et la perte focale, surpassant les détecteurs à une étape précédents et égalant ou dépassant les homologues à deux étapes sur l'ensemble de données COCO.

Extensions et variantes

Depuis son introduction, la perte focale a été adaptée à divers domaines et problèmes. Dans la recherche en apprentissage automatique, des variantes ont été proposées pour la classification multi-classes, la segmentation sémantique et l'imagerie médicale. Par exemple, dans les tâches de prédiction dense avec plusieurs classes, la perte est calculée par classe et sommée. Certains travaux ont exploré des paramètres gamma ou alpha adaptatifs, les apprenant pendant l'entraînement. La perte focale a également été appliquée à des tâches de traitement du langage naturel, comme la classification de textes avec des ensembles de données déséquilibrés, et à des grands modèles de langage pour des tâches comme la reconnaissance d'entités nommées où les entités rares sont sous-représentées.

Relation avec d'autres techniques

La perte focale est conceptuellement liée à l'exploitation minière d'exemples difficiles, où le processus d'entraînement sélectionne explicitement des exemples difficiles. Cependant, la perte focale est une approximation lisse et différentiable qui pondère tous les exemples en continu, évitant le besoin d'heuristiques de sélection explicites. Elle se connecte également à l'apprentissage sensible aux coûts, où les coûts de mauvaise classification sont ajustés par classe. Le paramètre alpha fournit une forme de sensibilité aux coûts, tandis que gamma ajoute une focalisation sur les exemples difficiles. En pratique, la perte focale est souvent combinée avec l'augmentation de données et d'autres techniques de régularisation pour améliorer davantage la généralisation.

Considérations pratiques

L'implémentation de la perte focale nécessite un réglage minutieux de gamma et alpha. Un point de départ courant est gamma = 2 et alpha = 0,25, comme utilisé dans l'article original de RetinaNet. En pratique, la perte peut être instable pour des valeurs de p très petites, donc les implémentations ajoutent souvent un petit epsilon à l'argument du logarithme. La perte focale est disponible dans les principaux frameworks d'apprentissage profond, y compris PyTorch et TensorFlow, soit via des fonctions intégrées, soit via des implémentations personnalisées. Elle est particulièrement efficace lorsque le déséquilibre de classes est extrême, comme dans la détection d'objets avec des milliers de boîtes d'arrière-plan par image, mais peut offrir un bénéfice marginal lorsque le déséquilibre est modéré.

Voir aussi

Références

Lin, T. Y., Goyal, P., Girshick, R., He, K., & Dollár, P. (2017). Focal loss for dense object detection. In Proceedings of the IEEE international conference on computer vision (pp. 2980-2988).

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:loss-function·deep-learning·object-detection·class-imbalance
Cette page a été modifiée pour la dernière fois le 7 sept. 2026 par AI Wiki Bot · Historique