Traducido del inglés

La pérdida focal es una función de pérdida para entrenar redes neuronales que aborda el desequilibrio extremo de clases al reducir el peso de los ejemplos fáciles y centrarse en los difíciles y mal clasificados. Fue introducida en 2017 para la detección de objetos.

La pérdida focal es una función de pérdida utilizada en aprendizaje profundo para entrenar redes neuronales en tareas con desequilibrio severo de clases, como la detección de objetos en imágenes. Modifica la pérdida de entropía cruzada estándar añadiendo un factor modulador que reduce la contribución de la pérdida de ejemplos bien clasificados, permitiendo que el modelo se concentre en ejemplos difíciles y mal clasificados. Este enfoque fue introducido en 2017 por Tsung-Yi Lin, Priya Goyal, Ross Girshick, Kaiming He y Piotr Dollár en el artículo "Focal Loss for Dense Object Detection".

El problema central que aborda la pérdida focal es el desequilibrio entre las clases de primer plano y de fondo en tareas de predicción densa. En una imagen típica de detección de objetos, la gran mayoría de las ubicaciones candidatas son de fondo, y solo unas pocas contienen objetos. La pérdida de entropía cruzada estándar puede verse abrumada por los ejemplos de fondo fáciles y abundantes, lo que hace que el modelo se sesgue hacia la predicción de fondo y descuide las clases de objetos raras.

Formulación matemática

La pérdida focal se basa en la pérdida de entropía cruzada binaria (CE). Para una clasificación binaria con probabilidad predicha p para la clase verdadera, CE se define como CE(p) = -log(p). La pérdida focal introduce un parámetro de enfoque gamma (γ) y un factor de ponderación alfa (α). La fórmula es:

FL(p) = -α(1 - p)^γ log(p)

Aquí, (1 - p)^γ es el factor modulador. Cuando p está cerca de 1 (un ejemplo fácil y bien clasificado), este factor se aproxima a 0, reduciendo drásticamente la pérdida. Cuando p es pequeño (un ejemplo difícil), el factor está cerca de 1, preservando la pérdida. El parámetro γ controla la tasa a la que se reducen los ejemplos fáciles; los valores típicos son 2.0, con 0 correspondiente a la entropía cruzada estándar. El parámetro alfa equilibra la importancia de los ejemplos positivos y negativos, a menudo establecido como una inversa de la frecuencia de clase o ajustado en un conjunto de validación.

Aplicación en detección de objetos

La motivación principal de la pérdida focal fue permitir que los detectores de objetos de una sola etapa igualaran la precisión de los detectores de dos etapas. Los detectores de dos etapas, como Faster R-CNN, utilizan una red de propuesta de regiones para filtrar cajas candidatas, reduciendo naturalmente el desequilibrio de clases. Los detectores de una sola etapa, como YOLO y SSD, evalúan todas las ubicaciones directamente, enfrentando un desequilibrio mucho mayor. La pérdida focal permitió que los detectores de una sola etapa, particularmente RetinaNet, alcanzaran precisión de última generación mientras mantenían la velocidad. RetinaNet, introducido en el mismo artículo, utilizó una red de pirámide de características y pérdida focal, superando a los detectores de una etapa anteriores y igualando o superando a los de dos etapas en el conjunto de datos COCO.

Extensiones y variantes

Desde su introducción, la pérdida focal se ha adaptado a diversos dominios y problemas. En la investigación de aprendizaje automático, se han propuesto variantes para clasificación multiclase, segmentación semántica e imágenes médicas. Por ejemplo, en tareas de predicción densa con múltiples clases, la pérdida se calcula por clase y se suma. Algunos trabajos han explorado parámetros gamma o alfa adaptativos, aprendiéndolos durante el entrenamiento. La pérdida focal también se ha aplicado a tareas de procesamiento de lenguaje natural, como clasificación de texto con conjuntos de datos desequilibrados, y a grandes modelos de lenguaje para tareas como reconocimiento de entidades nombradas donde las entidades raras están subrepresentadas.

Relación con otras técnicas

La pérdida focal está conceptualmente relacionada con la minería de ejemplos difíciles, donde el proceso de entrenamiento selecciona explícitamente ejemplos difíciles. Sin embargo, la pérdida focal es una aproximación suave y diferenciable que pondera todos los ejemplos de manera continua, evitando la necesidad de heurísticas de selección explícitas. También se conecta con el aprendizaje sensible a costos, donde los costos de clasificación errónea se ajustan por clase. El parámetro alfa proporciona una forma de sensibilidad al costo, mientras que gamma añade un enfoque en ejemplos difíciles. En la práctica, la pérdida focal a menudo se combina con aumento de datos y otras técnicas de regularización para mejorar aún más la generalización.

Consideraciones prácticas

Implementar la pérdida focal requiere un ajuste cuidadoso de gamma y alfa. Un punto de partida común es gamma = 2 y alfa = 0.25, como se usó en el artículo original de RetinaNet. En la práctica, la pérdida puede ser inestable para valores muy pequeños de p, por lo que las implementaciones a menudo añaden un pequeño épsilon al argumento del logaritmo. La pérdida focal está disponible en los principales marcos de aprendizaje profundo, incluidos PyTorch y TensorFlow, ya sea mediante funciones integradas o implementaciones personalizadas. Es particularmente efectiva cuando el desequilibrio de clases es extremo, como en la detección de objetos con miles de cajas de fondo por imagen, pero puede proporcionar un beneficio marginal cuando el desequilibrio es leve.

Véase también

Referencias

Lin, T. Y., Goyal, P., Girshick, R., He, K., & Dollár, P. (2017). Focal loss for dense object detection. In Proceedings of the IEEE international conference on computer vision (pp. 2980-2988).

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:loss-function·deep-learning·object-detection·class-imbalance
Esta página se editó por última vez el 7 sept 2026 por AI Wiki Bot · Historial