RetinaNet es una arquitectura de aprendizaje automático de red neuronal de una sola etapa para la detección de objetos, presentada por Tsung-Yi Lin, Priya Goyal, Ross Girshick, Kaiming He y Piotr Dollár en un artículo de 2017 titulado "Focal Loss for Dense Object Detection". Fue desarrollada en Facebook AI Research (ahora parte de Meta AI). El modelo fue diseñado para superar la brecha de precisión entre los detectores de una sola etapa, que suelen ser más rápidos pero menos precisos, y los detectores de dos etapas como Faster R-CNN, que son más lentos pero más precisos. RetinaNet logra alta precisión al introducir la pérdida focal, una función de pérdida novedosa que reduce el peso de la contribución de los ejemplos negativos fáciles durante el entrenamiento, lo que permite al modelo centrarse en ejemplos difíciles y clases de objetos raras.
RetinaNet es una red totalmente convolucional que utiliza una red piramidal de características (FPN) como columna vertebral para extraer características de múltiples escalas, seguida de dos subredes específicas de la tarea: una para clasificar objetos y otra para regresar las cajas delimitadoras. La subred de clasificación aplica la pérdida focal, mientras que la subred de regresión utiliza la pérdida L1 suave estándar. La arquitectura está diseñada para la detección densa, lo que significa que predice objetos en cada ubicación espacial a través de múltiples escalas, sin requerir un paso separado de propuesta de regiones.
Arquitectura y pérdida focal
La innovación central de RetinaNet es la pérdida focal, que modifica la pérdida de entropía cruzada estándar para la clasificación. La pérdida focal añade un factor modulador \((1 - p_t)^\gamma\) al término de entropía cruzada, donde \(p_t\) es la probabilidad estimada del modelo para la clase verdadera y \(\gamma\) es un parámetro de enfoque (típicamente establecido en 2). Este factor reduce la contribución de la pérdida de ejemplos bien clasificados (donde \(p_t\) es alta), evitando que el vasto número de ejemplos de fondo fáciles abrume la señal de entrenamiento. El artículo demostró que la pérdida focal sola, sin cambios arquitectónicos, era suficiente para igualar o superar el rendimiento de los detectores de dos etapas.
La red utiliza una columna vertebral de ResNet (ResNet-50 o ResNet-101) combinada con una red piramidal de características para producir mapas de características en múltiples escalas, desde características de alto nivel y baja resolución hasta características de bajo nivel y alta resolución. Cada nivel de la pirámide alimenta las subredes de clasificación y regresión, que se comparten en todas las escalas. Este diseño permite la detección de objetos de tamaños variables, desde pequeños hasta grandes, en una sola pasada hacia adelante.
Rendimiento y resultados de referencia
En el artículo original, RetinaNet logró una precisión promedio (AP) de última generación de 39.1 en el punto de referencia COCO test-dev con una columna vertebral ResNet-101-FPN, superando a detectores de una sola etapa anteriores como SSD y YOLOv2, e igualando o superando el rendimiento de detectores de dos etapas como Faster R-CNN. Con una columna vertebral más grande (ResNeXt-101-FPN), alcanzó una AP de 40.8. El modelo también demostró una fuerte velocidad de inferencia, ejecutándose a hasta 5.4 fotogramas por segundo en una GPU NVIDIA M40 con la columna vertebral ResNet-50, lo que lo hace adecuado para aplicaciones en tiempo real.
Los autores señalaron que la pérdida focal era particularmente efectiva para manejar el desequilibrio extremo de clases - en COCO, hay aproximadamente 100,000 ubicaciones candidatas por imagen pero solo unos pocos objetos, con ejemplos de fondo superando ampliamente a los de primer plano. Al reducir el peso de los negativos fáciles, RetinaNet logró una convergencia más rápida y una mejor precisión final que los detectores densos anteriores.
Impacto y legado
RetinaNet se convirtió en un punto de referencia estándar en visión por computadora y fue ampliamente adoptado en la industria para aplicaciones como conducción autónoma, vigilancia e imágenes médicas. Sus principios de diseño influyeron en detectores de objetos posteriores, incluidos EfficientDet y modelos de una sola etapa más nuevos. La pérdida focal también se adaptó para otras tareas, como la segmentación semántica y el procesamiento del lenguaje natural, donde surgen problemas de desequilibrio de clases.
En los marcos de aprendizaje profundo, RetinaNet está implementada en bibliotecas populares como Detectron2, torchvision de PyTorch y TensorFlow Object Detection API, lo que facilita su uso por investigadores y profesionales. Se ha utilizado como componente en sistemas más grandes de inteligencia artificial, incluidos Tesla para la detección de vehículos y peatones, y en la tecnología de conducción autónoma de Waymo, aunque estas empresas han pasado a arquitecturas personalizadas.
Extensiones y variantes
Se han propuesto varias extensiones de RetinaNet. Una variante notable es RetinaMask, que extiende RetinaNet a la segmentación de instancias añadiendo una rama de predicción de máscaras. Otra es FCOS (Fully Convolutional One-Stage), que se basa en principios similares pero utiliza la predicción centrada sin cajas de anclaje. Los investigadores también han explorado la integración de mecanismos de atención, como en el DEtection TRansformer (DETR), que utiliza una arquitectura de Transformer (architecture) pero aborda el mismo problema de detección densa.
El artículo original de RetinaNet ha sido altamente citado, con más de 10,000 citas en 2024, lo que refleja su influencia significativa en el campo de la detección de objetos. Sus contribuciones al diseño de funciones de pérdida siguen siendo una técnica estándar en el entrenamiento de redes de predicción densas.