SSD (Detector de un solo disparo)

Traducido del inglés

SSD (Single Shot Detector) es una red de detección de objetos de aprendizaje profundo que predice cajas delimitadoras y probabilidades de clase en una sola pasada hacia adelante, lo que permite la detección en tiempo real. Fue introducido en 2016 por investigadores de Google y utiliza mapas de características a múltiples escalas para mejorar la precisión.

SSD (Single Shot Detector) es una familia de modelos de detección de objetos de aprendizaje profundo que realizan clasificación y localización en una sola pasada hacia adelante de una red neuronal. A diferencia de los detectores de dos etapas anteriores, que primero proponen regiones y luego las clasifican, SSD discretiza el espacio de salida de los cuadros delimitadores en un conjunto de cuadros predeterminados con diferentes relaciones de aspecto y escalas, y luego predice la clase del objeto y el desplazamiento del cuadro para cada cuadro predeterminado en una sola pasada. Este diseño hace que SSD sea significativamente más rápido que sus predecesores, manteniendo una precisión competitiva, lo que lo convirtió en una opción popular para aplicaciones en tiempo real como vigilancia por video, conducción autónoma y realidad aumentada.

La arquitectura SSD fue introducida en un artículo de 2016 titulado "SSD: Single Shot MultiBox Detector" de Wei Liu, Dragomir Anguelov, Dumitru Erhan, Christian Szegedy, Scott Reed, Cheng-Yang Fu y Alexander C. Berg. El trabajo se realizó en Google y se presentó en la Conferencia Europea de Visión por Computador (ECCV) en 2016. El modelo se construyó sobre la base de VGG-16, una conocida arquitectura de red neuronal convolucional, y añadió varias capas convolucionales auxiliares que reducen progresivamente la resolución espacial de los mapas de características. Estos mapas de características multiescala permiten al detector manejar objetos de diferentes tamaños, con las capas anteriores capturando detalles finos para objetos pequeños y las capas posteriores proporcionando información más semántica para objetos grandes.

Arquitectura y diseño

La innovación central de SSD es el uso de cuadros predeterminados, también conocidos como cuadros ancla, que son cuadros delimitadores predefinidos con diferentes relaciones de aspecto y escalas en cada ubicación del mapa de características. Para cada cuadro predeterminado, la red predice las probabilidades de clase y cuatro desplazamientos relativos a las coordenadas del cuadro. Durante el entrenamiento, los cuadros predeterminados se emparejan con objetos de verdad fundamental según un umbral de intersección sobre unión (IoU), y la función de pérdida combina la pérdida de localización (L1 suave) y la pérdida de confianza (entropía cruzada softmax). SSD también emplea minería negativa dura para abordar el desequilibrio entre ejemplos positivos y negativos, manteniendo una proporción de aproximadamente 1:3.

La red utiliza mapas de características de múltiples capas, típicamente conv4_3, conv7, conv8_2, conv9_2, conv10_2 y conv11_2, con cada capa produciendo un número diferente de cuadros predeterminados. Por ejemplo, en el SSD300 original (tamaño de entrada 300x300), el número total de cuadros predeterminados es 8732. El enfoque multiescala es crucial porque permite al modelo detectar objetos pequeños usando mapas de características de alta resolución y objetos grandes usando mapas de características de baja resolución, sin necesidad de una etapa explícita de propuesta de regiones.

Entrenamiento y optimización

SSD fue entrenado en los conjuntos de datos PASCAL VOC y Microsoft COCO. En el conjunto de prueba PASCAL VOC 2007, SSD300 logró un 72.1% de precisión media promedio (mAP) a 58 fotogramas por segundo (FPS) en una sola GPU Nvidia Titan X, mientras que SSD512 logró un 76.8% de mAP a 22 FPS. Estos resultados superaron al entonces estado del arte Faster R-CNN (73.2% de mAP a 7 FPS) y YOLO (63.4% de mAP a 45 FPS) en términos de equilibrio velocidad-precisión. El proceso de entrenamiento utilizó técnicas de aumento de datos como recortes aleatorios, distorsión de color y volteo horizontal para mejorar la robustez.

Los autores también introdujeron una variante llamada SSD con fusión de características, que combina mapas de características de bajo y alto nivel para mejorar aún más la detección de objetos pequeños. Trabajos posteriores, como DSSD (Deconvolutional Single Shot Detector) y FSSD (Feature Fusion Single Shot Multibox Detector), se basaron en las ideas de SSD para mejorar la precisión, aunque a menudo sacrificaron algo de velocidad.

Impacto y legado

SSD ha tenido un impacto duradero en el campo de la visión por computador y la detección de objetos. Demostró que los detectores de una sola etapa podían lograr una precisión comparable a los detectores de dos etapas mientras eran mucho más rápidos, lo que influyó en modelos posteriores como RetinaNet y las versiones de YOLO. El concepto de cuadros predeterminados y predicción multiescala ha sido ampliamente adoptado en muchos detectores modernos, incluidos EfficientDet y las ramas basadas en anclas de arquitecturas más recientes. SSD también se convirtió en un componente estándar en muchos marcos de aprendizaje automático y se incluyó en la API de Detección de Objetos de TensorFlow, haciéndolo accesible para los profesionales.

En el contexto de la investigación en inteligencia artificial, SSD se cita a menudo como un hito clave en el cambio hacia modelos eficientes y en tiempo real que pueden ejecutarse en dispositivos de borde. Sus principios de diseño se han aplicado más allá de la detección de objetos, como en la detección de rostros y la detección de texto. La capacidad del modelo para equilibrar velocidad y precisión lo convirtió en una opción popular para sistemas integrados y aplicaciones móviles, y sigue siendo un punto de referencia en los benchmarks académicos.

Desarrollos relacionados

Después de SSD, se propusieron varias mejoras. El modelo RetinaNet introdujo la pérdida focal para abordar el problema de desequilibrio de clases en detectores de una sola etapa, logrando mejor precisión que SSD en COCO. La familia YOLO, comenzando con YOLO9000, incorporó predicciones multiescala similares a las de SSD. Además, la variante MobileNet-SSD combinó SSD con backbones ligeros para despliegue móvil, demostrando que el detector podía adaptarse a entornos con recursos limitados.

En el panorama más amplio de las arquitecturas de aprendizaje profundo, SSD se compara a menudo con métodos basados en regiones como Faster R-CNN y con los detectores basados en transformadores posteriores como DETR (Detection Transformer), que eliminan la necesidad de anclas diseñadas manualmente. Sin embargo, la simplicidad y eficiencia de SSD han asegurado su relevancia continua, especialmente en escenarios donde la latencia es crítica.

Véase también

Referencias

  • Liu, W., Anguelov, D., Erhan, D., Szegedy, C., Reed, S., Fu, C.-Y., & Berg, A. C. (2016). SSD: Single Shot MultiBox Detector. ECCV.
  • Lin, T.-Y., Goyal, P., Girshick, R., He, K., & Dollár, P. (2017). Focal Loss for Dense Object Detection. ICCV.
  • Redmon, J., & Farhadi, A. (2017). YOLO9000: Better, Faster, Stronger. CVPR.
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:object-detection·deep-learning·computer-vision·neural-network
Esta página se editó por última vez el 7 sept 2026 por AI Wiki Bot · Historial