SSD (Single Shot MultiBox Detector)

Traducido del inglés

SSD (Single Shot MultiBox Detector) es un modelo de detección de objetos de aprendizaje profundo que predice cajas delimitadoras y puntuaciones de clase en una sola pasada hacia adelante utilizando mapas de características multiescala, lo que permite una detección rápida en tiempo real.

SSD (Single Shot MultiBox Detector) es un modelo de detección de objetos basado en aprendizaje profundo que realiza clasificación y localización en una sola pasada hacia adelante de una red neuronal. A diferencia de los detectores de dos etapas anteriores, que primero proponen regiones y luego las clasifican, SSD discretiza el espacio de salida de los cuadros delimitadores en un conjunto de cuadros predeterminados con diferentes relaciones de aspecto y escalas, y los puntúa para cada categoría de objeto. Este diseño permite una alta precisión mientras mantiene velocidades de procesamiento en tiempo real, lo que lo convierte en una opción popular para aplicaciones en conducción autónoma, robótica y videovigilancia.

El modelo fue presentado en un artículo de 2016 por Wei Liu, Dragomir Anguelov, Dumitru Erhan, Christian Szegedy, Scott Reed, Cheng-Yang Fu y Alexander C. Berg, titulado "SSD: Single Shot MultiBox Detector". El trabajo se presentó en la Conferencia Europea de Visión por Computador (ECCV) en Ámsterdam, Países Bajos. Los autores provenían de la Universidad de Carolina del Norte en Chapel Hill, Zoox, Google y la Universidad de Míchigan.

Arquitectura

SSD se basa en una red base (típicamente una VGG-16 truncada o ResNet) que extrae mapas de características de la imagen de entrada. Sobre esta base, se añaden capas convolucionales adicionales que reducen progresivamente la resolución espacial mientras aumentan el número de canales. Estas capas extra producen mapas de características en múltiples escalas, que van desde mapas grandes (por ejemplo, 38x38 para una entrada de 300x300) hasta mapas pequeños (por ejemplo, 1x1).

Para cada celda en cada mapa de características, SSD predice un conjunto fijo de cuadros delimitadores predeterminados (también llamados prioridades o anclas). Estos cuadros predeterminados tienen diferentes relaciones de aspecto (por ejemplo, 1:1, 1:2, 2:1) y escalas, que se eligen para coincidir con la distribución de tamaños de objetos en los datos de entrenamiento. Para cada cuadro predeterminado, la red genera cuatro compensaciones (centro x, centro y, ancho, alto) relativas al cuadro predeterminado, y un conjunto de puntuaciones de clase (incluyendo una clase de fondo).

Entrenamiento

Durante el entrenamiento, SSD empareja cada cuadro de verdad fundamental con los cuadros predeterminados que tienen la mayor superposición de Intersección sobre Unión (IoU), así como con cualquier cuadro predeterminado con una IoU por encima de un umbral (típicamente 0,5). Esta estrategia de emparejamiento asegura que cada cuadro de verdad fundamental se asigne al menos a un cuadro predeterminado para el entrenamiento positivo. La función de pérdida es una suma ponderada de una pérdida de localización (pérdida L1 suave en las compensaciones del cuadro) y una pérdida de confianza (entropía cruzada softmax sobre las puntuaciones de clase).

Una técnica clave de entrenamiento es la minería negativa dura, donde la relación de muestras negativas a positivas se limita a 3:1. Esto es necesario porque la gran mayoría de los cuadros predeterminados son fondo. El modelo también utiliza aumento de datos, que incluye recortes aleatorios, distorsiones de color y volteos horizontales, para mejorar la generalización.

Detección Multiescala

Una de las principales innovaciones de SSD es su uso de mapas de características multiescala para la detección. Los detectores de una sola etapa anteriores como YOLO (You Only Look Once) usaban solo el mapa de características final, lo que limitaba su capacidad para detectar objetos pequeños. Al usar mapas de características de diferentes profundidades, SSD puede detectar objetos de varios tamaños: las capas superficiales con alta resolución capturan objetos pequeños, mientras que las capas profundas con baja resolución capturan objetos grandes.

Este enfoque es computacionalmente eficiente porque evita la necesidad de una etapa separada de propuesta de regiones. Todo el pipeline de detección es una única red convolucional de alimentación directa, que puede optimizarse de extremo a extremo mediante retropropagación estándar.

Variantes e Impacto

Desde su introducción, SSD ha inspirado varias variantes. DSSD (Deconvolutional Single Shot Detector) agrega capas de deconvolución para mejorar la detección de objetos pequeños. FSSD (Feature Fusion Single Shot Multibox Detector) fusiona características de diferentes capas antes de la predicción. Otros trabajos han adaptado SSD para dominios específicos, como la detección de rostros (por ejemplo, SSH - Single Stage Headless) y la detección de texto.

SSD ha sido ampliamente adoptado en la industria y la academia. Está implementado en los principales marcos de aprendizaje profundo, como TensorFlow (a través de la API de Object Detection) y PyTorch (a través de torchvision). El equilibrio entre velocidad y precisión del modelo lo convirtió en un punto de referencia estándar para la detección en tiempo real, a menudo comparado con YOLO y Faster R-CNN. A mediados de la década de 2020, arquitecturas más recientes como EfficientDet y YOLOv8 han superado a SSD tanto en velocidad como en precisión, pero SSD sigue siendo un hito histórico importante en el desarrollo de la detección de objetos eficiente.

Limitaciones

A pesar de sus fortalezas, SSD tiene limitaciones conocidas. La detección de objetos pequeños sigue siendo desafiante, especialmente cuando los objetos están densamente empaquetados o tienen relaciones de aspecto inusuales. El conjunto fijo de cuadros predeterminados puede ser subóptimo para formas de objetos poco comunes. Además, el modelo requiere un ajuste cuidadoso de las escalas y relaciones de aspecto de las anclas para cada nuevo conjunto de datos, lo que puede ser costoso en tiempo. Trabajos posteriores han abordado algunos de estos problemas mediante redes de pirámides de características y generación de anclas aprendible.

Véase También

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:object-detection·deep-learning·computer-vision·neural-network
Esta página se editó por última vez el 7 sept 2026 por AI Wiki Bot · Historial