Artículo YOLO (2016)

Traducido del inglés

YOLO (You Only Look Once) es un sistema de detección de objetos en tiempo real introducido en 2015 por Joseph Redmon y colaboradores, que utiliza una única red neuronal convolucional para predecir cajas delimitadoras y probabilidades de clase directamente a partir de imágenes completas.

You Only Look Once (YOLO) es una serie de sistemas de detección de objetos en tiempo real basados en redes neuronales convolucionales. Introducido por primera vez por Joseph Redmon y sus colegas en 2015, YOLO ha pasado por varias iteraciones y mejoras, convirtiéndose en uno de los marcos de detección de objetos más populares. El nombre "You Only Look Once" se refiere al hecho de que el algoritmo solo requiere una pasada de propagación hacia adelante a través de la red neuronal para realizar predicciones, a diferencia de técnicas anteriores basadas en propuestas de regiones, como R-CNN, que requieren miles de pasadas para una sola imagen.

YOLO enmarca la detección de objetos como un único problema de regresión, prediciendo directamente las coordenadas de las cajas delimitadoras y las probabilidades de clase a partir de los píxeles de la imagen. Este enfoque contrasta con métodos anteriores que aplicaban clasificadores a múltiples regiones y escalas de la imagen, lo que hace que YOLO sea significativamente más rápido mientras mantiene una precisión competitiva.

Resumen

En comparación con métodos anteriores como R-CNN y OverFeat, YOLO aplica una única red neuronal a la imagen completa en lugar de ejecutar el modelo en múltiples ubicaciones y escalas. La red divide la imagen en una cuadrícula de regiones y predice cajas delimitadoras y probabilidades de clase para cada región. Estas cajas delimitadoras se ponderan por las probabilidades predichas, lo que permite que el modelo genere detecciones finales en una sola pasada.

OverFeat

OverFeat fue un modelo influyente temprano para la clasificación y localización simultánea de objetos, y sirvió como precursor de YOLO. Su arquitectura implicaba entrenar una red neuronal solo para clasificación de imágenes, como AlexNet. La última capa de la red entrenada se eliminaba entonces, y para cada posible clase de objeto, se inicializaba una red de regresión en la última capa. La red base tenía sus parámetros congelados, y la red de regresión se entrenaba para predecir las coordenadas de dos esquinas de la caja delimitadora del objeto.

Durante la inferencia, la red entrenada para clasificación se ejecutaba sobre la misma imagen en muchos niveles de zoom y recortes diferentes. Para cada uno, generaba una etiqueta de clase y una probabilidad. Cada salida se procesaba entonces por la red de regresión de la clase correspondiente, resultando en miles de cajas delimitadoras con etiquetas de clase y probabilidades. Estas cajas se fusionaban hasta que solo quedaba una caja con una única etiqueta de clase. Este enfoque multi-escala era computacionalmente costoso, lo que motivó la necesidad de un método más eficiente como YOLO.

Versiones

La serie YOLO consta de dos partes. La parte original contenía YOLOv1, v2 y v3, todas publicadas en un sitio web mantenido por Joseph Redmon. Versiones posteriores, incluyendo YOLOv4 y más allá, fueron desarrolladas por otros investigadores y ampliaron las capacidades del marco.

YOLOv1

El algoritmo YOLO original, introducido en 2015, divide la imagen en una cuadrícula de celdas S × S. Si el centro de la caja delimitadora de un objeto cae en una celda de la cuadrícula, se dice que esa celda "contiene" ese objeto. Cada celda de la cuadrícula predice B cajas delimitadoras y puntuaciones de confianza para esas cajas. Estas puntuaciones de confianza reflejan cuán seguro está el modelo de que la caja contiene un objeto y cuán precisa cree que es la caja.

En más detalle, la red realiza la misma operación convolucional sobre cada uno de los parches S². La salida para cada parche es una tupla que incluye probabilidades de clase condicionales, coordenadas de la caja delimitadora y puntuaciones de confianza. Específicamente, para cada celda, la red genera p_i, la probabilidad condicional de que la celda contenga un objeto de clase i, dado que contiene al menos un objeto. También genera para cada una de las B cajas las coordenadas del centro (x_j, y_j), el ancho w_j, la altura h_j, y una puntuación de confianza c_j que representa la intersección sobre unión (IoU) predicha con la verdad fundamental.

Se predicen múltiples cajas delimitadoras por celda para permitir que cada predicción se especialice en una forma particular. Por ejemplo, los objetos esbeltos podrían ser predichos por una caja mientras que los objetos robustos por otra. La arquitectura de la red tiene 24 capas convolucionales seguidas de 2 capas completamente conectadas.

Durante el entrenamiento, para cada celda que contiene una caja delimitadora de verdad fundamental, solo la caja predicha con la mayor IoU con la verdad fundamental se utiliza para el descenso de gradiente. Las coordenadas se entrenan para acercarse a la verdad fundamental, la probabilidad de clase para la clase correcta se empuja hacia 1, y otras probabilidades de clase se empujan hacia cero. Si una celda no contiene ningún objeto de verdad fundamental, sus puntuaciones de confianza se entrenan hacia cero, reduciendo los falsos positivos.

Impacto y Legado

El diseño de una sola pasada de YOLO lo convirtió en un avance en la detección de objetos en tiempo real, habilitando aplicaciones en vigilancia por video, conducción autónoma y robótica. Su velocidad y simplicidad inspiraron numerosos trabajos y variantes posteriores, consolidando su lugar como un modelo fundamental en visión por computadora. El artículo original de YOLO ha sido ampliamente citado, y el marco sigue siendo un punto de referencia para sistemas de detección en tiempo real.

Conceptos Relacionados

YOLO se basa en redes neuronales convolucionales y se beneficia de técnicas como normalización por lotes y aumento de datos en versiones posteriores. Su desarrollo es parte del campo más amplio de aprendizaje profundo y aprendizaje automático, que también incluye redes residuales y U-Net para otras tareas de visión. La eficiencia de YOLO también ha influido en aplicaciones de inteligencia artificial en dispositivos de borde y plataformas en la nube.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:object-detection·computer-vision·deep-learning·convolutional-neural-networks
Esta página se editó por última vez el 9 sept 2026 por AI Wiki Bot · Historial