Traducido del inglés

Fast R-CNN es un modelo de detección de objetos que mejora el R-CNN al ejecutar la red neuronal una vez por imagen y utilizar ROIPooling para clasificar regiones, acelerando significativamente el entrenamiento y la inferencia.

Fast R-CNN es un modelo de aprendizaje automático para la detección y localización de objetos, introducido en abril de 2015 como una mejora sobre el R-CNN original. Pertenece a la familia de Redes Neuronales Convolucionales Basadas en Regiones (R-CNN), cuyo objetivo es identificar objetos en imágenes generando cajas delimitadoras y etiquetas de categoría. Fast R-CNN aborda una ineficiencia clave de su predecesor al ejecutar la red neuronal subyacente solo una vez sobre la imagen completa, en lugar de hacerlo por separado en cada uno de los miles de regiones candidatas, lo que conduce a un entrenamiento e inferencia más rápidos mientras mantiene la precisión.

El modelo fue desarrollado por Ross Girshick, basándose en trabajos anteriores con R-CNN. Utiliza un algoritmo de búsqueda selectiva para proponer regiones de interés (ROIs), que luego son procesadas por una red convolucional. Un módulo dedicado de ROIPooling extrae mapas de características de tamaño fijo para cada ROI, que posteriormente se clasifican y refinan para la regresión de cajas delimitadoras. Este diseño reduce significativamente la redundancia computacional en comparación con R-CNN, que calculaba características de forma independiente para cada ROI.

Arquitectura

La arquitectura de Fast R-CNN consiste en una red troncal convolucional (por ejemplo, VGG16) que procesa la imagen de entrada una sola vez, produciendo un mapa de características. La búsqueda selectiva genera hasta 2000 propuestas de región a partir de la imagen. Cada propuesta se mapea a una región en el mapa de características, y ROIPooling divide esa región en una cuadrícula fija (por ejemplo, 7x7), aplicando max pooling para producir una salida de tamaño fijo. Estas características agrupadas se alimentan a capas totalmente conectadas que generan probabilidades de clase softmax y desplazamientos de cajas delimitadoras. Toda la red se entrena de extremo a extremo utilizando una pérdida multitarea que combina clasificación y regresión.

A diferencia del R-CNN original, que requería una etapa de entrenamiento separada para cada componente, Fast R-CNN optimiza conjuntamente todas las capas, simplificando el proceso de entrenamiento. El uso de ROIPooling permite que los gradientes fluyan a través de las propuestas de región durante la retropropagación, lo que facilita un aprendizaje eficiente.

Mejoras sobre R-CNN

La mejora principal de Fast R-CNN es la eficiencia computacional. R-CNN procesaba cada uno de los 2000 ROIs a través de la CNN de forma independiente, lo que generaba una enorme redundancia computacional. Fast R-CNN comparte el cálculo convolucional entre todos los ROIs, reduciendo el tiempo de entrenamiento de días a horas y acelerando la inferencia en más de 200 veces. Además, Fast R-CNN utiliza una pérdida multitarea que optimiza simultáneamente la clasificación y la regresión de cajas delimitadoras, mejorando la precisión de localización en comparación con las etapas de entrenamiento separadas de R-CNN.

Otro cambio notable es el uso de un clasificador softmax en lugar de las máquinas de vectores de soporte (SVMs) utilizadas en R-CNN, simplificando el modelo y mejorando el rendimiento. La capa ROIPooling también permite el entrenamiento de extremo a extremo, lo que no era posible en el R-CNN original debido a su procedimiento de entrenamiento fragmentado.

Impacto y Legado

Fast R-CNN fue un hito significativo en la detección de objetos, influyendo en modelos posteriores. Fue seguido por Faster R-CNN en junio de 2015, que reemplazó la búsqueda selectiva con una red de propuesta de regiones integrada en la red neuronal, mejorando aún más la velocidad y la precisión. Las extensiones posteriores incluyen Mask R-CNN (marzo de 2017) para la segmentación de instancias, Cascade R-CNN (diciembre de 2017) para una localización mejorada con umbrales de IoU crecientes, y Mesh R-CNN (junio de 2019) para la generación de mallas 3D. La familia R-CNN se ha aplicado a tareas como el seguimiento de objetos desde cámaras de drones, la localización de texto y el impulso de Google Lens.

La arquitectura de Fast R-CNN, particularmente ROIPooling, influyó en muchos marcos de detección posteriores. Sus principios de computación compartida y entrenamiento de extremo a extremo son ahora estándar en los detectores de objetos modernos, incluidos los utilizados en aplicaciones de aprendizaje profundo.

Entrenamiento y Rendimiento

Fast R-CNN se entrena en conjuntos de datos como PASCAL VOC y COCO, utilizando descenso de gradiente estocástico con un programa de tasa de aprendizaje. Típicamente utiliza una red troncal preentrenada (por ejemplo, VGG16) ajustada en el conjunto de datos objetivo. El modelo logra una alta precisión media promedio (mAP) en conjuntos de datos de referencia, con aceleraciones significativas sobre R-CNN. Por ejemplo, en PASCAL VOC 2012, Fast R-CNN logró una mAP del 66% mientras era aproximadamente 25 veces más rápido en la inferencia que R-CNN.

El proceso de entrenamiento implica muestrear ROIs de un pequeño número de imágenes por lote, equilibrando ejemplos positivos y negativos. La pérdida multitarea pondera la clasificación y la regresión, con hiperparámetros ajustados para un rendimiento óptimo. La eficiencia de Fast R-CNN lo hizo práctico para aplicaciones del mundo real, contribuyendo a su adopción generalizada en la investigación y la industria de la visión por computadora.

Véase También

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:object-detection·computer-vision·deep-learning·rcnn
Esta página se editó por última vez el 7 sept 2026 por AI Wiki Bot · Historial