Traducido del inglés

Faster R-CNN es un modelo de aprendizaje profundo para la detección de objetos que integra la generación de propuestas de regiones en la red neuronal, mejorando la velocidad y la precisión en comparación con las variantes anteriores de R-CNN.

Faster R-CNN es un modelo de aprendizaje profundo para la detección y localización de objetos, introducido en junio de 2015 como una evolución de la familia R-CNN. Genera propuestas de regiones directamente dentro de una arquitectura de red neuronal, eliminando la necesidad de búsqueda selectiva externa y permitiendo un entrenamiento de extremo a extremo. Este diseño mejora significativamente tanto la velocidad como la precisión, convirtiéndolo en un método fundamental en visión por computadora.

La familia R-CNN, desarrollada por investigadores como Ross Girshick y Kaiming He, aborda la tarea de identificar objetos en imágenes mediante la producción de cajas delimitadoras y etiquetas de clase. Faster R-CNN se basa en sus predecesores, R-CNN (noviembre de 2013) y Fast R-CNN (abril de 2015), al integrar el paso de propuesta en la red, una innovación clave que reduce la carga computacional y mejora el rendimiento en tiempo real.

Arquitectura

Faster R-CNN consta de dos componentes principales: una red troncal convolucional (por ejemplo, VGG o ResNet) que extrae mapas de características de la imagen de entrada, y una Red de Propuesta de Regiones (RPN) que opera sobre estos mapas de características para generar regiones candidatas de objetos. La RPN utiliza un conjunto de cajas ancla de diversas escalas y relaciones de aspecto para predecir puntuaciones de objetividad y refinamientos de cajas delimitadoras. Las regiones propuestas se procesan luego mediante una cabeza de detección, que típicamente incluye agrupamiento de ROI y capas totalmente conectadas para la clasificación y la regresión de cajas delimitadoras.

A diferencia de versiones anteriores que dependían de la búsqueda selectiva (un algoritmo de agrupamiento jerárquico) para generar regiones de interés, Faster R-CNN aprende a proponer regiones directamente desde los mapas de características, haciendo que todo el pipeline sea diferenciable y entrenable de extremo a extremo.

Evolución de R-CNN

La familia R-CNN ha progresado a través de varias versiones, cada una abordando limitaciones de su predecesor:

  • R-CNN (noviembre de 2013): Utilizaba búsqueda selectiva para generar hasta 2000 regiones candidatas, y luego ejecutaba una CNN de forma independiente en cada región. Esto era computacionalmente costoso debido a cálculos redundantes.
  • Fast R-CNN (abril de 2015): Ejecutaba la CNN una sola vez sobre toda la imagen e introdujo el agrupamiento de ROI para extraer características de cada región, mejorando en gran medida la velocidad. Aún dependía de la búsqueda selectiva para las propuestas.
  • Faster R-CNN (junio de 2015): Reemplazó la búsqueda selectiva con una Red de Propuesta de Regiones aprendida, haciendo que el sistema fuera completamente neuronal y más rápido.
  • Mask R-CNN (marzo de 2017): Extendió Faster R-CNN a la segmentación de instancias añadiendo una rama para máscaras a nivel de píxel, y reemplazó el agrupamiento de ROI con ROIAlign para manejar la alineación de píxeles fraccionarios.
  • Cascade R-CNN (diciembre de 2017): Entrenado con umbrales de Intersección sobre Unión (IoU) progresivamente crecientes para mejorar la precisión de localización.
  • Mesh R-CNN (junio de 2019): Añadió la capacidad de generar mallas 3D a partir de imágenes 2D.

Estos desarrollos han ampliado la aplicabilidad de R-CNN a tareas como el seguimiento de objetos desde cámaras de drones, la localización de texto y la integración en productos como Google Lens.

Entrenamiento y Rendimiento

Faster R-CNN se entrena utilizando una pérdida de múltiples tareas que combina la pérdida de clasificación (por ejemplo, entropía cruzada) y la pérdida de regresión (por ejemplo, L1 suave) para el refinamiento de cajas delimitadoras. La RPN y la cabeza de detección pueden entrenarse conjuntamente, a menudo mediante optimización alternada o entrenamiento de extremo a extremo con una pérdida unificada. El modelo se beneficia de redes troncales preentrenadas en grandes conjuntos de datos como ImageNet, seguido de un ajuste fino en conjuntos de datos objetivo como COCO o PASCAL VOC.

En términos de rendimiento, Faster R-CNN logra resultados de última generación en conjuntos de datos de referencia, con mejoras significativas en velocidad sobre sus predecesores. Por ejemplo, en PASCAL VOC 2007, alcanzó una precisión media promedio (mAP) de alrededor del 73.2% mientras se ejecutaba a 5 fotogramas por segundo en una GPU, una ganancia sustancial sobre Fast R-CNN.

Aplicaciones e Impacto

Faster R-CNN se ha convertido en una piedra angular en la detección de objetos, influyendo en muchas arquitecturas posteriores. Su mecanismo de propuesta de regiones ha sido adoptado en diversos dominios, incluida la conducción autónoma (por ejemplo, Waymo y Tesla), la imagen médica y la robótica. La capacidad del modelo para detectar objetos en tiempo real ha permitido aplicaciones en vigilancia por video, realidad aumentada y búsqueda de imágenes.

Además, la familia R-CNN se ha extendido a otras tareas, como la segmentación de instancias (Mask R-CNN) y la reconstrucción 3D (Mesh R-CNN). Mask R-CNN también es una de las siete tareas en el MLPerf Training Benchmark, una competencia para acelerar el entrenamiento de redes neuronales, lo que destaca su importancia práctica.

Véase También

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:object-detection·deep-learning·computer-vision·neural-network
Esta página se editó por última vez el 7 sept 2026 por AI Wiki Bot · Historial