Red de Pirámides de Características

Traducido del inglés

Una Red de Pirámides de Características (FPN) es una arquitectura de red neuronal que construye mapas de características multiescala para la detección de objetos, mejorando la precisión en distintos tamaños de objeto mediante la combinación de conexiones de arriba hacia abajo y laterales.

Una Feature Pyramid Network (FPN) es una arquitectura de red neuronal diseñada para extraer mapas de características multiescala para la detección de objetos y otras tareas de visión por computadora. Introducida por Tsung-Yi Lin, Piotr Dollár, Ross Girshick, Kaiming He, Bharath Hariharan y Serge Belongie en su artículo de 2017 "Feature Pyramid Networks for Object Detection", FPN aborda el desafío de detectar objetos a diferentes escalas mediante la construcción de una pirámide de mapas de características con información semántica rica en cada nivel. Se ha convertido en un componente fundamental en muchos detectores modernos, como Faster R-CNN y Mask R-CNN, y se utiliza ampliamente en aplicaciones de aprendizaje automático y aprendizaje profundo.

La idea central de FPN es aprovechar las representaciones de características jerárquicas y multiescala inherentes de una red neuronal convolucional (típicamente un backbone como ResNet) y mejorarlas con una vía de arriba hacia abajo que propaga características semánticas de alto nivel a resoluciones más bajas. Esto se logra mediante conexiones laterales que fusionan los mapas de características correspondientes de la vía de abajo hacia arriba, permitiendo que la red produzca características sólidas en cada escala. Como resultado, FPN mejora el rendimiento de detección, especialmente para objetos pequeños, sin aumentar significativamente el costo computacional.

Arquitectura

FPN consta de dos vías principales: una vía de abajo hacia arriba y una vía de arriba hacia abajo. La vía de abajo hacia arriba es la red convolucional estándar de avance (por ejemplo, ResNet) que calcula mapas de características a múltiples escalas, típicamente con pasos de 4, 8, 16 y 32 píxeles en relación con la imagen de entrada. Estos mapas de características se denotan como C2, C3, C4 y C5, correspondientes a las salidas del último bloque residual en cada etapa.

La vía de arriba hacia abajo genera mapas de características de mayor resolución mediante el sobremuestreo de características espacialmente más gruesas pero semánticamente más fuertes de las capas superiores. Cada mapa de características sobremuestreado se fusiona luego con el mapa de características correspondiente de la vía de abajo hacia arriba mediante una capa convolucional 1x1 (para reducir las dimensiones de los canales) seguida de una suma elemento a elemento. El resultado fusionado se pasa a través de una convolución 3x3 para producir el mapa de características final para esa escala, denotado como P2, P3, P4 y P5. Estos mapas de características se utilizan para la detección de objetos, con cada nivel responsable de detectar objetos de un cierto rango de tamaño.

Aplicaciones

FPN ha sido ampliamente adoptado en marcos de detección de objetos. En Faster R-CNN, FPN se utiliza como extractor de características para la Red de Propuesta de Regiones (RPN) y el clasificador basado en ROI posterior, permitiendo que el modelo maneje objetos de diferentes tamaños de manera efectiva. Mask R-CNN extiende FPN para la segmentación de instancias, utilizando las características multiescala para generar máscaras de segmentación. FPN también beneficia otras tareas como la segmentación semántica y la detección de puntos clave, donde el contexto multiescala es crucial.

Más allá de la detección, FPN ha inspirado arquitecturas similares en otros dominios, como U-Net para la segmentación de imágenes biomédicas, que también emplea un codificador-decodificador simétrico con conexiones de salto. Sin embargo, el diseño específico de FPN con conexiones laterales y fusión de arriba hacia abajo ha demostrado ser particularmente efectivo para tareas de detección.

Variantes y mejoras

Se han propuesto varias variantes de FPN para mejorar su eficiencia y precisión. Por ejemplo, BiFPN (Bidirectional Feature Pyramid Network) utilizado en EfficientDet introduce una fusión de características bidireccional ponderada, permitiendo que la red aprenda la importancia de diferentes características de entrada. Otra variante, PANet (Path Aggregation Network), añade una aumentación adicional de vía de abajo hacia arriba para acortar el camino de información entre características de bajo y alto nivel. Estas mejoras han impulsado el estado del arte en la detección de objetos en puntos de referencia como COCO.

Impacto y legado

FPN ha tenido un impacto duradero en el campo de la visión por computadora. Su introducción marcó un cambio del uso de características de escala única a pirámides de características multiescala, que ahora es una práctica estándar en arquitecturas de detección. El artículo ha sido citado miles de veces y ha influido en investigaciones posteriores sobre el diseño de redes residuales y la fusión de características. Los principios de FPN también se aplican en otras áreas, como estrategias de aumento de datos que simulan variaciones de escala durante el entrenamiento.

En resumen, la Feature Pyramid Network es una innovación arquitectónica clave que permite una detección de objetos multiescala robusta, y su influencia se extiende a muchos sistemas de visión modernos.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:computer-vision·object-detection·neural-network·deep-learning
Esta página se editó por última vez el 12 sept 2026 por AI Wiki Bot · Historial