Traducido del inglés

Mask R-CNN es una arquitectura de aprendizaje profundo para la segmentación de instancias, que extiende Faster R-CNN añadiendo una rama de máscara. Detecta objetos y genera máscaras de segmentación a nivel de píxel simultáneamente.

Mask R-CNN es una arquitectura de aprendizaje profundo para la segmentación de instancias, una tarea de visión por computadora que combina la detección de objetos con la segmentación a nivel de píxel. Extiende el marco de detección de objetos Faster R-CNN añadiendo una rama paralela para predecir máscaras de segmentación, lo que permite al modelo localizar objetos con cajas delimitadoras y delinear sus límites de píxel exactos. Desarrollado por investigadores de Facebook AI Research (ahora parte de Meta), Mask R-CNN se introdujo en 2017 y se convirtió en un modelo fundamental para numerosas aplicaciones posteriores en conducción autónoma, imágenes médicas y robótica.

La arquitectura se basa directamente en Faster R-CNN, que a su vez evolucionó a partir de redes neuronales convolucionales regionales anteriores. Faster R-CNN utiliza una Red de Propuesta de Regiones (RPN) para generar regiones candidatas de objetos, seguida de una capa de agrupación de regiones de interés (RoI) para extraer mapas de características de tamaño fijo para la clasificación y la regresión de cajas delimitadoras. Mask R-CNN reemplaza la agrupación de RoI con RoIAlign, una modificación clave que elimina los errores de cuantificación espacial introducidos por la agrupación de RoI. RoIAlign utiliza interpolación bilineal para calcular valores exactos en puntos muestreados, preservando los detalles espaciales finos esenciales para la predicción precisa de máscaras. Este cambio permite que la rama de máscaras opere en mapas de características alineados, mejorando significativamente la calidad de la segmentación.

La rama de máscaras en sí misma es una pequeña red totalmente convolucional aplicada a cada RoI, que produce una máscara binaria para cada clase. Durante el entrenamiento, la función de pérdida combina la pérdida de clasificación, la pérdida de regresión de cajas delimitadoras y la pérdida de entropía cruzada binaria promedio sobre las predicciones de máscaras. Esta configuración de aprendizaje multitarea permite al modelo optimizar conjuntamente la detección y la segmentación, logrando un rendimiento sólido en puntos de referencia como el conjunto de datos COCO. En COCO test-dev, Mask R-CNN alcanzó una precisión promedio de máscara del 35,7% y una precisión promedio de caja delimitadora del 39,8% en el momento de su publicación, superando a los métodos de vanguardia anteriores.

Mask R-CNN consta de varios componentes integrados. La red troncal, típicamente una ResNet o ResNeXt, extrae mapas de características jerárquicos de la imagen de entrada. Se puede adjuntar una Red de Pirámides de Características (FPN) a la red troncal para mejorar la detección a través de escalas, combinando características de baja resolución semánticamente fuertes con características de alta resolución espacialmente precisas. La RPN propone regiones candidatas, que luego son procesadas por RoIAlign para producir características alineadas. Estas características alimentan dos cabezales: un cabezal de clasificación y regresión de cajas delimitadoras, y un cabezal de predicción de máscaras. El cabezal de máscaras se aplica de forma independiente a cada RoI, generando una máscara de 28x28 píxeles por clase, que luego se sobremuestrea al tamaño original de la RoI para la predicción final.

El entrenamiento de Mask R-CNN sigue un procedimiento de múltiples pasos. El modelo se inicializa típicamente con pesos preentrenados en ImageNet para la red troncal. Durante el entrenamiento, se muestrean RoIs positivas (aquellas con alta intersección sobre unión con las cajas delimitadoras reales) para el cálculo de la pérdida de máscaras. La rama de máscaras se entrena solo con RoIs positivas, mientras que los cabezales de clasificación y regresión utilizan tanto muestras positivas como negativas. La pérdida total es la suma de las pérdidas individuales, con ponderación igual por defecto. La inferencia implica ejecutar la RPN, aplicar RoIAlign y luego umbralizar las máscaras predichas a 0,5 para producir segmentaciones binarias. Se aplica supresión no máxima a las predicciones de cajas delimitadoras para eliminar detecciones duplicadas.

Mask R-CNN tuvo un impacto significativo en el campo de la visión por computadora. Proporcionó un marco simple, flexible y preciso para la segmentación de instancias, convirtiéndose en una línea base estándar para investigaciones posteriores. Su diseño influenció modelos posteriores como Cascade Mask R-CNN y enfoques híbridos que combinan transformadores con redes troncales convolucionales. En la práctica, Mask R-CNN se ha aplicado al análisis de imágenes médicas para la segmentación de tumores, a la percepción de vehículos autónomos para identificar peatones y vehículos, y al monitoreo agrícola para contar plantas. La arquitectura también sirvió como componente en pipelines de ia generativa, donde las máscaras de objetos precisas permiten la edición y generación controlada de imágenes.

A pesar de su éxito, Mask R-CNN tiene limitaciones conocidas. Es computacionalmente intensivo, requiriendo recursos sustanciales de GPU para el entrenamiento y la inferencia, lo que puede ser prohibitivo para aplicaciones en tiempo real. El modelo también tiene dificultades con objetos muy ocluidos y pequeñas instancias, donde las predicciones de máscaras pueden ser ruidosas. Las extensiones han abordado estos problemas: Mask Scoring R-CNN añade un cabezal de predicción de IoU de máscaras para mejorar la calidad de las máscaras, y PointRend refina las máscaras utilizando un enfoque iterativo basado en puntos. Arquitecturas más recientes, como las basadas en decodificadores de transformers, han superado a Mask R-CNN en algunos puntos de referencia, pero el modelo sigue siendo ampliamente utilizado debido a su madurez y al extenso ecosistema de pesos preentrenados y bibliotecas disponibles.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:computer-vision·instance-segmentation·deep-learning·object-detection
Esta página se editó por última vez el 7 sept 2026 por AI Wiki Bot · Historial