Mask R-CNN es un modelo de aprendizaje profundo diseñado para la segmentación de instancias, una tarea de visión por computadora que identifica y delimita cada instancia de objeto en una imagen a nivel de píxel. Extiende el marco de detección de objetos Faster R-CNN añadiendo una rama paralela para predecir máscaras de segmentación, lo que permite la detección simultánea de objetos y una localización espacial precisa. Introducido en 2017 por investigadores de Facebook AI Research (ahora parte de Meta), el modelo logró resultados de última generación en el conjunto de datos COCO y se convirtió en una arquitectura fundamental para muchos modelos de segmentación posteriores.
A diferencia de la segmentación semántica, que clasifica cada píxel en una categoría sin distinguir objetos individuales, la segmentación de instancias requiere separar objetos superpuestos o adyacentes de la misma clase. Mask R-CNN aborda esto combinando una red de propuesta de regiones (RPN) con una cabeza de predicción de máscaras. La RPN genera cajas delimitadoras candidatas para objetos, mientras que la rama de máscaras produce una máscara binaria para cada región de interés (RoI), utilizando una técnica llamada RoIAlign para preservar la alineación espacial.
Arquitectura
La arquitectura se basa en Faster R-CNN, que a su vez extiende la familia de detectores de objetos de redes neuronales. Faster R-CNN utiliza una columna vertebral convolucional (como ResNet) para extraer mapas de características, una RPN para proponer regiones y un clasificador para predecir clases de objetos y refinar las cajas delimitadoras. Mask R-CNN añade una tercera rama que opera en paralelo con las cabezas de clasificación y regresión de cajas. Esta rama de máscaras es una red totalmente convolucional que predice una máscara binaria para cada RoI, típicamente a una resolución de 28×28 píxeles, que luego se amplía al tamaño de la imagen original.
Una innovación clave es RoIAlign, que reemplaza la operación RoIPool utilizada en Faster R-CNN. RoIPool cuantiza los límites de la RoI, causando desalineación entre las características extraídas y la imagen original. RoIAlign evita la cuantización mediante interpolación bilineal, preservando información espacial precisa. Esta mejora es crítica para la predicción de máscaras con precisión de píxel, ya que incluso pequeñas desalineaciones degradan la calidad de la segmentación.
Entrenamiento y pérdida
El modelo se entrena de extremo a extremo con una función de pérdida multitarea que combina tres componentes: pérdida de clasificación (entropía cruzada), pérdida de regresión de cajas delimitadoras (L1 suave) y pérdida de máscara (entropía cruzada binaria por píxel). La rama de máscaras se entrena solo en RoIs positivas (aquellas que contienen un objeto), y cada RoI se asigna a una clase de verdad fundamental específica, por lo que la predicción de máscara es específica de clase. Durante la inferencia, la rama de máscaras se ejecuta para cada objeto detectado, y la salida final incluye etiquetas de clase, cajas delimitadoras y máscaras.
El entrenamiento típicamente utiliza descenso de gradiente estocástico con momento, inicializado con pesos preentrenados en ImageNet. En el conjunto de datos COCO, Mask R-CNN logró una precisión promedio (AP) de máscara del 35.7% con una columna vertebral ResNet-101, superando métodos anteriores como FCIS y el predecesor de Mask R-CNN, que dependían de un postprocesamiento más complejo. El modelo también demostró un rendimiento sólido en otros puntos de referencia, incluidos Cityscapes y tareas de segmentación a nivel de instancia en imágenes médicas.
Aplicaciones
La segmentación de instancias tiene amplias aplicaciones en diversos campos. En la conducción autónoma, Mask R-CNN ayuda a identificar y separar peatones, vehículos y obstáculos en la carretera, mejorando los sistemas de percepción para empresas como Waymo y Tesla. En imágenes médicas, segmenta tumores, células u órganos a partir de escaneos, ayudando en diagnósticos y planificación quirúrgica. En robótica, permite la manipulación precisa de objetos al proporcionar límites de objetos a nivel de píxel. Otros usos incluyen análisis de imágenes satelitales, monitoreo agrícola y realidad aumentada, donde contornos precisos de objetos mejoran la comprensión de la escena.
La flexibilidad del modelo también se extiende a la segmentación de instancias en video, donde se añade consistencia temporal, y a la segmentación panóptica, que combina segmentación de instancias y semántica en una salida unificada. Variantes como Mask R-CNN con redes de pirámides de características (FPN) mejoran la precisión en objetos pequeños, y columnas vertebrales ligeras como MobileNet permiten el despliegue en dispositivos de borde.
Impacto y legado
Mask R-CNN estableció un nuevo estándar para la segmentación de instancias, influyendo en arquitecturas posteriores como Cascade Mask R-CNN, Hybrid Task Cascade y los modelos basados en transformadores DETR y Mask2Former. Su implementación de código abierto en el marco Detectron2 (lanzado por Meta AI en 2019) aceleró la adopción en investigación e industria. Los principios de diseño del modelo - aprendizaje multitarea, RoIAlign y cabezas de predicción paralelas - han sido ampliamente reutilizados en otras tareas de visión, incluida la detección de puntos clave y la segmentación panóptica.
A pesar del auge de los modelos de transformadores de extremo a extremo, Mask R-CNN sigue siendo una línea base robusta debido a su eficiencia y precisión. A partir de 2024, todavía se utiliza en sistemas de producción donde los recursos computacionales son limitados, y sus conceptos se enseñan en cursos estándar de visión por computadora. El artículo "Mask R-CNN" de Kaiming He, Georgia Gkioxari, Piotr Dollár y Ross Girshick, publicado en ICCV 2017, ha recibido miles de citas, reflejando su influencia duradera en el campo.
Limitaciones
Mask R-CNN tiene limitaciones conocidas. Es más lento que los detectores más simples debido a su arquitectura de dos etapas, lo que hace que las aplicaciones en tiempo real sean desafiantes sin aceleración de hardware. La resolución de la máscara está fijada en 28×28, lo que puede perder detalles finos para objetos grandes. También tiene dificultades con instancias altamente superpuestas, donde la RPN puede fusionar propuestas. El entrenamiento requiere grandes conjuntos de datos anotados con máscaras a nivel de píxel, que son costosos de producir. Además, el modelo es sensible al cambio de dominio, rindiendo mal en imágenes fuera de su distribución de entrenamiento, un problema común en sistemas de aprendizaje automático.
La investigación ha abordado algunos de estos problemas, como el uso de máscaras de mayor resolución o mecanismos de atención, pero persisten los compromisos entre velocidad y precisión. Para muchos escenarios prácticos, Mask R-CNN sigue siendo una opción confiable, equilibrando precisión con costo computacional moderado.