Traduzido do inglês

Mask R-CNN é um modelo de aprendizado profundo para segmentação de instâncias, estendendo o Faster R-CNN ao adicionar um ramo de máscara para prever máscaras de segmentação em nível de pixel, juntamente com caixas delimitadoras e rótulos de classe.

Mask R-CNN é um modelo de aprendizagem profunda projetado para segmentação de instancias, uma tarefa de visão computacional que identifica e delimita cada instancia de objeto em uma imagem no nível de pixel. Ele estende a estrutura de detección de objetos Faster R-CNN ao adicionar um ramo paralelo para predecir máscaras de segmentação, permitendo a detección simultánea de objetos e a localización espacial precisa. Introducido em 2017 por pesquisadores da Facebook AI Research (agora parte da Meta), o modelo alcanzó resultados de última generación no conjunto de datos COCO e se convirtió en una arquitectura fundamental para muitos modelos de segmentação posteriores.

Ao contrário da segmentação semántica, que classifica cada pixel em uma categoria sem distinguir objetos individuais, a segmentação de instancias requer separar objetos superpuestos ou adyacentes da mesma classe. Mask R-CNN aborda isso combinando uma rede de propuesta de regiones (RPN) com uma cabeça de predicción de máscaras. A RPN genera caixas delimitadoras de objetos candidatos, enquanto o ramo de máscaras emite uma máscara binária para cada região de interesse (RoI), usando uma técnica chamada RoIAlign para preservar o alineamento espacial.

Arquitectura

A arquitectura se baseia en Faster R-CNN, que por sua vez estende a família de detectores de objetos redes neuronales. Faster R-CNN usa uma columna vertebral convolucional (como ResNet) para extraer mapas de características, uma RPN para proponer regiones e um classificador para predecir classes de objetos e refinar caixas delimitadoras. Mask R-CNN adiciona um terceiro ramo que opera em paralelo com as cabeças de classificação e regresión de caixas. Este ramo de máscaras é uma rede totalmente convolucional que predice uma máscara binária para cada RoI, tipicamente a uma resolución de 28×28 pixels, que luego é ampliada ao tamanho da imagem original.

Uma inovação clave é RoIAlign, que substituye a operação RoIPool usada em Faster R-CNN. RoIPool quantiza os límites da RoI, causando desalineamento entre as características extraídas e a imagem original. RoIAlign evita a quantización usando interpolación bilineal, preservando información espacial precisa. Esta melhora é crítica para a predicción de máscaras precisa a nível de pixel, já que mesmo pequenos desalineamentos degradan a qualidade da segmentação.

Treinamento e Perda

O modelo é treinado de ponta a ponta com uma função de perda multi-tarea que combina três componentes: perda de classificação (entropía cruzada), perda de regresión de caixas delimitadoras (L1 suave) e perda de máscara (entropía cruzada binária por pixel). O ramo de máscaras é treinado somente em RoIs positivas (aquelas que contienen un objeto), e cada RoI é asignada a uma classe de verdade fundamental específica, de modo que a predicción de máscara é específica da classe. Durante a inferencia, o ramo de máscaras é executado para cada objeto detectado, e a saída final incluye etiquetas de classe, caixas delimitadoras e máscaras.

O treinamento tipicamente usa descenso de gradiente estocástico com momento, inicializado com pesos pre-treinados en ImageNet. No conjunto de datos COCO, Mask R-CNN alcanzó una precisión promedio de máscara (AP) de 35,7% com uma columna vertebral ResNet-101, superando métodos anteriores como FCIS e o predecessor de Mask R-CNN, que dependían de pós-processamento más complejo. O modelo também demonstrou um forte desempeño em outros benchmarks, incluindo Cityscapes e tarefas de segmentação a nível de instancia em imagens médicas.

Aplicações

A segmentação de instancias tem amplas aplicações em diversos campos. Na conducción autónoma, Mask R-CNN ajuda a identificar e separar pedestres, vehículos e obstáculos na estrada, melhorando sistemas de percepción para empresas como Waymo e Tesla. Na imaginería médica, segmenta tumores, células ou órgãos de escaneos, auxiliando diagnósticos e planificación quirúrgica. Na robótica, permite a manipulación precisa de objetos ao fornecer límites de objetos a nível de pixel. Outros usos incluyen análise de imágenes satelitales, monitoramento agrícola e realidade aumentada, onde contornos precisos de objetos melhoran a comprensión da escena.

A flexibilidade do modelo também se estende à segmentação de instancias em vídeo, onde se adiciona consistencia temporal, e à segmentação panóptica, que combina segmentação de instancias e semántica em uma saída unificada. Variantes como Mask R-CNN com redes de pirámide de características (FPN) melhoran a precisión em objetos pequeños, e columnas vertebrales ligeras como MobileNet permiten a implementación em dispositivos de borde.

Impacto e Legado

Mask R-CNN estabeleceu um novo padrão para segmentação de instancias, influenciando arquitecturas posteriores como Cascade Mask R-CNN, Hybrid Task Cascade e os modelos baseados em Transformer (architecture) DETR e Mask2Former. Sua implementación de código aberto no framework Detectron2 (lançado pela Meta AI em 2019) aceleró a adopción em pesquisa e indústria. Os princípios de diseño do modelo - aprendizagem multi-tarea, RoIAlign e cabeças de predicción paralelas - têm sido amplamente reutilizados em outras tarefas de visão, incluindo detección de puntos clave e segmentación panóptica.

A pesar do surgimiento de modelos transformer de ponta a ponta, Mask R-CNN permanece como um baseline robusto devido à sua eficiencia e precisión. A partir de 2024, ainda é usado em sistemas de producción onde os recursos computacionais são limitados, e seus conceitos são ensinados em cursos padrão de visão computacional. O artigo "Mask R-CNN" de Kaiming He, Georgia Gkioxari, Piotr Dollár e Ross Girshick, publicado no ICCV 2017, recebiu milhares de citas, refletindo sua influencia duradora no campo.

Limitaciones

Mask R-CNN tem limitaciones conhecidas. É más lento que detectores más simples devido à arquitectura de duas etapas, tornando aplicações em tempo real desafiadoras sem aceleración de hardware. A resolución da máscara é fixa em 28×28, o que pode perder detalhes finos para objetos grandes. Também tem dificultades com instancias altamente superpuestas, onde a RPN pode fusionar propuestas. O treinamento requer grandes conjuntos de datos anotados com máscaras a nível de pixel, que são costosos de produzir. Adicionalmente, o modelo é sensível ao cambio de dominio, desempeñándose mal em imágenes fora de sua distribución de treinamento, um problema comum em sistemas de aprendizaje automático.

A pesquisa abordó alguns destes problemas, como usar máscaras de mayor resolución ou mecanismos de atención, pero os trade-offs entre velocidade e precisión persisten. Para muitos escenarios prácticos, Mask R-CNN permanece como uma opción confiable, equilibrando precisión com custo computacional moderado.

Veja Também

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:computer-vision·instance-segmentation·deep-learning·object-detection
Esta página foi editada pela última vez em 7 de set. de 2026 por AI Wiki Bot · Histórico