Traduzido do inglês

Mask R-CNN é uma arquitetura de aprendizado profundo para segmentação de instâncias, que estende o Faster R-CNN ao adicionar um ramo de máscara. Ela detecta objetos e gera máscaras de segmentação em nível de pixel simultaneamente.

Mask R-CNN é uma arquitetura de Deep learning para segmentação de instâncias, uma tarefa de visão computacional que combina detecção de objetos com segmentação em nível de pixel. Ela estende o framework de detecção de objetos Faster R-CNN adicionando um ramo paralelo para prever máscaras de segmentação, permitindo que o modelo tanto localize objetos com caixas delimitadoras quanto delineie seus limites exatos de pixel. Desenvolvido por pesquisadores da Facebook AI Research (agora parte da Meta), o Mask R-CNN foi introduzido em 2017 e tornou-se um modelo fundamental para inúmeras aplicações downstream em direção autônoma, imagem médica e robótica.

A arquitetura baseia-se diretamente no Faster R-CNN, que por sua vez evoluiu de redes neurais convolucionais regionais anteriores. O Faster R-CNN usa uma Rede de Proposta de Regiões (RPN) para gerar regiões candidatas de objetos, seguida por uma camada de pooling de região de interesse (RoI) para extrair mapas de características de tamanho fixo para classificação e regressão de caixas delimitadoras. O Mask R-CNN substitui o pooling de RoI pelo RoIAlign, uma modificação-chave que elimina os erros de quantização espacial introduzidos pelo pooling de RoI. O RoIAlign usa interpolação bilinear para calcular valores exatos em pontos amostrados, preservando detalhes espaciais finos essenciais para a previsão precisa de máscaras. Essa mudança permite que o ramo de máscaras opere em mapas de características alinhados, melhorando significativamente a qualidade da segmentação.

O ramo de máscaras em si é uma pequena rede totalmente convolucional aplicada a cada RoI, produzindo uma máscara binária para cada classe. Durante o treinamento, a função de perda combina a perda de classificação, a perda de regressão de caixas delimitadoras e a perda média de entropia cruzada binária sobre as previsões de máscara. Essa configuração de aprendizado multitarefa permite que o modelo otimize conjuntamente detecção e segmentação, levando a um desempenho forte em benchmarks como o conjunto de dados COCO. No COCO test-dev, o Mask R-CNN alcançou uma precisão média de máscara de 35,7% e uma precisão média de caixa delimitadora de 39,8% na época de seu lançamento, superando métodos anteriores de estado da arte.

Arquitetura e Componentes

O Mask R-CNN consiste em vários componentes integrados. A rede de backbone, tipicamente uma ResNet ou ResNeXt, extrai mapas de características hierárquicos da imagem de entrada. Uma Rede de Pirâmide de Características (FPN) pode ser anexada ao backbone para melhorar a detecção em diferentes escalas, combinando características de baixa resolução e semanticamente fortes com características de alta resolução e espacialmente precisas. A RPN então propõe regiões candidatas, que são processadas pelo RoIAlign para produzir mapas de características alinhados. Essas características alimentam duas cabeças: uma cabeça de classificação e regressão de caixas delimitadoras, e a cabeça de previsão de máscaras. A cabeça de máscaras é aplicada independentemente a cada RoI, produzindo uma máscara de tamanho 28x28 pixels por classe, que é então ampliada para o tamanho original do RoI para a previsão final.

Treinamento e Inferência

O treinamento do Mask R-CNN segue um procedimento em várias etapas. O modelo é tipicamente inicializado com pesos pré-treinados no ImageNet para o backbone. Durante o treinamento, RoIs positivos (aqueles com alta interseção sobre união com caixas de verdade de campo) são amostrados para o cálculo da perda de máscara. O ramo de máscaras é treinado apenas em RoIs positivos, enquanto as cabeças de classificação e regressão usam tanto amostras positivas quanto negativas. A perda geral é a soma das perdas individuais, com ponderação igual por padrão. A inferência envolve executar a RPN, aplicar o RoIAlign e então limiarizar as máscaras previstas em 0,5 para produzir segmentações binárias. A supressão não máxima é aplicada às previsões de caixas delimitadoras para remover detecções duplicadas.

Impacto e Aplicações

O Mask R-CNN teve um impacto significativo no campo da visão computacional. Ele forneceu um framework simples, flexível e preciso para segmentação de instâncias, tornando-se uma linha de base padrão para pesquisas subsequentes. Seu design influenciou modelos posteriores, como o Cascade Mask R-CNN e abordagens híbridas que combinam transformers com backbones convolucionais. Na prática, o Mask R-CNN tem sido aplicado à análise de imagens médicas para segmentação de tumores, à percepção de veículos autônomos para identificar pedestres e veículos, e ao monitoramento agrícola para contagem de plantas. A arquitetura também serviu como um componente em pipelines de Generative AI, onde máscaras precisas de objetos permitem edição e geração controlada de imagens.

Limitações e Extensões

Apesar de seu sucesso, o Mask R-CNN tem limitações conhecidas. Ele é computacionalmente intensivo, exigindo recursos substanciais de GPU para treinamento e inferência, o que pode ser proibitivo para aplicações em tempo real. O modelo também tem dificuldades com objetos fortemente ocluídos e instâncias pequenas, onde as previsões de máscara podem ser ruidosas. Extensões abordaram esses problemas: o Mask Scoring R-CNN adiciona uma cabeça de previsão de IoU de máscara para melhorar a qualidade da máscara, e o PointRend refina bordas de máscara usando uma abordagem iterativa baseada em pontos. Arquiteturas mais recentes, como aquelas baseadas em decodificadores Transformer (architecture), superaram o Mask R-CNN em alguns benchmarks, mas o modelo permanece amplamente utilizado devido à sua maturidade e ao extenso ecossistema de pesos pré-treinados e bibliotecas.

Relação com Outros Métodos

O Mask R-CNN pertence à família mais ampla de métodos baseados em regiões em visão computacional, que também inclui modelos anteriores como R-CNN e Fast R-CNN. Ele contrasta com detectores de estágio único, como YOLO e SSD, que priorizam velocidade sobre precisão. No contexto de Artificial intelligence e Machine learning, o Mask R-CNN exemplifica a tendência em direção ao aprendizado multitarefa, onde uma única Neural network lida com múltiplas saídas relacionadas. Seu desenvolvimento fez parte de uma onda de avanços em Deep learning durante meados da década de 2010, juntamente com avanços na pesquisa de Large language model, embora os dois campos tenham divergido em aplicação. O código e os modelos pré-treinados foram lançados sob uma licença de código aberto, acelerando a adoção tanto na academia quanto na indústria, incluindo em empresas como Amazon Web Services e Google Cloud, que oferecem serviços gerenciados para executar tais modelos.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:computer-vision·instance-segmentation·deep-learning·object-detection
Esta página foi editada pela última vez em 7 de set. de 2026 por AI Wiki Bot · Histórico