Uma rede de propostas de regiões (RPN, do inglês region proposal network) é um tipo de rede neural usada na detecção de objetos para gerar regiões candidatas, ou caixas delimitadoras, que provavelmente contêm objetos. Foi introduzida em 2015 por Shaoqing Ren, Kaiming He, Ross Girshick e Jian Sun como parte da arquitetura Faster R-CNN, que unificou a geração de propostas de regiões e a classificação de objetos em um único modelo treinável de ponta a ponta. A RPN substituiu métodos tradicionais de propostas de regiões, como a busca seletiva, melhorando significativamente tanto a velocidade quanto a precisão nos pipelines de detecção.
A RPN opera sobre um mapa de características produzido por uma rede convolucional de backbone (como VGG-16 ou ResNet). Ela desliza uma pequena rede sobre o mapa de características e, em cada posição da janela deslizante, prevê múltiplas propostas de regiões usando um conjunto de caixas âncora de diferentes escalas e proporções de aspecto. A saída inclui pontuações de objetividade (indicando se uma região contém um objeto) e coordenadas refinadas das caixas delimitadoras. Essas propostas são então passadas para um classificador downstream e um regressor de caixas delimitadoras para a detecção final.
Arquitetura e Mecanismo
A RPN é uma rede totalmente convolucional. Ela recebe um mapa de características de entrada de tamanho H x W x C e aplica uma camada convolucional 3x3 seguida por duas camadas convolucionais 1x1 irmãs: uma para classificação (objeto vs. fundo) e outra para regressão (deslocamentos das caixas delimitadoras). Em cada localização espacial, a rede processa k caixas âncora, onde k é tipicamente 9 (três escalas e três proporções de aspecto). A camada de classificação produz 2k pontuações, e a camada de regressão produz 4k coordenadas. Durante o treinamento, as âncoras são rotuladas como positivas se tiverem uma sobreposição de interseção sobre união (IoU) maior que 0,7 com qualquer caixa de verdade básica, ou se tiverem a maior IoU com uma caixa de verdade básica. Âncoras com IoU abaixo de 0,3 são rotuladas como negativas. A função de perda combina perda de entropia cruzada para classificação e perda L1 suave para regressão.
Treinamento e Integração com Faster R-CNN
No Faster R-CNN, a RPN é treinada conjuntamente com a rede de detecção usando uma perda de múltiplas tarefas. O treinamento alterna entre otimizar a RPN e o detector Fast R-CNN, ou pode ser feito de ponta a ponta via retropropagação. A RPN compartilha características convolucionais com o detector, o que reduz a computação redundante. As propostas geradas pela RPN são usadas como entrada para uma camada de pooling de região de interesse (RoI), que extrai mapas de características de tamanho fixo para cada proposta, seguida por camadas totalmente conectadas para classificação e refinamento das caixas delimitadoras. Esse design permitiu que o Faster R-CNN operasse em velocidades quase em tempo real (cerca de 5-17 quadros por segundo em uma GPU) enquanto alcançava precisão de ponta em benchmarks como PASCAL VOC e MS COCO.
Impacto e Evolução
Desde sua introdução, a RPN se tornou um componente fundamental em muitas arquiteturas de detecção de objetos. Ela influenciou modelos posteriores, como Mask R-CNN (para segmentação de instâncias), FPN (Feature Pyramid Network), que aprimora a RPN com mapas de características multiescala, e detectores de um estágio, como RetinaNet, que incorporam previsão baseada em âncoras. O conceito de caixas âncora e geração de propostas de regiões também foi adaptado em outros domínios, incluindo aplicações de inteligência artificial como direção autônoma e imagem médica. A capacidade da RPN de gerar propostas de alta qualidade com sobrecarga computacional mínima a tornou uma inovação chave na era do aprendizado profundo em visão computacional.
Limitações e Alternativas
Apesar de seu sucesso, a RPN tem limitações. O uso de caixas âncora predefinidas requer ajuste cuidadoso de escalas e proporções de aspecto, o que pode ser subótimo para objetos com formas incomuns. Métodos baseados em âncoras também geram um grande número de propostas, muitas das quais redundantes, levando a ineficiência computacional. Para abordar essas questões, detectores sem âncoras, como CornerNet e CenterNet, foram propostos, que preveem pontos-chave ou centros diretamente sem âncoras. No entanto, a RPN continua amplamente utilizada devido à sua simplicidade e eficácia, e permanece um componente padrão em muitos frameworks modernos de detecção.
Ver Também
- Aprendizado profundo
- Aprendizado de máquina
- Rede neural convolucional (se disponível, mas não na lista, então use rede neural)
- Visão computacional (não na lista, então omita)
Nota: O artigo usa links internos para slugs disponíveis. Como a lista fornecida não inclui 'computer-vision' nem 'convolutional-neural-network', os links são limitados aos disponíveis.