A subtração de fundo é uma técnica fundamental em visão computacional e processamento de vídeo que separa objetos em movimento do primeiro plano de um fundo relativamente estático em uma sequência de quadros. A ideia central é construir um modelo estatístico ou heurístico da cena de fundo e, então, classificar cada pixel em um novo quadro como pertencente ao fundo (se ele corresponder ao modelo) ou ao primeiro plano (se ele se desviar significativamente). Esse método sustenta muitas aplicações, incluindo vigilância por vídeo, monitoramento de tráfego, interação humano-computador e rastreamento de objetos, nas quais o objetivo é identificar regiões de interesse sem conhecimento prévio da aparência dos objetos.
A abordagem pressupõe que a câmera esteja estacionária e que o fundo seja, em sua maioria, inalterado ao longo do tempo, embora variações como mudanças graduais de iluminação, ruído da câmera e pequenos movimentos repetitivos (por exemplo, folhas de árvores balançando) devam ser tratadas. A subtração de fundo é distinta de métodos de segmentação mais recentes baseados em Deep learning, pois normalmente opera em estatísticas por pixel em vez de características semânticas aprendidas, o que a torna computacionalmente eficiente e adequada para sistemas em tempo real em hardware embarcado.
Desenvolvimento Histórico
As origens da subtração de fundo remontam às décadas de 1970 e 1980, quando os primeiros sistemas de análise de vídeo usavam diferenciação simples de quadros, subtraindo quadros consecutivos para detectar mudanças. Um avanço marcante ocorreu em 1997 com o trabalho de Chris Stauffer e W.E.L. Grimson no MIT Computer Science and Artificial Intelligence Laboratory, que modelaram cada pixel como uma combinação de distribuições gaussianas. Essa abordagem adaptativa conseguia lidar com fundos multimodais, como monitores piscando ou superfícies de água, e tornou-se o padrão de fato por mais de uma década.
Refinamentos subsequentes incluíram o algoritmo de codebook de Kim et al. (2004), que comprimia amostras de fundo em codewords para eficiência de memória, e o método ViBe (Visual Background Extractor) introduzido por Olivier Barnich e Marc Van Droogenbroeck em 2011, que usava um mecanismo aleatório para atualizar amostras de fundo, alcançando alta velocidade com baixo custo computacional. Na década de 2010, a pesquisa mudou o foco para integrar características de cor, textura e bordas, a fim de melhorar a robustez contra sombras e mudanças de iluminação.
Técnicas Principais
Um pipeline simples de subtração de fundo começa com a inicialização do fundo, na qual os primeiros N quadros são usados para estimar o modelo inicial. A forma mais básica é a média móvel, em que o valor de fundo de cada pixel é atualizado como B_t = (1 - alpha) B_{t-1} + alpha I_t, sendo alpha uma taxa de aprendizado. A detecção do primeiro plano então aplica um limite: se |I_t - B_t| > T, o pixel é marcado como primeiro plano. Isso funciona bem em ambientes controlados, mas falha em condições dinâmicas.
Métodos mais sofisticados incluem o modelo de mistura gaussiana (GMM), que mantém K distribuições gaussianas por pixel, cada uma com um peso, média e variância. Um pixel é classificado como fundo se corresponder a alguma distribuição dentro de certo número de desvios padrão. Os parâmetros são atualizados online usando um procedimento semelhante à maximização de expectativa. Outra abordagem popular é a estimativa de densidade por kernel não paramétrica, que usa um histograma de valores recentes de pixel para estimar a densidade de probabilidade, permitindo distribuições de fundo arbitrárias sem assumir uma forma paramétrica específica.
Desafios e Abordagens Modernas
Cenas do mundo real apresentam vários desafios, levando a mudanças súbitas de iluminação (por exemplo, nuvens passando), além de sombras lançadas por objetos em primeiro plano, tremor de câmera e objetos de fundo que começam a se mover (por exemplo, um carro estacionado que sai dirigindo. As sombras são particularmente problemáticas porque compartilham a mesma textura do fundo, mas têm luminância menor. Muitos algoritmos incorporam espaços de cor como HSV para separar crominância de luminância, ou usam características baseadas em gradientes para distinguir sombras do primeiro plano verdadeiro.
Desde meados de 2010, abordagens de Machine learning e Neural network ganharam destaque. Redes neurais convolucionais, especialmente variantes da arquitetura U-Net , foram treinadas em conjuntos de dados rotulados como CDnet 2014 para realizar segmentação de primeiro plano em nível de pixel. Esses métodos aprendem a suprimir sombras e a lidar com fundos dinâmicos de forma mais eficaz que as técnicas clássicas, mas exigem grandes conjuntos de dados anotados e recursos computacionais significativos. Sistemas híbridos costumam combinar um método clássico rápido para a detecção inicial com um modelo profundo para refino, equilibrando velocidade e precisão.
Aplicações
A subtração de fundo é amplamente utilizada em sistemas de segurança e vigilância, nos quais detecta intrusos ou objetos abandonados em feeds de câmeras fixas. No gerenciamento de tráfego, conta veículos e estima velocidades em rodovias. Na análise de movimento humano , para reconhecimento de marcha ou controle por gestos, como visto nos primeiros sistemas interativos. Essa técnica também aparece em imagens médicas para subtrair imagens pré-contraste das pós-contraste, e em astronomia para remover um céu poderia estático das imagens de telescópio.
Em ambientes industriais, a subtração de fundo permite inspeção de qualidade em linhas de montagem, detectando defeitos ou objetos estranhos em uma esteira transportadora. Com o avanço da computação de extremidade, implementações em dispositivos de baixo consumo de energia, como os da ARM ou Qualcomm , permitem processamento em tempo real em drones e câmeras inteligentes, ampliando o alcance da técnica além dos sistemas tradicionais baseados em hospedados.
Avaliação e Conjuntos de Dados
A comparação de algoritmos é fundamental para a padronização de benchmarks. Os conjuntos de dados CDnet 2012 e CDnet 2014, criados pela Universidade de Montreal, fornecem um conjunto diversificado de sequências de vídeo com anotações de terreno real em nível de pixel , cobrindo categorias como linha de base, fundo dinâmico, movimento intermitente e sombra. As métricas incluem precisão, recall, F-measure e a porcentagem de classificação correta. A edição de 2012 introduziu categorias 11 e 53 vídeos, tornando-se o padrão para a avaliação acadêmica.
Trabalhos mais recentes, como o conjunto de dados LASIESTA, adicionam cenários sintéticos e reais com dificuldade variada. Embora os modelos de aprendizado profundo alcancem medidas F maiores nesses , os métodos clássicos permanecem competitivos em velocidade e são preferidos quando há escassos de dados de treinamento ou quando a interpretação é necessária. A escolha do algoritmo depende, em última análise, das restrições específicas de cada aplicação, incluindo limites de hardware, requisitos de tempo real e a variabilidade esperada da cena.
Decisiones Adicionais
- Data Augmentation
- Residual Network (ResNet)
- Computer vision (nota: não listado na lista de slugs fornecida, portanto omitido)
- Machine learning