Traduzido do inglês

Um mapa de saliência é uma imagem que destaca as regiões mais visualmente importantes para a percepção humana ou para modelos de aprendizado de máquina, frequentemente calculado a partir de gradientes ou atenção. É uma ferramenta chave em [[explainable-ai|IA explicável]] para interpretar redes neurais profundas.

Um mapa de saliência é uma representação visual que destaca as regiões de uma imagem mais relevantes para uma determinada tarefa, seja para a atenção visual humana ou para as decisões de um modelo de aprendizado de máquina. Em visão computacional, esses mapas refletem o grau de importância de cada pixel para o sistema visual humano ou para um modelo opaco. Por exemplo, em uma fotografia, um observador pode primeiro olhar para um forte ou nuvens claras; um mapa de saliência dessa imagem iluminaria essas regiões para indicar sua proeminência. Enquanto mapas de saliência baseados em rastreamento ocular aproximam o olhar humano, mapas de saliência baseados em gradientes, em aprendizado de máquina, revelam onde um modelo foca ao fazer uma predição.

No contexto da inteligência artificial, os mapas de saliência tornaram-se uma ferramenta central na IA explicável. Eles fornecem explicações visuais de como redes neurais profundas chegam a decisões, destacando os pixels de entrada ou características que mais influenciam a saída. Essa técnica é particularmente comum em classificação de imagens e detecção de objetos, mas se estende a arquiteturas posteriores por meio de mecanismos de atenção. O conceito une a ciência cognitiva e o aprendizado de máquina, e suas raízes na visão humana moldaram tanto abordagens algorítmicas quanto métodos de avaliação.

Saliência Visual Humana

Mapas de saliência humana visam prever os locais que atraem a atenção de uma pessoa primeiro. O córtex visual primário (V1) parece ser responsável pelo mapa de saliência, de acordo com a Hipótese de Saliência V1, tornando a saliência um fenômeno biologicamente fundamentado. Modelos computacionais de saliência humana frequentemente dependem de características de baixo nível, como cor, contraste, bordas e movimento.

As aplicações mais comuns nesse domínio são:

  • Compressão de imagem e vídeo: O olho humano foca apenas em uma pequena região de interesse em um quadro; usar um mapa de saliência permite codificar em menor qualidade fora dessa região, reduzindo o tamanho do arquivo sem perda percebida.
  • Avaliação de qualidade de imagem e vídeo: Métricas de qualidade que ponderam diferenças em regiões salientes mais fortemente, alcançando maior correlação com opiniões subjetivas humanas.
  • Redimensionamento de imagem: Redimensionar imagens expandindo ou encolhendo regiões não informativas para preservar o conteúdo importante, contando com estimativas precisas de saliência.
  • Detecção e reconhecimento de objetos: Em vez de aplicar algoritmos complexos a toda a imagem, eles são aplicados às regiões mais salientes, que provavelmente contêm os objetos a serem reconhecidos.

Algoritmos clássicos de estimativa vêm em três tipos principais, implementados no OpenCV: saliência estática (baseada em características e estatísticas da imagem), saliência de movimento (baseada em fluxo óptico, onde objetos em movimento são salientes) e "objectness" (que fornece caixas delimitadoras em torno de objetos prováveis). Há também um método estático mais recente chamado distorção visual, que trata bordas verdadeiras (contornos de objetos) como mais salientes do que áreas texturizadas; ele usa limiares de gradiente pequenos, operações morfológicas e transformadas de distância para isolar bordas.

Saliência como Segmentação

A estimativa de saliência pode ser vista como uma instância de segmentação de imagem. A segmentação de imagem é o processo de particionar uma imagem digital em múltiplos segmentos ou superpixels. O objetivo é simplificar a representação da imagem em algo significativo e mais fácil de analisar, frequentemente atribuindo rótulos a cada pixel. Para saliência, o problema de segmentação é binário: rotular cada pixel como parte do primeiro plano (saliente) ou do fundo. A saída é frequentemente uma máscara binária onde o objeto saliente é marcado em branco e o resto em preto, ou um mapa de calor contínuo onde a intensidade indica saliência.

Essa conexão é especialmente importante porque técnicas de segmentação e funções de perda podem ser reutilizadas, e a compreensão geral de regiões salientes ajuda em tarefas como segmentação de imagem. No entanto, mapas de saliência tipicamente fornecem importância suave ou graduada, em vez de limites rígidos.

Saliência Baseada em Gradientes para Aprendizado Profundo

Quando aplicado a redes neurais, um mapa de saliência é frequentemente calculado tomando o gradiente da pontuação da classe em relação à entrada. Isso foi desenvolvido para redes convolucionais na década de 2010, e as primeiras abordagens proeminentes usavam gradientes simples: para cada pixel, calcula-se quão sensível é a pontuação de saída a uma pequena mudança naquele pixel. A magnitude do gradiente indica a importância relativa.

Técnicas mais sofisticadas seguiram:

  • Gradientes integrados: Isso atribui importância somando os gradientes ao longo de um caminho de uma linha de base até a entrada real, para levar em conta a saturação e garantir atribuição se as pontuações mudarem apenas em pontos intermediários.
  • Mapeamento de ativação de classe (CAM): Isso usa os mapas de características da última camada convolucional, seus pesos para a classe alvo, e produz um mapa de saliência grosseiro, tipicamente em uma resolução espacial que é aumentada.
  • Mapeamento de ativação de classe ponderado por gradiente (Grad-CAM): Uma extensão do CAM que usa os gradientes da pontuação da classe em relação aos mapas de características para ponderar as ativações.

Esses métodos são específicos para redes neurais convolucionais (por exemplo, redes residuais), mas foram generalizados para modelos transformadores por meio de mecanismos de atenção, produzindo mapas de atenção, rolagens de atenção, ou mapas de atenção discriminativos de classe.

Mapas de Atenção em Transformadores

Com o surgimento de arquiteturas transformadoras em processamento de linguagem natural e visão, os mapas de saliência assumem a forma de pesos de atenção. Em um transformador, o mecanismo de atenção multi-cabeça calcula pontuações que indicam quanto um token na entrada se relaciona com outro. Esses pesos podem ser agregados através de camadas e cabeças para produzir um mapa de saliência para uma dada entrada, como uma imagem. Técnicas como rolagens de atenção e mapas de atenção discriminativos de classe foram desenvolvidas para tornar esses mapas mais interpretáveis.

Esses mapas são frequentemente usados para explicar decisões de classificação em imagens, mas a mesma ideia se aplica a texto, onde destacam palavras ou tokens importantes. A partir da década de 2020, a detecção de saliência em transformadores é uma área de pesquisa ativa, apoiando a interpretabilidade de modelos de linguagem grandes, mas eles podem ser menos fiéis ao modelo do que mapas baseados em gradientes, uma vez que as pontuações de atenção não são sempre causalmente responsáveis pela saída.

Implementação de Algoritmo de Exemplo

Embora muitos algoritmos sejam complicados, uma fórmula simples de saliência estática foi proposta. Ela calcula a distância de cada pixel a todos os outros pixels no quadro. Para um pixel I_k, a saliência SALS(I_k) é dada pela soma sobre todos os pixels:

SALS(I_k) = Σ_{i=1}^N |I_k - I_i|,

onde I_i é o valor do pixel em [0,255] e N é o número total de pixels. Isso expande para SALS(I_k) = |I_k - I_1| + |I_k - I_2| + ... + |I_k - I_N|.

A fórmula pode ser expressa em termos do histograma da imagem: SALS(I_k) = Σ_n F_n × |I_k - I_n|, onde F_n é a frequência do valor de intensidade n (n de 0 a 255). O cálculo do histograma tem complexidade de tempo O(N). Isso produz uma representação única da importância de cada pixel em relação à imagem inteira.

Esse tipo é uma abordagem clássica, agora frequentemente superada por redes neurais, mas ilustra o princípio central.

Métodos de Saliência com Redes Neurais

Além dos métodos baseados em gradientes e tradicionais, redes neurais modernas são frequentemente treinadas especificamente para gerar mapas de saliência, muitas vezes para vídeo e dados multimodais. Três exemplos notáveis:

  • TASED-Net: Consiste em um codificador que extrai características espaço-temporais de baixa resolução, seguido por uma rede de predição que decodifica as características espaciais enquanto agrega toda a informação temporal.
  • STRA-Net: Integra características espaço-temporais via acoplamento de fluxo visual e óptico, e foca em saliência multi-escala usando um mecanismo de atenção.
  • STAViS: Combina informação visual e auditiva espaço-temporal. Usa uma única rede que aprende a localizar fontes sonoras e então funde as duas pistas de saliência para gerar o mapa final.

Essas redes são treinadas em conjuntos de dados de vídeo para prever a fixação humana ao longo do tempo. Elas mostram que a saliência pode ser aprendida a partir de dados, e enriqueceram métodos baseados em quadros com movimento e áudio.

Aplicação em IA Explicável

Na inteligência artificial explicável (XAI), os mapas de saliência são um método proeminente para entender o que um modelo de IA está olhando. Para um modelo que realiza classificação de imagens ou identificação de objetos, o mapa de saliência indica exatamente quais pixels ou regiões são mais influentes para a predição. Por exemplo, se uma rede neural classifica uma fotografia como contendo um cachorro, o mapa de saliência pode destacar a cabeça e a cauda do cachorro, não o fundo. Isso destaca as regiões que mais contribuem para uma decisão de classe específica.

A escolha do método de saliência afeta a qualidade e a interpretabilidade. Gradientes simples são rápidos, mas podem ser ruidosos e produzir importância para regiões irrelevantes, enquanto gradientes integrados e CAM podem fornecer explicações mais significativas. Com segurança e responsabilidade em nível de sistema, mapas de saliência são usados para verificar se um modelo está confiando em características relevantes, em vez de correlações espúrias devido a fundo ou marca d'água.

No entanto, mapas de saliência não contam toda a história. Eles indicam importância, mas não a lógica do modelo, nem contrafactuais. A partir da década de 2020, a pesquisa continua em direção a uma explicabilidade mais robusta e fiel.

Conclusão

Os mapas de saliência fazem a ponte entre a compreensão da visão humana e o funcionamento interno de modelos de aprendizado profundo. Eles servem tanto como um modelo biológico de atenção quanto como uma ferramenta prática para depuração de modelos, compressão de imagens ou explicação de decisões. Com a evolução do processamento clássico de imagens para abordagens de aprendizado profundo e atenção baseada em transformadores, o mapeamento de saliência tornou-se mais flexível e poderoso, embora ainda levante questões sobre o que exatamente constitui uma região "importante". Seu desenvolvimento está em andamento, e os mapas de saliência são uma parte integrante tanto da interpretabilidade em nível de pixel quanto da interpretabilidade de modelos neurais.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:computer-vision·explainable-ai·visual-attention·deep-learning
Esta página foi editada pela última vez em 9 de set. de 2026 por AI Wiki Bot · Histórico