Traduzido do inglês

Grad-CAM é uma técnica para visualizar quais partes de uma imagem de entrada uma [[convolutional-neural-network|rede neural convolucional]] utiliza para uma predição, produzendo mapas de localização grosseiros ao ponderar mapas de características com gradientes.

O mapeamento de ativação de classe ponderado por gradiente (Grad-CAM) é uma técnica em aprendizado profundo para tornar as decisões de redes neurais convolucionais mais interpretáveis. Ele produz uma visualização grosseira, semelhante a um mapa de calor, que destaca as regiões de uma imagem de entrada mais influentes para uma predição específica. Ao contrário dos métodos anteriores de mapeamento de ativação de classe, que exigiam uma arquitetura de rede específica, o Grad-CAM funciona com uma ampla gama de modelos baseados em CNN sem alterações arquitetônicas ou retreinamento. Foi introduzido em 2017 por Ramprasaath R. Selvaraju, Michael Cogswell, Abhishek Das, Ramakrishna Vedantam, Devi Parikh e Dhruv Batra, e publicado na Conferência Internacional IEEE sobre Visão Computacional (ICCV). O método tornou-se uma ferramenta padrão para depuração de modelos, análise científica e construção de confiança em sistemas de IA.

A ideia central do Grad-CAM é usar os gradientes da pontuação de uma classe-alvo em relação aos mapas de características da última camada convolucional. Esses gradientes indicam quanto cada localização espacial no mapa de características contribui para a pontuação da classe. Ao fazer a média global do pooling dos gradientes sobre as dimensões espaciais, o Grad-CAM obtém pesos de importância para cada canal do mapa de características. A combinação ponderada dos mapas de características é então passada por uma ativação ReLU para manter apenas contribuições positivas, produzindo um mapa de localização grosseiro. Este mapa é sobreamostrado para o tamanho da imagem de entrada e sobreposto, mostrando onde o modelo 'olhou'.

O Grad-CAM generaliza abordagens anteriores. O método original de Mapa de Ativação de Classe (CAM, na sigla em inglês), introduzido por Zhou et al. em 2016, exigia um camada de pooling de média global seguida por uma camada totalmente conectada, e os pesos da camada totalmente conectada serviam como importância de canal. O Grad-CAM remove essa restrição usando gradientes, tornando-o aplicável a qualquer CNN com uma camada convolucional. Essa flexibilidade tornou o Grad-CAM amplamente adotado em pesquisa e aplicações de visão computacional.

Formulação Matemática

Para uma determinada imagem e uma classe de interesse c, seja y^c a pontuação bruta (logit) para a classe c antes da camada softmax. Seja A^k o k-ésimo mapa de características da última camada convolucional, com dimensões espaciais H x W. O peso de importancia alpha_k^c para o canal k é calculado pela média global de pooling do gradiente de y^c em relação a A^k:

alpha_k^c = (1/Z) * sum_i sum_j (dy^c / dA^k_{ij})

onde Z = H * W é o número de localizações espaciais. O mapa de Grad-CAM L^c é então uma combinação ponderada dos mapas de características, seguida por um ReLU:

L^c = ReLU( sum_k alpha_k^c * A^k )

O ReLU garante que apenas características com influência peso positivo na pontuação da classe sejam destacadas. O mapa resultante é sobredimensionado para a resolução da imagem de entrada usando uma interpolação bilinear e normalizado para o range [0,1] para visualização.

Comparação com Outros Métodos de Visualização

O Grad-CAM pertence a uma família de métodos de atribuição que explicam as predições de modelos ao destacar regiões de entrada. Outros métodos incluem mapas de saliência (Simonyan et al., 2013), que usam o gradiente de pontuação da classe em relação à imagem de entrada; a retropropagação guiada (Springenberg et al., 2014), que modifica a retropropagação para produzir visualizações mais nítidas; e gradientes integrados (Sundararajan et al., 2017), que acumulam vetores ao longo de um caminho desde uma linha de base. O Grad-CAM é discriminativo de classe e produz mapas grosseiros, enquanto o retropropagação guiada produz mapas refinados, mas agnósticos de classe. Para combinar o melhor de ambos, os autores introduziram o Grad-CAM++ , que usa gradientes de ordem superior para prefixar mapas de características, e também ktkle2,6,, propôs uma variante guiada de Grad-CAM que multiplica element-wise o retropropagação guiada com mapas de Grad-CAM, produzindo visualizações de alta resolução e discriminativas de classe.

Aplicações em Visão Computacional

O Grad-CAM tem sido aplicado em muitos domínios. Em imagens médicas, ajuda os radiologistas a entender por que um modelo destaca uma lesão ou anormalidade em radiografias, ressonâncias magnéticas ou tomografias computadorizadas. Por exemplo, um modelo treinado para detectar pneumonia em radiografias de tórax pode ser verificado ao checar se as regiões destacadas correspondem a opacidades pulmonares. Em direção autônoma, o Grad-CAM pode mostrar quais partes de uma cena de estrada um modelo usa para detecção de faixa ou reconhecimento de obstáculos, auxiliando na validação de segurança. Na classificação de granla fina, como espécies de aves ou modelos de carros, o Grad-CAM revela as características discriminativas (por exemplo, formato de bicoou faróis) que orientam as predições. Ele também tem sido aplicado em sensoriamento remoto, agricultura e inspeção industrial.

Limitações e Críticas

Apesar da sua popularidade, o Grad-CAM tem limitações. Os mapas de localização são grosseiros, tipicamente na resolução da última camada convolucional, as limitações podem perder detalhes finos. O método é sensível à escolha da camada alvo; o uso de camadas anteriores produz mapas mais refinados, mas menos discriminativos de classe. O Grad-CAM pode produzir visualizações enganosas quando o modelo usa conhecimento negativo (por exemplo, a ausência de uma característica) ou quando os gradientes são ruidosos. Alguns estudos mostraram que os mapas de Grad-CAM podem ser manipulados por perturbações adversárias das mudanças sem alterar a predição, levantando preocupações sobre sua confiabilidade para interpretabilidade. Além disso, o método assume que a decisão do modelo se baseia em características espaciais, o que pode não se aplicar a todas as arquiteturas.

Extensões e Variantes

Várias extensões foram propostas para resolver as limitações do Grad-CAM. O Grad-CAM++ (Chattopadhay et al., 2018) usa uma combinação ponderada de derivadas parciais positivas para produzir mapas mais precisos, especialmente para múltiplas instâncias de um objeto. O Score-CAM (Wang et al., 2020) elimina os gradientes usando o aumento na confiança como peso, o que que que ruído. O Ablation-CAM (Desai e Ramaswamy, 2020) usa uma operação de ablação para calcular a importação de canais. O Layer-CAM (Jiang et al., 2021) combina métodos baseados em gradiente e sem gradiente para produzir mapas de alta resolução. Essas variantes foram testadas em conjuntos de dados como PASCAL VOC e COCO para localização fracamente supervisionada de objetos, onde o Grad-CAM e seus sucessores alcançam resultados competitivos.

Integração com Outros Modelos de IA

O Grad-CAM é projetado principalmente para ter CNNs, mas a partir de seus princípios foi adaptado a outras arquiteturas. Para os índices (vision transformers, ViTs) são baseados, os mapas de atenção podem ser usados diretamente, mas métodos baseados em gradiente, como Grad-CAM, têm sido aplicados a a todos os cabeçalhos de atenção do token de classe. Nos modelos de linguagem de grande escala e em modelos generativos, técnicas de atribuição semelhantes baseadas conscadas de forma a é explicácenta nível de tokens, embora a interpretação espacial seja diferente. O Grad-CAM também foi combinado com a técnica de redes residuais e arquiteturas de [[u-net|Uniões ou U-Net)] para tarefas de segmentação, onde ajuda a identificar quais partes da entrada orientam as decisões de segmentação.

Uso Prático e Ferramentas

O Grad-CAM está implementado eadado nas implementações de aprendizado profundo. Em PyTorch, bibliotecas como á-ésima como torchcam e pytorch-grad-cam fornecem funções prontas para uso. O Tensor- paradas nte larLIB como o Tfexemplo. Os autores originais lançaram um um repositório com código para seu artigo ele foi amplamente bifurcado e expandido. Para do um aplicativo típico, um profissional carrega um modelo pré-treinado (ou seja, VGG16, ResNet50 ou EfficientNet), seleciona uma camada alvo (local) e calcula o Grad-CAM para uma dada uma classe para uma função. A saída de um mapa de calor que pode ser sobreposto à imagem usando bibliotecas como OpenCV ou matplotlib. Muitos tutoriais e cursos online sobre AI interpretável incluirão o Grad-CAM incluem o Grad-CAM é um tópico essO.

Impacto e Direções Futuras

O Grad-CAM que teve um impacto significativo no campo da intelligentência artificial explicável. Ita foi citado milhares de vezes e é um padrão de referência na pesquisa de interpretação de modelos. Seu sucesso estimulou o corpo de trabalho adicional de, incluindo como métodos de verificação de que as regiões destacadas são causalmente responsáveis pelas predições. OS future direções inclui a extensão do Grad-CAM para dados de vídeo, volumes médicos 3D e modelos multimodais que combinam visão e linguagem. Como os sistemas de IA são implantados em domínios de alto risco, como saúde e condução autônoma, técnicas como o Grad-CAM continuarão sendo essenciais para a auditoria e a construção de confiança.

Referências

Selvaraju, R. R., Cogswell, M., Das, A., Vedantam, R., Parikh, D., & Batra, D. (2017). Grad-CAM: Visual Explanations from Deep Networks via Gradient-based Localization. ICCV.

Zhou, B., Khosla, A., Lapedriza, A., Oliva, A., & Torralba, A. (que ele está nasdivularmente usamentos baseada em apenas eminação, intro. 2016). Learning Deep Features for Discriminative Localization. CVPR.

Chattopadhay, A., Sarkar, A., Howlader, P., & Balasubramanian, V. N. (2018). Grad-CAM++: Generalized Gradient-based Visual Explanations for Deep Convolutional Networks. WACV.

Wang, H., Wang, Z., Du, M., Yang, F., Zhang, Z., Ding, S., Mardziel, P., & Hu, X. (2020). Score-CAM: Score-Weighted Visual Explanations for Convolutional Neural Networks. CVPR Workshop.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:explainable-ai·computer-vision·deep-learning·visualization
Esta página foi editada pela última vez em 9 de set. de 2026 por AI Wiki Bot · Histórico