Mapas de saliencia

Traducido del inglés

Los mapas de saliencia son mapas de calor que resaltan las regiones más importantes de una imagen para la atención visual humana o las predicciones de modelos de aprendizaje automático, utilizados en visión por computadora e IA explicable.

En visión por computadora, un mapa de saliencia es una imagen que resalta la región en la que los ojos de las personas se enfocan primero o las regiones más relevantes para los modelos de aprendizaje automático. El objetivo de un mapa de saliencia es reflejar el grado de importancia de un píxel para el sistema visual humano o para un modelo de aprendizaje automático opaco. Por ejemplo, en una imagen de un paisaje, una persona podría mirar primero un fuerte y nubes ligeras, por lo que esas regiones se resaltarían en el mapa de saliencia. Los mapas de saliencia se utilizan ampliamente en aplicaciones que van desde la compresión de imágenes hasta la inteligencia artificial explicable, donde proporcionan explicaciones visuales de las decisiones del modelo.

El concepto de saliencia se origina en estudios de la atención visual humana. La corteza visual primaria (V1) parece ser responsable del mapa de saliencia, según la Hipótesis de Saliencia V1. En el aprendizaje automático, los mapas de saliencia se generan típicamente para redes neuronales profundas, especialmente redes neuronales convolucionales y transformadores, para indicar qué partes de la entrada influyen más en la salida.

Aplicaciones para el Ojo Humano

Los mapas de saliencia tienen aplicaciones en una variedad de problemas diferentes. Para la atención del ojo humano, se utilizan en:

  • Compresión de imágenes y videos: El ojo humano se enfoca solo en una pequeña región de interés en el cuadro. Por lo tanto, no es necesario comprimir todo el cuadro con calidad uniforme. Usar un mapa de saliencia reduce el tamaño final del video con la misma percepción visual.
  • Evaluación de calidad de imágenes y videos: La tarea principal de una métrica de calidad de imagen o video es una alta correlación con las opiniones de los usuarios. Las diferencias en las regiones salientes reciben más importancia y, por lo tanto, contribuyen más a la puntuación de calidad.
  • Reencuadre de imágenes: Esto tiene como objetivo redimensionar una imagen expandiendo o contrayendo las regiones no informativas. Los algoritmos de reencuadre dependen de la disponibilidad de mapas de saliencia que estimen con precisión todos los detalles salientes de la imagen.
  • Detección y reconocimiento de objetos: En lugar de aplicar un algoritmo computacionalmente complejo a toda la imagen, se puede aplicar a las regiones más salientes de una imagen que probablemente contengan un objeto.

IA Explicable

Los mapas de saliencia son una herramienta destacada en la inteligencia artificial explicable, proporcionando explicaciones visuales del proceso de toma de decisiones de los modelos de aprendizaje automático, particularmente redes neuronales profundas. Estos mapas resaltan las regiones en los datos de entrada que son más influyentes en la salida del modelo, indicando efectivamente dónde está "mirando" el modelo al hacer una predicción. En tareas de clasificación de imágenes, por ejemplo, los mapas de saliencia pueden identificar píxeles o regiones que contribuyen más a una decisión de clase específica.

Desarrolladas para redes neuronales convolucionales, las técnicas de mapeo de saliencia van desde simplemente tomar el gradiente de la puntuación de clase con respecto a los datos de entrada hasta algoritmos más complejos, como gradientes integrados y mapeo de activación de clase. En la arquitectura de transformadores, los mecanismos de atención llevaron a mapas de saliencia análogos, como mapas de atención, despliegues de atención y mapas de atención discriminativos de clase.

Saliencia como Problema de Segmentación

La estimación de saliencia puede verse como una instancia de segmentación de imágenes. En visión por computadora, la segmentación de imágenes es el proceso de particionar una imagen digital en múltiples segmentos (conjuntos de píxeles, también conocidos como superpíxeles). El objetivo de la segmentación es simplificar y/o cambiar la representación de una imagen en algo más significativo y más fácil de analizar. La segmentación de imágenes se usa típicamente para localizar objetos y límites (líneas, curvas, etc.) en imágenes. Más precisamente, la segmentación de imágenes es el proceso de asignar una etiqueta a cada píxel en una imagen de modo que los píxeles con la misma etiqueta compartan ciertas características.

Algoritmos Clásicos

Hay tres formas de algoritmos clásicos de estimación de saliencia implementados en OpenCV:

  • Saliencia estática: Se basa en características y estadísticas de la imagen para localizar las regiones de interés de una imagen.
  • Saliencia de movimiento: Se basa en el movimiento en un video, detectado por flujo óptico. Los objetos que se mueven se consideran salientes.
  • Objetividad: La objetividad refleja cuán probable es que una ventana de imagen cubra un objeto. Estos algoritmos generan un conjunto de cajas delimitadoras de dónde puede estar un objeto en una imagen.

Además de los enfoques clásicos, los métodos basados en redes neuronales también son populares. Hay ejemplos de redes neuronales para la estimación de saliencia de movimiento:

  • TASED-Net: Consiste en dos bloques de construcción. Primero, la red codificadora extrae características espacio-temporales de baja resolución, y luego la red de predicción decodifica las características espacialmente codificadas mientras agrega toda la información temporal.
  • STRA-Net: Enfatiza dos problemas esenciales. Primero, características espacio-temporales integradas mediante acoplamiento de apariencia y flujo óptico, y luego saliencia multiescala aprendida mediante mecanismo de atención.
  • STAViS: Combina información visual y auditiva espacio-temporal. Este enfoque emplea una sola red que aprende a localizar fuentes de sonido y a fusionar las dos saliencias para obtener un mapa de saliencia final.

Hay un método más nuevo de saliencia estática llamado sensibilidad a la distorsión visual. Se basa en la idea de que los bordes verdaderos, es decir, los contornos de objetos, son más salientes que otras regiones texturizadas complejas. Detecta bordes de una manera diferente a los algoritmos clásicos de detección de bordes. Usa un umbral bastante pequeño para las magnitudes del gradiente para considerar la mera presencia de los gradientes. Obtiene cuatro mapas binarios para las direcciones vertical, horizontal y dos diagonales. Se aplican cierre y apertura morfológicos a las imágenes binarias para cerrar pequeños huecos. Para limpiar formas similares a manchas, utiliza la transformada de distancia. Después de todo, los grupos de píxeles conectados son bordes individuales (o contornos). Se usa un umbral de tamaño del conjunto de píxeles conectados para determinar si un bloque de imagen contiene un borde perceptible (región saliente) o no.

Implementación de Ejemplo

Un mapa de saliencia simple se puede calcular calculando la distancia de cada píxel al resto de píxeles en el mismo cuadro. El valor de saliencia para un píxel \(I_k\) se da por:

\(\mathrm{SALS}(I_k) = \sum_{i=1}^{N} |I_k - I_i|\)

donde \(I_i\) es el valor del píxel \(i\), en el rango de [0,255]. La forma expandida es:

\(\mathrm{SALS}(I_k) = |I_k - I_1| + |I_k - I_2| + ... + |I_k - I_N|\)

donde N es el número total de píxeles en el cuadro actual. La fórmula se puede reestructurar agrupando píxeles con el mismo valor de intensidad:

\(\mathrm{SALS}(I_k) = \sum_{n=0}^{255} F_n \times |I_k - I_n|\)

donde \(F_n\) es la frecuencia del valor de intensidad \(I_n\). Las frecuencias se expresan en forma de histograma, y el tiempo computacional del histograma es \(O(N)\). Este enfoque es eficiente y forma la base para muchos métodos clásicos de detección de saliencia.

Enfoques de Redes Neuronales

La generación moderna de mapas de saliencia a menudo se basa en el aprendizaje profundo. Para redes neuronales convolucionales, los métodos basados en gradientes calculan la derivada de la puntuación de clase con respecto a la imagen de entrada, produciendo un mapa de saliencia que resalta los píxeles con la influencia más fuerte. Los gradientes integrados y el mapeo de activación de clase (CAM) son técnicas más avanzadas que proporcionan mapas más suaves y discriminativos. En transformadores, los mecanismos de atención producen mapas de atención que se pueden agregar a través de capas, conocidos como despliegues de atención, para crear mapas de saliencia para entradas visuales y textuales. Estos métodos se utilizan ampliamente en aprendizaje automático y aprendizaje profundo para la interpretabilidad de modelos.

Aplicaciones en Otros Dominios

Aunque los mapas de saliencia son más comunes en visión por computadora, se han adaptado a otros dominios. En el procesamiento de lenguaje natural, los mapas de saliencia pueden resaltar palabras o tokens que más influyen en la predicción de un modelo, especialmente en modelos basados en transformadores como modelos de lenguaje grandes. En el procesamiento de audio, los mapas de saliencia pueden indicar regiones de tiempo-frecuencia relevantes para la clasificación. El principio subyacente sigue siendo el mismo: identificar las partes de la entrada que más importan para la salida.

Desafíos y Limitaciones

Los mapas de saliencia no están exentos de críticas. Pueden ser sensibles a pequeñas perturbaciones en la entrada, lo que lleva a explicaciones inestables. Algunos métodos producen mapas que no son discriminativos de clase, lo que significa que resaltan regiones que son generalmente salientes en lugar de específicas para una predicción particular. Además, evaluar la calidad de los mapas de saliencia es difícil, ya que no hay una verdad fundamental para la atención del modelo. Los investigadores continúan desarrollando nuevas técnicas para mejorar la fiabilidad y la interpretabilidad, a menudo basándose en conocimientos de la investigación de redes neuronales y la ética de la inteligencia artificial.

Direcciones Futuras

A medida que los modelos de inteligencia artificial se vuelven más complejos, crece la necesidad de explicaciones transparentes. Es probable que los mapas de saliencia sigan siendo una herramienta clave en la IA explicable, especialmente para aplicaciones de alto riesgo como imágenes médicas y conducción autónoma. Los avances en IA generativa y modelos multimodales pueden llevar a nuevas formas de saliencia que combinen señales visuales, textuales y auditivas. La investigación en instituciones como MIT CSAIL, Stanford AI Lab y Berkeley AI Research continúa empujando los límites de la interpretabilidad, con los mapas de saliencia sirviendo como una técnica fundamental.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:computer-vision·explainable-ai·saliency·interpretability
Esta página se editó por última vez el 12 sept 2026 por AI Wiki Bot · Historial