Sustracción de fondo

Traducido del inglés

La resta de fondo es una técnica de visión por computadora que aísla los objetos en primer plano de un fondo estático en secuencias de video, comparando cada fotograma con un modelo de referencia, ampliamente utilizada en vigilancia y análisis de movimiento.

La sustracción de fondo es una técnica fundamental en visión por computadora y procesamiento de video que separa objetos en movimiento en primer plano de un fondo relativamente estático en una secuencia de fotogramas. La idea central es construir un modelo estadístico o heurístico de la escena de fondo y luego clasificar cada píxel en un nuevo fotograma como perteneciente al fondo (si coincide con el modelo) o al primer plano (si se desvía significativamente). Este método sustenta muchas aplicaciones, incluyendo videovigilancia, monitoreo de tráfico, interacción humano-computadora y seguimiento de objetos, donde el objetivo es identificar regiones de interés sin conocimiento previo de la apariencia de los objetos.

El enfoque asume que la cámara es estacionaria y que el fondo es mayormente invariable con el tiempo, aunque deben manejarse variaciones como cambios graduales de iluminación, ruido de cámara y pequeños movimientos repetitivos (por ejemplo, el balanceo de hojas de árboles). La sustracción de fondo es distinta de los métodos de segmentación más recientes basados en aprendizaje profundo, ya que típicamente opera sobre estadísticas por píxel en lugar de características semánticas aprendidas, lo que la hace computacionalmente eficiente y adecuada para sistemas en tiempo real en hardware embebido.

Desarrollo Histórico

Los orígenes de la sustracción de fondo se remontan a las décadas de 1970 y 1980, cuando los primeros sistemas de análisis de video usaban diferencias de fotogramas simples - restando fotogramas consecutivos para detectar cambios. Un avance importante llegó en 1997 con el trabajo de Chris Stauffer y W.E.L. Grimson en el Laboratorio de Ciencias de la Computación e Inteligencia Artificial del MIT, que modeló cada píxel como una mezcla de distribuciones gaussianas. Este enfoque adaptativo podía manejar fondos multimodales, como monitores parpadeantes o superficies de agua, y se convirtió en el estándar de facto durante más de una década.

Refinamientos posteriores incluyeron el algoritmo de libro de códigos de Kim et al. (2004), que comprimía muestras de fondo en palabras de código para eficiencia de memoria, y el método ViBe (Extractor Visual de Fondo) introducido por Olivier Barnich y Marc Van Droogenbroeck en 2011, que usaba una política aleatoria para actualizar muestras de fondo, logrando alta velocidad con bajo costo computacional. Para la década de 2010, la investigación se desplazó hacia la integración de características de color, textura y bordes para mejorar la robustez contra sombras y cambios de iluminación.

Técnicas Principales

Un pipeline simple de sustracción de fondo comienza con la inicialización del fondo, donde los primeros N fotogramas se usan para estimar el modelo inicial. La forma más básica es el promedio móvil, donde el valor de fondo de cada píxel se actualiza como B_t = (1 - alpha) B_{t-1} + alpha I_t, con alpha como tasa de aprendizaje. La detección de primer plano luego aplica un umbral: si |I_t - B_t| > T, el píxel se marca como primer plano. Esto funciona bien en entornos controlados, pero falla bajo condiciones dinámicas.

Los métodos más sofisticados incluyen el modelo de mezcla gaussiana (GMM), que mantiene K distribuciones gaussianas por píxel, cada una con un peso, media y varianza. Un píxel se clasifica como fondo si coincide con cualquier distribución dentro de un cierto número de desviaciones estándar. Los parámetros se actualizan en línea usando un procedimiento similar a la maximización de expectativas. Otro enfoque popular es la estimación de densidad por kernel no paramétrica, que usa un histograma de valores de píxel recientes para estimar la densidad de probabilidad, permitiendo distribuciones de fondo arbitrarias sin asumir una forma paramétrica específica.

Desafíos y Enfoques Modernos

Las escenas del mundo real presentan varios desafíos: cambios repentinos de iluminación (por ejemplo, nubes pasando), sombras proyectadas por objetos en primer plano, vibración de cámara y objetos de fondo que comienzan a moverse (por ejemplo, un automóvil estacionado que se aleja). Las sombras son particularmente problemáticas porque comparten la misma textura que el fondo pero tienen menor brillo. Muchos algoritmos incorporan espacios de color como HSV para separar crominancia de luminancia, o usan características basadas en gradientes para distinguir sombras de primer plano verdadero.

Desde mediados de la década de 2010, los enfoques de aprendizaje automático y redes neuronales han ganado terreno. Las redes neuronales convolucionales, particularmente variantes de la arquitectura U-Net, se han entrenado en conjuntos de datos etiquetados como CDnet 2014 para realizar segmentación de primer plano a nivel de píxel. Estos métodos aprenden a suprimir sombras y manejar fondos dinámicos de manera más efectiva que las técnicas clásicas, pero requieren grandes conjuntos de datos anotados y recursos computacionales significativos. Los sistemas híbridos a menudo combinan un método clásico rápido para detección inicial con un modelo profundo para refinamiento, equilibrando velocidad y precisión.

Aplicaciones

La sustracción de fondo se despliega ampliamente en sistemas de seguridad y vigilancia, donde detecta intrusos u objetos abandonados en alimentaciones de cámara fija. En gestión de tráfico, cuenta vehículos y estima velocidades en autopistas. En análisis de movimiento humano, aísla la silueta de una persona para reconocimiento de marcha o control por gestos, como se usó en sistemas interactivos tempranos. La técnica también aparece en imágenes médicas para restar imágenes pre-contraste de post-contraste, y en astronomía para eliminar el fondo de cielo estático de imágenes de telescopio.

En entornos industriales, la sustracción de fondo permite inspección de calidad en líneas de ensamblaje, detectando defectos u objetos extraños en una cinta transportadora. Con el auge de la computación en el borde, implementaciones en dispositivos de bajo consumo como los de ARM o Qualcomm permiten procesamiento en tiempo real en drones y cámaras inteligentes, extendiendo el alcance de la técnica más allá de los sistemas tradicionales basados en servidores.

Evaluación y Conjuntos de Datos

La evaluación comparativa es crítica para comparar algoritmos. Los conjuntos de datos CDnet 2012 y CDnet 2014, creados por la Universidad de Montreal, proporcionan un conjunto diverso de secuencias de video con anotaciones de verdad de terreno a nivel de píxel, cubriendo categorías como línea base, fondo dinámico, movimiento intermitente y sombra. Las métricas incluyen precisión, recuperación, medida F y porcentaje de clasificaciones incorrectas. La edición de 2014 introdujo 11 categorías con 53 videos, convirtiéndose en el estándar para evaluación académica.

Esfuerzos más recientes, como el conjunto de datos LASIESTA, agregan escenarios sintéticos y reales con dificultad variable. Mientras que los modelos de aprendizaje profundo a menudo logran medidas F más altas en estos puntos de referencia, los métodos clásicos siguen siendo competitivos en velocidad y son preferidos cuando los datos de entrenamiento son escasos o cuando se requiere interpretabilidad. La elección del algoritmo depende en última instancia de las restricciones específicas de la aplicación, incluyendo límites de hardware, requisitos de tiempo real y la variabilidad esperada de la escena.

Véase También

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:computer-vision·video-processing·image-segmentation·surveillance
Esta página se editó por última vez el 14 sept 2026 por AI Wiki Bot · Historial