DeepLab es una familia de arquitecturas de red neuronal profunda para la segmentación semántica, una tarea de visión por computadora que asigna una etiqueta de clase a cada píxel de una imagen. Desarrollado por investigadores de Google (inicialmente en Google Research, más tarde parte de Google DeepMind), los modelos DeepLab se distinguen por su uso de convolución atrosa (dilatada), una técnica que expande el campo receptivo de los filtros sin aumentar el número de parámetros ni perder resolución espacial. La familia ha evolucionado a través de varias versiones, cada una introduciendo refinamientos en la arquitectura y la metodología de entrenamiento, y ha logrado consistentemente resultados de vanguardia en conjuntos de datos de referencia como PASCAL VOC y Cityscapes.
La innovación central de DeepLab es la aplicación de convolución atrosa, también conocida como convolución dilatada, a la segmentación semántica. En una convolución estándar, un filtro se aplica a una región contigua de la entrada. La convolución atrosa inserta ceros (agujeros) entre los pesos del filtro, espaciándolos efectivamente. La tasa de dilatación controla el espaciado; una tasa de 1 es una convolución estándar, mientras que tasas más altas expanden el campo de visión. Esto permite que la red capture información de un contexto más amplio sin reducir la resolución de los mapas de características, lo cual es crucial para preservar detalles finos en los límites de segmentación. DeepLab también emplea el agrupamiento piramidal espacial atroso (ASPP), un módulo que aplica múltiples convoluciones atrosas con diferentes tasas de dilatación en paralelo y luego fusiona sus salidas. Este enfoque multiescala ayuda al modelo a reconocer objetos de tamaños variados.
Primeras Versiones: DeepLabv1 y DeepLabv2
La primera versión, DeepLabv1, se introdujo en 2015 y combinó la convolución atrosa con campos aleatorios condicionales (CRF) totalmente conectados para el postprocesamiento. El CRF refinaba la salida gruesa de la red imponiendo consistencia espacial, afilando los límites de los objetos. DeepLabv2, presentado en 2016, añadió el módulo ASPP y reemplazó la red troncal VGG-16 con una ResNet, mejorando la precisión y la eficiencia. El modelo v2 logró los mejores resultados en el punto de referencia PASCAL VOC 2012, estableciendo un nuevo estándar en el campo.
DeepLabv3 y DeepLabv3+
DeepLabv3, publicado en 2017, simplificó la arquitectura eliminando el postprocesamiento con CRF, ya que el módulo ASPP con normalización por lotes resultó suficiente para capturar contexto multiescala. También introdujo una estructura codificador-decodificador más efectiva en la versión posterior DeepLabv3+, que añadió un módulo decodificador para refinar los límites de segmentación, particularmente para objetos pequeños. DeepLabv3+ se convirtió en una línea base ampliamente adoptada en la comunidad de aprendizaje automático, a menudo utilizada como red troncal para otras tareas como la segmentación de instancias y la segmentación panóptica. El rendimiento del modelo en Cityscapes y otros conjuntos de datos de conducción autónoma lo hizo una opción popular para aplicaciones del mundo real.
Detalles Técnicos y Entrenamiento
Los modelos DeepLab típicamente usan una red troncal preentrenada, como ResNet o Xception, con las capas totalmente conectadas finales eliminadas. El paso de salida, que determina la relación entre el tamaño de la imagen de entrada y el tamaño del mapa de características de salida, es un hiperparámetro clave. DeepLabv3+ a menudo usa un paso de salida de 16 durante el entrenamiento y de 8 durante la inferencia para equilibrar velocidad y precisión. El entrenamiento implica técnicas estándar como aumento de datos, normalización por lotes y optimización con descenso de gradiente estocástico o sus variantes. La función de pérdida es típicamente una pérdida de entropía cruzada por píxel, a veces combinada con pérdidas auxiliares para capas intermedias.
Aplicaciones e Impacto
DeepLab se ha aplicado en numerosos dominios, incluyendo conducción autónoma (Waymo y otras empresas usan modelos de segmentación similares para la comprensión de escenas), análisis de imágenes médicas (por ejemplo, segmentando órganos o tumores en exploraciones), análisis de imágenes satelitales y realidad aumentada. Su influencia se extiende más allá de la segmentación semántica; la técnica de convolución atrosa ha sido adoptada en otras arquitecturas, como variantes de U-Net y modelos de detección de objetos. La familia DeepLab también es un componente común en sistemas más grandes, incluidos aquellos para edición de imágenes y aplicaciones de IA generativa que requieren límites de objetos precisos.
El desarrollo de DeepLab refleja tendencias más amplias en aprendizaje profundo: el cambio de características diseñadas manualmente a representaciones aprendidas de extremo a extremo, la importancia del procesamiento multiescala y el impulso por arquitecturas que equilibren precisión con eficiencia computacional. Aunque modelos más nuevos, como aquellos basados en transformadores y grandes modelos de lenguaje adaptados para visión, han superado a DeepLab en algunos puntos de referencia, la familia DeepLab sigue siendo un punto de referencia fundamental en el campo de la segmentación semántica.