Cityscapes es un conjunto de datos a gran escala diseñado para la comprensión semántica de escenas urbanas. Proporciona un conjunto diverso de secuencias de video estéreo grabadas desde un vehículo en movimiento en 50 ciudades de Alemania y países vecinos, con anotaciones de alta calidad a nivel de píxel para 5,000 fotogramas y anotaciones poligonales más gruesas para 20,000 fotogramas adicionales. El conjunto de datos fue introducido en 2016 por investigadores de Daimler AG, TU Darmstadt y otras instituciones, y se ha convertido en un estándar de referencia para tareas como la segmentación semántica, la segmentación de instancias y la segmentación panóptica en la investigación de conducción autónoma y visión por computadora.
El objetivo principal de Cityscapes es permitir el desarrollo y la evaluación de algoritmos que puedan comprender el entorno visual de un vehículo en condiciones del mundo real. El conjunto de datos captura la complejidad de la conducción urbana, incluyendo condiciones climáticas variables, estaciones y situaciones de tráfico, lo que lo convierte en un banco de pruebas desafiante y realista. Sus anotaciones cubren 30 clases agrupadas en ocho categorías: superficies planas (carreteras, aceras), humanos (peatones, ciclistas), vehículos (automóviles, camiones, autobuses), construcción (edificios, muros), objetos (señales de tráfico, postes), naturaleza (vegetación, terreno), cielo y vacío (áreas no etiquetadas). Esta taxonomía de grano fino respalda un análisis detallado de la escena y se utiliza ampliamente para entrenar modelos de aprendizaje profundo en sistemas de conducción autónoma.
Recopilación de Datos y Anotación
El conjunto de datos se capturó utilizando un sistema de cámara estéreo montado en un automóvil, grabando a 17 fotogramas por segundo con una resolución de 2048x1024 píxeles. Las sesiones de grabación se llevaron a cabo en primavera, verano y otoño, cubriendo condiciones soleadas, nubladas y lluviosas, pero no escenas invernales ni nocturnas. Los 5,000 fotogramas finamente anotados se seleccionaron de 27 ciudades, mientras que los 20,000 fotogramas con anotaciones gruesas provienen de 23 ciudades adicionales, lo que garantiza diversidad geográfica. La anotación fue realizada por un equipo profesional, y cada imagen fina tardó aproximadamente 90 minutos en etiquetarse, utilizando una herramienta poligonal que permite una delimitación precisa de los bordes. Las anotaciones gruesas, que toman alrededor de 7 minutos por imagen, utilizan polígonos con menos vértices y están destinadas al preentrenamiento o al aprendizaje débilmente supervisado.
Tareas de Referencia y Métricas
El conjunto de datos se utiliza principalmente para la segmentación semántica, donde a cada píxel se le asigna una etiqueta de clase. La métrica de evaluación estándar es la Intersección sobre Unión media (mIoU) en todas las clases, con informes separados para las 19 clases que se utilizan para el entrenamiento y la evaluación (la clase 'vacío' se excluye). Cityscapes también admite la segmentación de instancias (distinguir objetos individuales dentro de una clase, como automóviles separados) y la segmentación panóptica (que combina la segmentación semántica y de instancias). El punto de referencia tiene una tabla de clasificación pública donde los investigadores pueden enviar resultados, y ha impulsado un progreso significativo en los modelos de segmentación, desde las primeras redes totalmente convolucionales hasta arquitecturas modernas basadas en transformadores como SegFormer y Mask2Former.
Impacto en la Visión por Computadora
Cityscapes se ha convertido en uno de los conjuntos de datos más influyentes en visión por computadora, con miles de citas y un uso generalizado tanto en el ámbito académico como en la industria. Ha impulsado el desarrollo de técnicas de adaptación de dominio, ya que los modelos entrenados en Cityscapes a menudo necesitan generalizarse a otros entornos urbanos, como los de los datos de Waymo o Tesla Autopilot. El conjunto de datos también popularizó el uso de datos sintéticos, con herramientas como GTA-V y CARLA utilizadas para generar datos de entrenamiento adicionales que luego se ajustan finamente en Cityscapes. Sus anotaciones se han utilizado para entrenar modelos de segmentación semántica, estimación de profundidad y detección de objetos, y sigue siendo un conjunto de evaluación estándar para nuevas arquitecturas, incluidas las basadas en paradigmas de red neuronal y aprendizaje profundo.
Limitaciones y Extensiones
A pesar de su éxito, Cityscapes tiene limitaciones conocidas. Cubre solo ciudades europeas, principalmente en Alemania, lo que introduce un sesgo hacia los diseños de carreteras, señalización y tipos de vehículos europeos. El conjunto de datos no incluye escenas nocturnas, lluvias intensas o nieve, lo que limita su aplicabilidad a condiciones climáticas adversas. Para abordar estas brechas, los investigadores han creado extensiones y conjuntos de datos complementarios, como Cityscapes-Dark para escenas nocturnas y ACDC (Conjunto de Datos de Condiciones Adversas) para niebla, lluvia y nieve. Además, las anotaciones gruesas son menos precisas, lo que puede afectar a los modelos entrenados con ellas. No obstante, Cityscapes sigue siendo un recurso fundamental, y su punto de referencia continúa utilizándose activamente para evaluar modelos de última generación en la comprensión de escenas urbanas.
Véase También
- segmentación semántica
- conducción autónoma
- visión por computadora
- conjunto de datos