COCO-Stuff 164K es un conjunto de datos a gran escala para la segmentación semántica y la comprensión de escenas, construido como una extensión del conjunto de datos Microsoft Common Objects in Context (COCO). Proporciona anotaciones densas a nivel de píxel tanto para clases de 'stuff' (regiones de fondo amorfas como cielo, hierba y carretera) como para clases de 'thing' (objetos contables como persona, coche y perro). El conjunto de datos contiene 164,000 imágenes, cada una anotada con una de 172 categorías semánticas, lo que lo convierte en uno de los recursos más completos para entrenar y evaluar modelos en tareas de visión por computador como la segmentación semántica, la segmentación de instancias y el análisis de escenas.
El conjunto de datos fue introducido en 2018 por investigadores de la Universidad de Friburgo, incluyendo a Holger Caesar, Jasper Uijlings y Vittorio Ferrari, y fue publicado en el artículo 'COCO-Stuff: Thing and Stuff Classes in Context'. Se basa en el conjunto de datos original COCO-Stuff, que tenía 10,000 imágenes, ampliándolo a las divisiones completas de entrenamiento y validación de COCO. Las 172 clases se dividen en 80 clases de thing (idénticas a las categorías de thing de COCO) y 92 clases de stuff, que incluyen elementos de fondo naturales y artificiales.
Construcción y Anotación
El proceso de anotación para COCO-Stuff 164K implicó pasos tanto automáticos como manuales. Las anotaciones iniciales de stuff se generaron utilizando una combinación de modelos de aprendizaje profundo y refinamiento humano. El conjunto de datos aprovecha las anotaciones existentes de COCO para las clases de thing, que fueron creadas por trabajadores colaborativos, y añade máscaras a nivel de píxel para las clases de stuff. Las anotaciones finales se validaron mediante una serie de controles de calidad para garantizar la consistencia y precisión en las 164,000 imágenes.
Cada imagen del conjunto de datos está anotada con una única etiqueta por píxel, y las anotaciones se proporcionan en un formato compacto de codificación por longitud de ejecución para reducir los requisitos de almacenamiento. El conjunto de datos se divide en un conjunto de entrenamiento de 118,000 imágenes y un conjunto de validación de 5,000 imágenes, con las imágenes restantes reservadas para pruebas (las anotaciones del conjunto de prueba no se publican públicamente).
Aplicaciones en Aprendizaje Profundo
COCO-Stuff 164K se ha convertido en un punto de referencia estándar para la segmentación semántica, una tarea en aprendizaje automático y aprendizaje profundo donde un modelo asigna una etiqueta de clase a cada píxel de una imagen. Se utiliza ampliamente para evaluar el rendimiento de arquitecturas de red neuronal, incluyendo modelos basados en red residual y U-Net, así como enfoques basados en transformadores. La diversidad del conjunto de datos en clases de stuff y thing desafía a los modelos a comprender tanto límites de objetos finos como regiones contextuales a gran escala.
El conjunto de datos también se utiliza para la segmentación panóptica, una tarea que unifica la segmentación semántica y de instancias al requerir que los modelos predigan etiquetas de stuff y thing simultáneamente. Esto ha impulsado la investigación en arquitecturas unificadas que pueden manejar ambos tipos de clases en una sola pasada hacia adelante.
Punto de Referencia y Métricas de Evaluación
La métrica de evaluación principal para COCO-Stuff 164K es la Intersección sobre Unión media (mIoU), que mide la superposición entre las máscaras de segmentación predichas y las reales promediada sobre todas las clases. Los investigadores también informan IoU por clase y precisión de píxel. El servidor de evaluación oficial del conjunto de datos permite una comparación justa de modelos, y las tablas de clasificación rastrean el estado del arte a lo largo del tiempo.
Desde su lanzamiento, el conjunto de datos se ha utilizado en cientos de artículos de investigación, y los modelos de mejor rendimiento han logrado puntuaciones de mIoU superiores a 50 en el conjunto de validación, con un progreso significativo impulsado por avances en arquitecturas basadas en transformadores y mecanismos de atención.
Relación con Otros Conjuntos de Datos
COCO-Stuff 164K es parte de una familia de conjuntos de datos derivados de COCO, incluyendo COCO-Stuff 10K y el conjunto de datos original COCO. Complementa otros conjuntos de datos de comprensión de escenas como Cityscapes, que se centra en escenas de conducción urbana, y ADE20K, que cubre una gama más amplia de escenas interiores y exteriores. El énfasis del conjunto de datos en el contexto y las clases de stuff lo hace particularmente útil para aplicaciones en conducción autónoma, robótica y realidad aumentada, donde comprender las regiones de fondo es tan importante como detectar objetos.
El conjunto de datos está disponible públicamente para fines de investigación y está alojado en el sitio web oficial de COCO. Se utiliza comúnmente junto con modelos preentrenados de laboratorios de investigación de inteligencia artificial y plataformas en la nube, y sigue siendo un recurso clave para avanzar en el campo de la visión por computador.