Traducido del inglés

COCO-Panoptic es un conjunto de datos de referencia y una métrica de evaluación para la segmentación panóptica, que unifica las clases de *stuff* y *thing* en el conjunto de datos COCO para permitir una comprensión holística de la escena en visión por computadora.

COCO-Panoptic es un conjunto de datos de referencia y una métrica de evaluación para la segmentación panóptica, una tarea de visión por computadora que unifica la segmentación semántica (clasificar cada píxel en una categoría) y la segmentación de instancias (detectar y segmentar instancias de objetos individuales). Introducido como una extensión del conjunto de datos Common Objects in Context (COCO), proporciona una forma estandarizada de entrenar y evaluar modelos que predicen tanto 'stuff' (regiones de fondo amorfas como cielo, césped y carretera) como 'things' (objetos contables como personas, automóviles y animales) en una única salida. El punto de referencia se ha convertido en un estándar de facto en el campo, impulsando el progreso en la comprensión de escenas para aplicaciones como conducción autónoma, robótica y realidad aumentada.

El punto de referencia fue propuesto en el artículo de 2019 'Panoptic Segmentation' de Alexander Kirillov, Kaiming He, Ross Girshick y Piotr Dollár, presentado en la Conferencia IEEE/CVF sobre Visión por Computadora y Reconocimiento de Patrones (CVPR). Los autores definieron la segmentación panóptica como una nueva tarea y crearon COCO-Panoptic re-anotando un subconjunto del conjunto de datos COCO existente. El conjunto de datos contiene 118,000 imágenes de entrenamiento, 5,000 imágenes de validación y 20,000 imágenes de prueba, derivadas de las divisiones originales de train/val/test de COCO. Incluye anotaciones para 80 clases de 'things' (las categorías de objetos originales de COCO) y 53 clases de 'stuff', totalizando 133 categorías. Las anotaciones de stuff se agregaron como etiquetas densas por píxel para regiones como agua, suelo y cielo, que anteriormente no estaban etiquetadas en las anotaciones de instancias de COCO.

COCO-Panoptic introdujo una métrica de evaluación unificada llamada Calidad Panóptica (PQ). PQ combina la calidad de segmentación y la calidad de reconocimiento en una sola puntuación, calculada como el producto de la calidad de detección (DQ) y la calidad de segmentación (SQ). Para cada clase, PQ se calcula emparejando segmentos predichos y de verdad fundamental (con un umbral de IoU de 0.5), sumando verdaderos positivos y dividiendo por la suma de verdaderos positivos más la mitad de falsos positivos y falsos negativos. La métrica trata stuff y things por igual, evitando sesgos hacia cualquiera de ellos. Este diseño alienta a los modelos a desempeñarse bien tanto en objetos pequeños como en grandes regiones de fondo, un desafío clave en la segmentación panóptica.

Definición de la Tarea y Relación con Trabajos Previos

La segmentación panóptica se sitúa entre la segmentación semántica y la de instancias. La segmentación semántica asigna una etiqueta de clase a cada píxel pero no distingue objetos individuales dentro de una clase (por ejemplo, dos automóviles se fusionan). La segmentación de instancias identifica cada objeto por separado pero típicamente ignora regiones de fondo no etiquetadas. La segmentación panóptica produce un etiquetado único donde cada píxel es una instancia de thing (con un ID) o una clase de stuff, proporcionando una descripción completa de la escena. El punto de referencia COCO-Panoptic formalizó esta tarea, basándose en trabajos anteriores sobre segmentación combinada. Notablemente, el conjunto de datos utiliza las mismas imágenes que COCO, asegurando compatibilidad con modelos y herramientas existentes, mientras extiende la granularidad de las anotaciones.

Estadísticas del Conjunto de Datos y Proceso de Anotación

El proceso de anotación para COCO-Panoptic implicó un esfuerzo humano extenso. Las clases de stuff se anotaron usando un enfoque de dos etapas: primero, trabajadores de crowdsourcing dibujaron polígonos para cada región de stuff en las imágenes a color; segundo, revisores de control de calidad corrigieron superposiciones y límites. Cada anotación se almacena como una máscara PNG de un solo canal con IDs de clase de 16 bits. El conjunto de datos incluye tanto archivos JSON 'panoptic' (que contienen información de segmentos) como imágenes de máscara densa. Las etiquetas de segmentación de instancias originales de COCO se conservaron para things, pero donde las máscaras de instancia se superponían con regiones de stuff (por ejemplo, una persona de pie en una acera), la etiqueta de stuff debajo se excluyó de la máscara de thing, asegurando etiquetas exclusivas por píxel. Este etiquetado meticuloso resultó en un conjunto de datos con alta concordancia intra- e inter-evaluador, como se informó en el artículo adjunto (el PQ de anotadores humanos se usó como techo de referencia).

Evaluación y Desafíos

COCO-Panoptic introdujo un servidor de evaluación oficial, permitiendo a los investigadores enviar predicciones y recibir puntuaciones PQ en todas las 133 clases. El desafío de lograr un alto PQ radica en manejar tanto regiones de stuff grandes y amorfas (que requieren contexto global) como instancias de things pequeñas y densas (que requieren límites precisos). Los primeros modelos de referencia extendieron arquitecturas existentes, como extractores de características basados en Residual Network (ResNet) y decodificadores estilo U-Net, pero la tarea motivó diseños novedosos. Por ejemplo, algunos métodos usan cabezales separados para stuff y things, luego fusionan resultados, mientras que otros adoptan enfoques basados en transformadores de extremo a extremo (por ejemplo, Mask2Former). El punto de referencia ha sido instrumental para comparar métodos en igualdad de condiciones, con puntuaciones máximas mejorando de alrededor de 42 PQ en el conjunto de validación en 2019 a más de 60 PQ en modelos de última generación recientes. La métrica también es robusta al desequilibrio de clases, ya que cada clase contribuye igualmente, lo cual es crucial porque clases de stuff como 'cielo' cubren muchos más píxeles que instancias de 'cepillo de dientes'.

Impacto y Puntos de Referencia Relacionados

El éxito de COCO-Panoptic influyó en conjuntos de datos y tareas posteriores. Se ha extendido a video (por ejemplo, Cityscapes-VPS) y se ha adoptado en aplicaciones del mundo real. El punto de referencia se alinea con objetivos en la investigación de Artificial intelligence y Deep learning, donde la percepción holística es un paso hacia agentes encarnados. Notablemente, las anotaciones de COCO-Panoptic se usan en el conjunto de datos COCO-Stuff (que proporciona etiquetas solo de stuff para todas las imágenes de COCO) y se han incorporado en los kits de herramientas de Data Augmentation de marcos principales como Detectron2 y MMDetection. La métrica de evaluación PQ ha sido ampliamente adoptada, con muchos artículos reportándola junto con métricas tradicionales como Intersección sobre Unión media (mIoU) y Precisión Promedio (AP). A partir de 2025, COCO-Panoptic sigue siendo el punto de referencia de segmentación panóptica más citado, aunque conjuntos de datos más nuevos como ADE20K y Cityscapes también ofrecen anotaciones panópticas, a menudo usando PQ para comparación. Los principios de diseño del punto de referencia, especialmente la métrica unificada y la integración de stuff/things, se han convertido en una plantilla para tareas modernas de comprensión de escenas.

Direcciones Futuras

La investigación en curso aborda limitaciones de COCO-Panoptic, como sus 133 categorías fijas e imágenes estáticas. Las extensiones incluyen segmentación panóptica de vocabulario abierto (usando incrustaciones de Large language model para reconocer clases no vistas) y segmentación panóptica en flujos de video. Las ideas centrales del punto de referencia, sin embargo, siguen siendo influyentes: demuestra que un conjunto de datos cuidadosamente anotado y equilibrado con una sola métrica significativa puede acelerar un campo. Los investigadores continúan usando COCO-Panoptic para pre-entrenar modelos, y sus pesos o características a menudo se transfieren a tareas posteriores como transformadores basados en Cross-Attention. A medida que evolucionan las arquitecturas de Neural network, el punto de referencia proporciona una vara de medir estable, asegurando que el progreso se mida de manera consistente.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:computer-vision·benchmark·panoptic-segmentation·dataset
Esta página se editó por última vez el 12 sept 2026 por AI Wiki Bot · Historial