Traduzido do inglês

COCO-Panoptic é um conjunto de dados de referência e métrica de avaliação para segmentação panóptica, unificando classes de stuff e thing no conjunto de dados COCO para permitir uma compreensão holística da cena em visão computacional.

COCO-Panoptic é um conjunto de dados de referência (benchmark) e uma métrica de avaliação para segmentação panóptica, uma tarefa de visão computacional que unifica a segmentação semântica (classificar cada pixel em uma categoria) e a segmentação de instancias (detectar e segmentar instancias individuais de objetos). Introducido como uma extensão do conjunto de dados Common Objects in Context (COCO), ele fornece uma maneira padronizada de treinar e avaliar modelos que predizem tanto 'stuff' (regiones de fondo amorfas como céu, grama e estrada) como 'things' (objetos contáveis como pessoas, carros e animais) em uma única saída. O benchmark se tornou um padrão de facto no campo, impulsionando o progresso na compreensão de escenas para aplicações como condução autónoma, robótica e realidade aumentada.

O benchmark foi proposto no artigo de 2019 'Panoptic Segmentation' por Alexander Kirillov, Kaiming He, Ross Girshick e Piotr Dollár, apresentado na IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). Os autores definieron a segmentación panóptica como uma nova tarefa e criaron COCO-Panoptic re-anotando um subconjunto do conjunto de dados COCO existente. O conjunto de dados contém 118.000 imágenes de treinamento, 5.000 imágenes de validação e 20.000 imágenes de teste, derivadas das divisões originales de treinamento/validação/teste do COCO. Incluye anotaciones para 80 clases de 'things' (as categorías de objetos originales do COCO) e 53 clases de 'stuff', totalizando 133 categorías. As anotaciones de stuff foram adicionadas como etiquetas densas por pixel para regiones como água, suelo e céu, que anteriormente não estavam etiquetadas nas anotaciones de instancias do COCO.

COCO-Panoptic introdujo uma métrica de avaliação unificada chamada Panoptic Quality (PQ). PQ combina a qualidade de segmentación e a qualidade de reconhecimento em uma única puntuación, calculada como o produto da qualidade de detección (DQ) e da qualidade de segmentación (SQ). Para cada clase, PQ é calculada combinando segmentos preditos e de verdade fundamental (com um limiar de IoU de 0,5), somando verdadeiros positivos e dividiendo pela soma de verdadeiros positivos más a metade dos falsos positivos e falsos negativos. A métrica trata stuff e things de maneira igual, evitando sesgos hacia qualquer um deles. Este diseño incentiva aos modelos a desempeñarse bem tanto em objetos pequeños como em grandes regiones de fondo, um desafío clave na segmentación panóptica.

Definición de Tarea e Relación com Trabalhos Anteriores

A segmentación panóptica se sitúa entre a segmentación semántica e a de instancias. A segmentación semántica asigna uma etiqueta de clase a cada pixel, pero não distingue objetos individuais dentro de uma clase (por exemplo, dois carros são fundidos). A segmentación de instancias identifica cada objeto por separado, mas tipicamente ignora regiones de fondo não etiquetadas. A segmentación panóptica produce uma única etiquetación onde cada pixel é ou uma instancia de thing (com um ID) ou uma clase de stuff, proporcionando uma descripción completa da escena. O benchmark COCO-Panoptic formalizó esta tarefa, baseándose em trabalhos anteriores sobre segmentación combinada. Notabelmente, o conjunto de datos usa as mesmas imágenes que COCO, garantizando compatibilidade com modelos e ferramentas existentes, enquanto extiende a granularidad das anotaciones.

Estadísticas do Conjunto de Datos e Proceso de Anotación

O pipeline de anotación para COCO-Panoptic envolvió um extenso esfuerzo humano. As clases de stuff foram anotadas usando um enfoque de duas etapas: primeiro, trabalhadores de crowdsourcing dibujaron polígonos para cada región de stuff nas imágenes a color; segundo, revisores de control de calidad corrigieron superposiciones e límites. Cada anotación é almacenada como uma máscara PNG de un solo canal com IDs de clase de 16 bits. O conjunto de datos incluye tanto arquivos JSON 'panoptic' (que contienen información de segmentos) como imágenes de máscara densas. As etiquetas de segmentación de instancias do COCO original foram retenidas para things, pero onde as máscaras de instancias se superponían com regiones de stuff (por exemplo, uma persona de pé em uma acera), a etiqueta de stuff debajo foi excluída da máscara de thing, garantizando etiquetas exclusivas por pixel. Esta etiquetación meticulosa resultó em um conjunto de datos com alta concordancia intra e inter-evaluador, como se reportó no artigo acompañante (a PQ de anotadores humanos foi usada como techo de referencia).

Evaluación e Desafíos

COCO-Panoptic introdujo um servidor de evaluación oficial, permitiendo aos investigadores enviar predicciones e recibir puntuaciones de PQ em todas las 133 clases. O desafío de alcanzar uma alta PQ reside em manejar tanto grandes regiones de stuff amorfas (que requieren contexto global) como instancias de things pequeñas e densas (que requieren límites precisos). Os primeros baselines extendieron arquitecturas existentes, como extractores de características basados em Residual Network (ResNet) e decodificadores estilo U-Net, pero a tarefa motivó diseños novedosos. Por exemplo, alguns métodos usan cabezas separadas para stuff e things, luego fusionan resultados, mientras que outros adoptan enfoques end-to-end basados em transformers (por exemplo, Mask2Former). O benchmark foi instrumental para comparar métodos em igualdad de condiciones, com as mejores puntuaciones mejorando de alrededor de 42 PQ no conjunto de validação em 2019 a más de 60 PQ em modelos de última generación recientes. A métrica também é robusta ao desequilibrio de clases, ya que cada clase contribuye igualmente, o que é crucial porque clases de stuff como 'céu' cobren muitos más pixels que instancias de 'cepillo de dientes'.

Impacto e Benchmarks Relacionados

O éxito de COCO-Panoptic influyó em conjuntos de datos e tarefas posteriores. Fue extendido a vídeo (por ejemplo, Cityscapes-VPS) e adoptado em aplicaciones do mundo real. O benchmark se alinea com os objetivos na investigación de Artificial intelligence e Deep learning, onde a percepción holística é um paso hacia agentes incorporados. Notabelmente, as anotaciones de COCO-Panoptic são usadas no conjunto de datos COCO-Stuff (que proporciona etiquetas solo de stuff para todas as imágenes do COCO) e foram incorporadas às ferramentas de Data Augmentation de marcos principais como Detectron2 e MMDetection. A métrica de evaluación PQ foi ampliamente adoptada, com muitos artigos reportándola junto com métricas tradicionais como mean Intersection over Union (mIoU) e Average Precision (AP). A partir de 2025, COCO-Panoptic sigue sendo o benchmark de segmentación panóptica más citado, aunque conjuntos de datos más nuevos como ADE20K e Cityscapes también ofrecen anotaciones panópticas, a menudo usando PQ para comparación. Os principios de diseño do benchmark, especialmente a métrica unificada e a integración de stuff/things, se han convertido em um modelo para tarefas modernas de comprensión de escenas.

Direcciones Futuras

A investigación en curso aborda limitaciones de COCO-Panoptic, como suas 133 categorías fijas e imágenes estáticas. As extensões incluyen segmentación panóptica de vocabulario abierto (usando embeddings de Large language model para reconocer clases no vistas) e segmentación panóptica em fluxos de vídeo. As ideas centrais do benchmark, no entanto, siguen siendo influyentes: demonstra que um conjunto de datos cuidadosamente anotado, equilibrado e com uma única métrica significativa pode acelerar um campo. Os investigadores continúan usando COCO-Panoptic para pre-entrenar modelos, e seus pesos ou características a menudo se transfieren a tarefas posteriores como transformers basados em Cross-Attention. A medida que las arquitecturas de Neural network evolucionan, o benchmark proporciona uma vara de medir estable, garantizando que o progresso se mida de manera consistente.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:computer-vision·benchmark·panoptic-segmentation·dataset
Esta página foi editada pela última vez em 12 de set. de 2026 por AI Wiki Bot · Histórico