COCO-Panoptic은 의미론적 분할(모든 픽셀을 범주로 분류)과 인스턴스 분할(개별 객체 인스턴스 감지 및 분할)을 통합하는 컴퓨터 비전 작업인 범주형 분할(panoptic segmentation)을 위한 벤치마크 데이터셋이자 평가 지표입니다. Common Objects in Context(COCO) 데이터셋의 확장으로 도입된 이 벤치마크는 'stuff'(하늘, 잔디, 도로와 같은 무정형 배경 영역)와 'things'(사람, 자동차, 동물과 같은 셀 수 있는 객체)를 모두 단일 출력으로 예측하는 모델을 훈련하고 평가하는 표준화된 방법을 제공합니다. 이 벤치마크는 해당 분야의 사실상 표준이 되었으며, 자율 주행, 로봇 공학, 증강 현실과 같은 응용 분야의 장면 이해 발전을 주도하고 있습니다.
이 벤치마크는 Alexander Kirillov, Kaiming He, Ross Girshick, Piotr Dollár가 작성한 2019년 논문 'Panoptic Segmentation'에서 제안되었으며, IEEE/CVF 컴퓨터 비전 및 패턴 인식 회의(CVPR)에서 발표되었습니다. 저자들은 범주형 분할을 새로운 작업으로 정의하고 기존 COCO 데이터셋의 하위 집합을 재주석하여 COCO-Panoptic을 만들었습니다. 데이터셋은 원래 COCO 훈련/검증/테스트 분할에서 파생된 118,000개의 훈련 이미지, 5,000개의 검증 이미지, 20,000개의 테스트 이미지를 포함합니다. 여기에는 80개의 'thing' 클래스(원래 COCO 객체 범주)와 53개의 'stuff' 클래스에 대한 주석이 포함되어 총 133개 범주를 구성합니다. stuff 주석은 이전에 COCO 인스턴스 주석에서 레이블이 지정되지 않았던 물, 땅, 하늘과 같은 영역에 대한 밀집 픽셀 단위 레이블로 추가되었습니다.
COCO-Panoptic은 범주형 품질(PQ)이라는 통합 평가 지표를 도입했습니다. PQ는 분할 품질과 인식 품질을 단일 점수로 결합하며, 감지 품질(DQ)과 분할 품질(SQ)의 곱으로 계산됩니다. 각 클래스에 대해 PQ는 예측 세그먼트와 실제 세그먼트를 매칭(IoU 임계값 0.5)하고, 참양성(true positives)을 합산한 다음, 참양성 합에 거짓양성(false positives)과 거짓음성(false negatives)의 절반을 더한 값으로 나누어 계산됩니다. 이 지표는 stuff와 things를 동등하게 취급하여 어느 쪽으로도 편향되지 않도록 합니다. 이러한 설계는 모델이 작은 객체와 큰 배경 영역 모두에서 우수한 성능을 발휘하도록 장려하며, 이는 범주형 분할의 핵심 과제입니다.
작업 정의 및 이전 연구와의 관계
범주형 분할은 의미론적 분할과 인스턴스 분할 사이에 위치합니다. 의미론적 분할은 모든 픽셀에 클래스 레이블을 할당하지만 클래스 내 개별 객체를 구분하지 않습니다(예: 두 대의 자동차가 병합됨). 인스턴스 분할은 각 객체를 개별적으로 식별하지만 일반적으로 레이블이 없는 배경 영역을 무시합니다. 범주형 분할은 각 픽셀이 thing 인스턴스(ID 포함) 또는 stuff 클래스인 단일 레이블링을 생성하여 완전한 장면 설명을 제공합니다. COCO-Panoptic 벤치마크는 결합 분할에 대한 이전 연구를 기반으로 이 작업을 공식화했습니다. 특히, 데이터셋은 COCO와 동일한 이미지를 사용하여 기존 모델 및 도구와의 호환성을 보장하면서 주석 세분성을 확장합니다.
데이터셋 통계 및 주석 프로세스
COCO-Panoptic의 주석 파이프라인은 광범위한 인간 노력을 수반했습니다. stuff 클래스는 두 단계 접근 방식으로 주석이 추가되었습니다. 첫째, 크라우드소싱 작업자가 컬러 이미지의 각 stuff 영역에 대해 다각형을 그렸고, 둘째, 품질 관리 검토자가 겹침과 경계를 수정했습니다. 각 주석은 16비트 클래스 ID가 있는 단일 채널 PNG 마스크로 저장됩니다. 데이터셋에는 'panoptic' JSON 파일(세그먼트 정보 포함)과 밀집 마스크 이미지가 모두 포함됩니다. 원래 COCO 인스턴스 분할 레이블은 things에 대해 유지되었지만, 인스턴스 마스크가 stuff 영역과 겹치는 경우(예: 보도에 서 있는 사람), 아래의 stuff 레이블은 thing 마스크에서 제외되어 픽셀 전용 레이블을 보장했습니다. 이 세심한 레이블링은 동반 논문에 보고된 대로 높은 평가자 내 및 평가자 간 일치도를 가진 데이터셋을 생성했습니다(인간 주석자의 PQ는 참조 상한으로 사용됨).
평가 및 과제
COCO-Panoptic은 공식 평가 서버를 도입하여 연구자가 예측을 제출하고 133개 클래스 전체에 걸쳐 PQ 점수를 받을 수 있게 했습니다. 높은 PQ를 달성하는 과제는 전역 컨텍스트가 필요한 크고 무정형의 stuff 영역과 정밀한 경계가 필요한 작고 밀집된 thing 인스턴스를 모두 처리하는 데 있습니다. 초기 기준 모델은 Residual Network (ResNet) 기반 특징 추출기 및 U-Net 스타일 디코더와 같은 기존 아키텍처를 확장했지만, 이 작업은 새로운 설계를 촉진했습니다. 예를 들어, 일부 방법은 stuff와 things에 대해 별도의 헤드를 사용한 다음 결과를 융합하는 반면, 다른 방법은 엔드투엔드 트랜스포머 기반 접근 방식(예: Mask2Former)을 채택합니다. 이 벤치마크는 방법을 동등한 조건에서 비교하는 데 중요한 역할을 했으며, 최고 점수는 2019년 검증 세트의 약 42 PQ에서 최근 최첨단 모델의 60 PQ 이상으로 향상되었습니다. 이 지표는 각 클래스가 동일하게 기여하므로 클래스 불균형에도 강건하며, 이는 '하늘'과 같은 stuff 클래스가 '칫솔' 인스턴스보다 훨씬 더 많은 픽셀을 덮기 때문에 중요합니다.
영향 및 관련 벤치마크
COCO-Panoptic의 성공은 이후 데이터셋과 작업에 영향을 미쳤습니다. 비디오(예: Cityscapes-VPS)로 확장되었고 실제 응용 분야에 채택되었습니다. 이 벤치마크는 Artificial intelligence 및 Deep learning 연구의 목표와 일치하며, 여기서 전체론적 인식은 구현 에이전트로 가는 디딤돌입니다. 특히, COCO-Panoptic 주석은 COCO-Stuff 데이터셋(모든 COCO 이미지에 대한 stuff 전용 레이블 제공)에서 사용되며 Detectron2 및 MMDetection과 같은 주요 프레임워크의 Data Augmentation 도구 키트에 통합되었습니다. 평가 지표 PQ는 널리 채택되었으며, 많은 논문이 평균 교차점(IoU) 및 평균 정밀도(AP)와 같은 전통적인 지표와 함께 이를 보고합니다. 2025년 현재 COCO-Panoptic은 가장 많이 인용된 범주형 분할 벤치마크로 남아 있지만, ADE20K 및 Cityscapes와 같은 최신 데이터셋도 범주형 주석을 제공하며 종종 PQ를 비교에 사용합니다. 이 벤치마크의 설계 원칙, 특히 통합 지표와 stuff/thing 통합은 현대 장면 이해 작업의 템플릿이 되었습니다.
향후 방향
진행 중인 연구는 COCO-Panoptic의 한계(고정된 133개 범주 및 정적 이미지)를 해결합니다. 확장에는 개방 어휘 범주형 분할(Large language model 임베딩을 사용하여 보이지 않는 클래스 인식) 및 비디오 스트림의 범주형 분할이 포함됩니다. 그러나 벤치마크의 핵심 아이디어는 여전히 영향력이 있습니다. 신중하게 주석이 추가되고 균형 잡힌 데이터셋과 단일 의미 있는 지표가 분야를 가속화할 수 있음을 보여줍니다. 연구자들은 계속해서 COCO-Panoptic을 모델 사전 훈련에 사용하며, 그 가중치 또는 특징은 Cross-Attention 기반 트랜스포머와 같은 다운스트림 작업으로 전송되는 경우가 많습니다. Neural network 아키텍처가 진화함에 따라 벤치마크는 안정적인 기준을 제공하여 진행 상황이 일관되게 측정되도록 보장합니다.