COCO 인스턴스 분할은 마이크로소프트 COCO(Common Objects in Context) 데이터셋에 의해 정의된 컴퓨터 비전 분야의 벤치마크 작업이다. 목표는 이미지에서 객체의 모든 인스턴스를 감지하고 각 인스턴스의 윤곽을 정밀하게 나타내는 픽셀 수준 마스크를 생성하여, 동일한 클래스의 개별 객체를 구분하는 것이다. 이 작업은 사람, 자동차, 개와 같은 셀 수 있는 객체인 80개의 "사물" 클래스를 다루며, 하늘이나 잔디와 같은 "배경" 클래스와는 대조된다. 이는 위치 파악과 세밀한 공간 이해를 모두 요구하는 작업에서 딥러닝 모델의 성능을 평가하는 데 널리 사용된다.
COCO 데이터셋은 2014년 마이크로소프트 팀에 의해 처음 출시되었으며, 인스턴스 분할 주석은 2015년 버전에 추가되었다. 데이터셋에는 20만 장 이상의 이미지가 포함되어 있으며, 150만 개 이상의 객체 인스턴스가 경계를 정의하는 다각형으로 레이블링되어 있다. 공식 평가 지표는 0.5에서 0.95까지 0.05 단계의 Intersection over Union(IoU) 임계값에 대해 평균화된 평균 정밀도(AP)이며, 소형, 중형, 대형 객체에 대한 추가 지표도 포함된다. 흔히 COCO AP라고 불리는 이 지표는 인스턴스 분할 모델을 비교하는 사실상의 표준이 되었다.
모델의 진화
초기 인스턴스 분할 접근법은 객체 감지 프레임워크를 기반으로 구축되었다. 2017년 페이스북 AI 연구소의 Kaiming He와 동료들이 도입한 Mask R-CNN 아키텍처는 Faster R-CNN 감지기를 확장하여 경계 상자 회귀와 병렬로 분할 마스크를 예측하는 분기를 추가했다. Mask R-CNN은 이전 방법보다 크게 개선된 성능을 달성했으며 COCO 테스트 세트에서 약 35 AP에 도달하는 강력한 기준을 세웠다. 그 성공은 다중 스케일 특징 추출을 위한 Feature Pyramid Network와 함께 ResNet 백본의 사용을 대중화했다.
이후 모델들은 정확도와 효율성을 개선했다. 2019년에 도입된 YOLACT는 프로토타입 마스크를 생성하고 이를 인스턴스별 계수와 결합하는 실시간 접근법을 제안하여 정확도에 약간의 비용을 들여 더 빠른 추론을 달성했다. 2020년에는 Cascade Mask R-CNN 변형이 감지기 계단식 적용을 통해 AP를 개선했다. 2020년 페이스북 AI가 도입한 DETR 모델은 트랜스포머 인코더-디코더 아키텍처를 사용하여 객체 감지를 집합 예측 문제로 취급함으로써 앵커 박스와 비최대 억제와 같은 수작업 구성 요소를 제거했다. DETR과 Mask2Former(2021)와 같은 후속 모델은 단일 마스크 분류 프레임워크 아래 인스턴스, 파놉틱, 의미론적 분할 작업을 통합했다.
평가 및 지표
COCO 인스턴스 분할의 주요 지표는 평균 정밀도(AP)로, 모든 예측 마스크를 신뢰도로 정렬하고 다양한 IoU 임계값에서 정밀도와 재현율을 측정하여 계산된다. 공식 COCO 평가는 IoU 0.50과 0.75에서의 AP를 별도로 보고하며, 객체 크기별 AP도 보고한다: 소형(면적 32^2 픽셀 미만), 중형(32^2와 96^2 사이), 대형(96^2 초과). 챌린지는 또한 이미지당 고정된 감지 수로 평균 재현율(AR)을 추적한다. 이러한 지표는 모델이 소형 객체 감지에 어려움을 겪는 반면 대형 객체에서는 뛰어날 수 있으므로 세부적인 비교를 가능하게 한다.
COCO test-dev 세트는 연례 챌린지에 사용되지만, 연구자들은 더 빠른 반복을 위해 검증 세트(val2017)에서 결과를 보고하는 경우가 많다. 데이터셋은 train2017(약 118,000개 이미지)과 val2017(5,000개 이미지)로 분할된다. 공식 평가 서버는 일관된 평가를 강제하지만, 많은 논문은 로컬에서 pycocotools 라이브러리를 사용하여 지표를 계산하기도 한다.
응용 및 영향
인스턴스 분할은 자율 주행, 로봇 공학, 의료 영상, 증강 현실과 같이 정밀한 객체 경계가 필요한 응용 분야에 중요하다. 자율 주행에서 보행자, 차량, 도로 객체를 분할하는 것은 인식 시스템이 장면을 이해하는 데 도움을 준다. 로봇 공학에서는 픽셀 수준 마스크가 특정 객체의 파지와 조작을 가능하게 한다. COCO 벤치마크는 이러한 분야의 빠른 발전을 주도했으며, 최첨단 모델은 2017년 약 35 AP에서 2024년 60 AP 이상으로 개선되었으며, 이는 주로 신경망 아키텍처, 데이터 증강 기술, 훈련 전략의 발전 덕분이다.
이 작업은 또한 관련 문제의 기초 역할을 한다. 파놉틱 분할은 인스턴스 분할과 의미론적 분할을 결합하여 모델이 모든 픽셀에 클래스와 인스턴스 ID를 모두 레이블링하도록 요구한다. COCO 데이터셋은 파놉틱 주석을 포함하도록 확장되었으며, Mask2Former와 같은 모델은 두 작업을 모두 처리한다. 또한 인스턴스 분할은 정밀한 마스크가 대상 수정을 가능하게 하는 생성 모델의 이미지 편집에 사용된다.
과제 및 한계
진전에도 불구하고 COCO 인스턴스 분할은 여전히 어려운 작업이다. 소형 객체는 제한된 픽셀 정보로 인해 특히 어렵고, 가려지거나 겹치는 인스턴스는 모델을 혼란시킬 수 있다. 80개의 사물 클래스는 불균형하며, 사람과 자동차 같은 일반적인 클래스가 지배하는 반면 헤어 드라이어와 칫솔 같은 희귀 클래스는 예시가 거의 없다. 데이터셋은 또한 서양 맥락의 이미지가 우세한 것과 같은 편향을 가지고 있어 모델 일반화에 영향을 줄 수 있다. 2025년 현재 연구자들은 더 나은 손실 함수, 효율성을 위한 모델 가지치기, 더 크고 다양한 데이터셋 개발을 통해 이러한 문제를 계속 해결하고 있다.
또 다른 한계는 최첨단 모델 훈련의 높은 계산 비용으로, 종종 여러 GPU와 며칠간의 훈련이 필요하다. 이는 효율적인 아키텍처와 가지치기 기술에 대한 관심을 불러일으켰다. COCO 벤치마크는 진행 상황을 측정하는 핵심 도구로 남아 있지만, 일부에서는 포화 상태에 이르렀다고 주장하며 1,200개 이상의 클래스를 가진 LVIS(Large Vocabulary Instance Segmentation)와 같은 더 도전적인 벤치마크의 생성을 촉진하고 있다.