COCO 2019는 컴퓨터 비전 분야에서 널리 인정받는 연례 대회인 Common Objects in Context(COCO) 챌린지의 2019년 버전을 의미한다. 학계 및 산업계 연구자들로 구성된 컨소시엄이 주최하는 이 대회는 객체 탐지, 인스턴스 분할, 이미지 캡셔닝을 포함한 작업에서 알고리즘을 평가한다. 2019년 버전은 2019년 6월 캘리포니아주 롱비치에서 열린 컴퓨터 비전 및 패턴 인식 학회(CVPR)와 함께 개최되었으며, 전 세계 주요 연구 그룹과 기술 기업들의 참여를 이끌어냈다.
2014년에 처음 공개된 COCO 데이터셋은 80개의 객체 범주에 걸쳐 20만 개 이상의 라벨링된 이미지를 포함하며, 150만 개 이상의 객체 인스턴스를 보유하고 있다. 2019년 챌린지는 업데이트된 평가 지표와 새로운 테스트 세트를 도입하여 시각 인식 분야의 최신 기술을 발전시켰다. 2019년 우승작들은 특히 소형 객체 탐지와 세밀한 분할에서 정확도가 크게 향상되었으며, 이는 Deep learning 아키텍처와 훈련 기법의 발전에 힘입은 것이다.
챌린지 트랙 및 작업
COCO 2019 챌린지는 각각 특정 시각 이해 작업에 초점을 맞춘 여러 개의 별도 트랙으로 구성되었다. 주요 트랙은 객체 탐지로, 알고리즘이 경계 상자를 사용하여 이미지 내 객체를 위치시키고 분류해야 했다. 더 까다로운 작업인 인스턴스 분할은 감지된 각 객체에 대한 픽셀 수준의 마스크를 요구했다. 추가 트랙에는 인간 자세 추정을 위한 키포인트 탐지와 시스템이 이미지 내용에 대한 자연어 설명을 생성하는 이미지 캡셔닝이 포함되었다.
각 트랙은 자체 평가 프로토콜을 가졌다. 탐지 및 분할의 경우, 주요 지표는 0.5에서 0.95까지의 여러 교차-결합(IoU) 임계값에서 계산된 평균 정밀도(AP)였다. 캡셔닝은 생성된 캡션과 인간이 작성한 참조 간의 유사성을 측정하는 CIDEr 및 BLEU와 같은 지표로 평가되었다. 챌린지는 또한 개발을 위한 "test-dev" 분할과 최종 순위를 위한 별도의 "test-challenge" 분할을 포함하여 제출물 간의 공정한 비교를 보장했다.
우승 접근법 및 혁신
2019년 우승자들은 Neural network 아키텍처, 특히 Residual Network (ResNet) 계열 및 특징 피라미드 네트워크의 변형을 활용했다. 많은 상위 참가자들은 여러 모델을 결합하여 정확도를 높이는 앙상블 방법을 사용했다. 주목할 만한 추세는 무작위 스케일링, 크롭핑, 색상 지터와 같은 Data Augmentation 기법을 사용하여 일반화를 개선한 것이다. 일부 팀은 또한 훈련을 안정화하고 과적합을 줄이기 위해 Batch Normalization 및 Dropout을 채택했다.
탐지 트랙에서 우승 솔루션은 test-challenge 세트에서 48% 이상의 AP를 달성했으며, 이는 전년도 최고 기록보다 크게 향상된 수치였다. 이는 더 큰 백본 네트워크, 고급 훈련 일정, 소프트 비최대 억제와 같은 후처리 개선의 결합을 통해 이루어졌다. 인스턴스 분할의 경우, 최고 참가자는 정제된 경계 예측을 사용한 마스크 기반 접근법을 사용하여 41% 이상의 AP에 도달했다. 키포인트 탐지 우승자들은 다중 스케일 추론과 히트맵 회귀를 사용하여 COCO 키포인트 벤치마크에서 높은 정확도를 달성했다.
컴퓨터 비전 연구에 미친 영향
COCO 2019는 이후 몇 년간 영향력 있는 여러 연구 방향의 촉매 역할을 했다. 소형 객체 탐지에 대한 강조는 더 높은 해상도의 특징 맵과 다중 스케일 훈련 전략의 개발을 촉진했다. 챌린지는 또한 많은 참가자들이 정확도를 유지하면서 계산 비용을 줄이기 위해 Model Pruning 및 지식 증류를 탐구함에 따라 모델 효율성의 중요성을 부각시켰다.
COCO 2019의 결과는 학술 문헌에서 널리 인용되었으며, Generative AI 시스템에서 사용되는 모델을 포함한 이후 비전 모델의 설계에 영향을 미쳤다. 챌린지의 엄격한 평가 프레임워크는 PASCAL VOC 및 ImageNet과 같은 다른 데이터셋과 함께 객체 탐지 및 분할 알고리즘을 비교하기 위한 표준 벤치마크가 되었다. 또한, 대회의 협력적 성격은 지식 공유를 촉진했으며, 많은 팀이 자신들의 방법을 상세히 설명하는 기술 보고서를 발표했다.
유산 및 후속 버전
2019년 버전 이후, COCO 챌린지는 계속 진화했다. 2020년 버전은 의미 분할과 인스턴스 분할을 결합한 전역 분할(panoptic segmentation)과 같은 새로운 작업을 도입했다. 이후 몇 년간 Transformer (architecture) 기반 아키텍처가 통합되었으며, 이는 결국 리더보드를 지배하게 되었다. COCO 데이터셋은 컴퓨터 비전에서 Machine learning 모델을 훈련하고 평가하기 위한 기초 자원으로 남아 있으며, 그 주석은 수많은 연구 프로젝트에서 사용된다.
COCO 2019는 또한 학계를 넘어 더 넓은 영향을 미쳤다. 챌린지 기간 동안 정제된 많은 기법들이 자율 주행 시스템과 의료 영상 도구를 포함한 상업 제품에 채택되었다. 챌린지가 폐색된 객체와 복잡한 장면과 같은 실제 시나리오에 중점을 둔 것은 실험실 연구와 실제 응용 간의 격차를 줄이는 데 도움이 되었다. 2020년대 중반 현재, COCO 벤치마크는 시각 인식의 진전을 측정하는 기준점으로 계속 사용되고 있으며, 2019년 버전은 새로운 성능 기록을 세우고 혁신의 물결을 고무한 중추적인 해로 기억된다.