COCO 2020은 컴퓨터 비전 분야의 오랜 기간 운영된 벤치마크 및 경쟁 시리즈인 Common Objects in Context(COCO) 챌린지의 2020년 판을 의미한다. 학계 및 산업계 연구자들로 구성된 컨소시엄이 주최한 이 챌린지는 객체 탐지, 인스턴스 분할, 이미지 캡셔닝 등의 작업에서 알고리즘을 평가한다. 2020년 판은 2020년 6월 컴퓨터 비전 및 패턴 인식 학회(CVPR)와 함께 개최되었으나, COVID-19 팬데믹으로 인해 물리적 행사는 가상 형식으로 대체되었다. 이 챌린지는 주요 연구 그룹과 기술 기업들의 참여를 끌어모았으며, 결과는 온라인으로 발표되었다.
COCO 데이터셋 자체는 2014년에 처음 공개되었으며, 80개의 객체 범주에 걸쳐 20만 개 이상의 레이블이 지정된 이미지를 포함하고, 150만 개 이상의 객체 인스턴스를 보유한다. 2020년 챌린지는 2017년 버전의 데이터셋을 사용했으며, 이는 이미지를 훈련(118,000개), 검증(5,000개), 테스트(20,000개) 세트로 나눈다. 탐지 및 분할의 주요 평가 지표는 다양한 교차-결합(IoU) 임계값에서의 평균 정밀도(AP)이며, 주요 지표는 IoU 0.50:0.95에서의 AP이다. 캡셔닝의 경우 BLEU, METEOR, ROUGE, CIDEr, SPICE 지표가 포함된다.
챌린지 작업 및 우승자
2020년 챌린지에는 탐지, 인스턴스 분할, 키포인트 탐지, 이미지 캡셔닝 등 여러 트랙이 포함되었다. 탐지 작업에서 우승 팀은 테스트-개발 세트에서 AP 0.617을 달성했으며, 이는 2019년 우승자의 0.493에 비해 상당한 개선이다. 최고 솔루션은 Deep learning 아키텍처의 변형을 포함한 고급 구조를 사용했으며, Residual Network (ResNet) 및 Neural network 설계와 Batch Normalization 및 Dropout 기법을 활용했다. 인스턴스 분할 우승자는 AP 0.582를, 키포인트 탐지 우승자는 AP 0.764를 달성했다. 캡셔닝의 경우 최고 모델은 Transformer (architecture) 기반 Sequence-to-Sequence (Seq2Seq) 아키텍처와 Multi-Head Attention 및 Positional Encoding을 사용하여 CIDEr 1.302를 기록했다.
기술 혁신
COCO 2020 참가자들은 여러 방향에서 최첨단 기술을 발전시켰다. 많은 상위 참가자들은 일반화를 개선하기 위해 무작위 자르기, 크기 조정, 색상 지터를 포함한 Data Augmentation 전략을 사용했다. 코사인 어닐링 및 워밍업과 같은 Learning Rate Scheduling 기법이 널리 채택되었다. 일부 팀은 정확도를 유지하면서 계산 비용을 줄이기 위해 Model Pruning을 사용했다. Adam 및 Adam (Optimizer)와 같은 Stochastic Gradient Descent Variants의 사용이 일반적이었으며, 종종 Gradient Clipping과 결합하여 훈련을 안정화했다. Layer Normalization 및 Batch Normalization은 네트워크의 다른 부분에서 모두 적용되었다. 이 대회는 또한 Natural language processing 연구의 Transformer (architecture) 혁신을 기반으로 탐지 헤드에서 Cross-Attention 메커니즘의 사용이 증가하는 것을 보였다.
영향 및 유산
COCO 2020 결과는 이후 컴퓨터 비전 연구에 영향을 미쳤다. 우승 아키텍처와 훈련 레시피는 자율 주행, 로봇 공학, 의료 영상 분야의 Artificial intelligence 애플리케이션을 포함한 많은 후속 프로젝트에서 채택되었다. 이 챌린지는 대규모 Machine learning의 중요성과 높은 정확도 달성에서 Neural network 설계의 역할을 강조했다. COCO 벤치마크는 표준 평가 도구로 남아 있으며, 2020년 판은 향후 대회를 위한 새로운 기준을 설정했다. 이 행사는 또한 MIT CSAIL, Stanford AI Lab, BAIR (Berkeley AI Research)와 같은 학술 기관과 Google DeepMind 및 OpenAI와 같은 산업 연구소 간의 협력을 촉진했지만, 우승 팀의 정확한 소속은 다양했다.
다른 벤치마크와의 비교
COCO 2020이 객체 수준 이해에 초점을 맞춘 반면, ImageNet과 같은 다른 벤치마크는 이미지 분류를 대상으로 한다. COCO의 인스턴스 분할 및 캡셔닝 강조는 이를 더 어렵게 만들고 실제 세계 장면 이해에 더 가깝게 했다. 2020년 판에서는 최고 성능과 평균 성능 사이에 눈에 띄는 격차가 있어 개선 여지가 있음을 나타냈다. 결정론적인 Chess computer 벤치마크와 달리 COCO 작업은 시각적 변동성과 모호성을 처리해야 한다. 이 대회는 또한 텍스트 생성보다 시각적 인식에 중점을 두어 Large language model 평가와 달랐다. 이러한 차이에도 불구하고 캡셔닝의 Top-K Sampling과 같은 COCO 2020의 기술은 Generative AI 모델에서 유사점을 찾았다.
향후 방향
COCO 2020 이후 커뮤니티는 더 많은 범주와 긴 꼬리 분포를 포함하는 LVIS 및 Open Images와 같은 더 포괄적인 벤치마크로 이동했다. 2020년 챌린지의 효율성 초점은 Arm Holdings 및 Qualcomm과 같은 엣지 장치에 배포 가능한 경량 모델에 대한 연구를 촉진했다. 2020년에 대중화된 Transformer (architecture) 기반 탐지기의 사용은 이후 몇 년 동안 주류가 되었다. COCO 2020 데이터셋과 결과는 많은 Deep learning 프레임워크에서 사전 훈련 및 평가에 계속 사용된다. 2025년 현재 COCO는 여전히 참조 지점으로 남아 있지만, 더 높은 해상도와 비디오 데이터를 가진 새로운 데이터셋이 등장하고 있다.