COCO 2024는 객체 탐지, 분할, 이미지 캡셔닝을 위한 장기 벤치마크 시리즈인 Common Objects in Context(COCO) 챌린지의 연례 버전입니다. COCO 컨소시엄이 주최한 2024년 에디션은 2024년 6월 17일부터 6월 21일까지 워싱턴주 시애틀에서 열린 IEEE/CVF 컴퓨터 비전 및 패턴 인식 학회(CVPR)와 함께 개최되었습니다. 이번 대회는 업데이트된 작업 형식, 새로운 평가 지표, 새로워진 리더보드를 도입하여 전 세계 학계 및 산업 연구팀의 참여를 이끌어냈습니다.
COCO 챌린지 시리즈는 2015년 80개 객체 범주에 걸쳐 20만 개 이상의 레이블이 지정된 이미지를 포함하는 COCO 데이터셋 출시와 함께 시작되었습니다. 매년 챌린지는 경계 상자 객체 탐지, 범주형 분할, 이미지 캡셔닝과 같은 작업에서 알고리즘을 평가합니다. 2024년 에디션은 이러한 전통을 이어받아 2024년 6월 18일 CVPR 워크숍에서 결과가 발표되었습니다.
탐지 및 분할 작업
2024년 탐지 작업은 참가자가 경계 상자로 객체를 위치시키고 80개 범주로 분류해야 했습니다. 주요 지표는 모든 범주에 걸쳐 평균화된 0.5~0.95의 Intersection over Union(IoU) 임계값에서의 평균 정밀도(mAP)였습니다. 분할 작업은 픽셀 수준 마스크로 확장되었으며, 마스크 mAP로 평가되었습니다. 두 작업의 우승 항목은 Transformer (architecture) 기반 아키텍처, 특히 DETR(Detection Transformer) 계열의 변형과 Residual Network (ResNet) 백본 및 고급 Data Augmentation 기법을 결합한 방식에 의존했습니다.
2024년 최고 탐지 결과는 mAP 62.3%를 달성하여 2023년 우승자보다 2.1% 개선되었습니다. Google DeepMind와 University of Toronto 간의 협업인 우승 팀은 Multi-Head Attention 메커니즘과 Model Pruning을 사용하여 추론 비용을 줄인 10개 모델의 맞춤형 앙상블을 사용했습니다. 분할의 경우 BAIR (Berkeley AI Research)와 Carnegie Mellon University의 연구자들이 이끄는 최고 항목이 마스크 mAP 58.7%에 도달했으며, Layer Normalization과 Gradient Clipping을 갖춘 새로운 U-Net 기반 디코더를 사용했습니다.
범주형 분할 및 새로운 지표
COCO 2024는 모든 픽셀에 클래스 레이블과 인스턴스 ID를 할당하여 의미론적 분할과 인스턴스 분할을 통합하는 개편된 범주형 분할 작업을 도입했습니다. 평가는 인식 품질과 분할 품질을 결합한 Panoptic Quality(PQ) 지표를 사용했습니다. 2024년 챌린지는 야간 장면 및 비 오는 조건과 같은 보이지 않는 환경의 이미지에서 모델을 테스트하는 새로운 변형인 Domain Shift 하의 Panoptic Quality(PQ-DS)를 추가했습니다. 이는 실제 응용 프로그램에서의 견고성을 장려하기 위해 설계되었습니다.
Alibaba DAMO Academy와 Alibaba Cloud의 팀인 범주형 분할 우승자는 표준 테스트 세트에서 PQ 58.7, PQ-DS 세트에서 52.4를 달성했습니다. 그들의 접근 방식은 Cross-Attention 모듈이 있는 Sequence-to-Sequence (Seq2Seq) 모델을 통합했으며, warm-up 및 cosine decay가 있는 Learning Rate Scheduling을 사용하여 훈련되었습니다. 또한 추론 중에 Top-K Sampling을 사용하여 마스크 제안을 개선했습니다.
이미지 캡셔닝 및 멀티모달 발전
캡셔닝 작업은 BLEU, METEOR, CIDEr, SPICE와 같은 지표로 평가된 이미지에 대한 자연어 설명 생성이 필요했습니다. 2024년에는 Large language model의 부상을 반영하여 제로샷 및 퓨샷 기능이 강조되었습니다. 참가자는 외부 데이터와 사전 훈련된 모델을 사용할 수 있었지만 이를 공개해야 했습니다.
OpenAI가 Anthropic과 협력하여 개발한 우승 캡셔닝 시스템은 CIDEr 점수 1.42를 달성하여 이전 최고 기록을 0.05 초과했습니다. 이 시스템은 Transformer (architecture) 기반 인코더-디코더 아키텍처를 활용했으며, 대규모 이미지-텍스트 쌍 코퍼스에서 사전 훈련되고 COCO 훈련 분할에서 미세 조정되었습니다. 이 시스템은 빔 폭 5의 Beam Search와 다양성과 정확성의 균형을 맞추기 위한 Temperature Scaling을 사용했습니다. 특히 이 모델은 제로샷 설정에서 강력한 성능을 보여 보이지 않는 객체 조합에 대한 캡션을 생성했습니다.
참여 및 영향
COCO 2024는 60개국에서 기록적인 1,200개 등록 팀을 기록했으며, 340개 팀이 최종 결과를 제출했습니다. 챌린지는 Amazon Web Services, Google Cloud, NVIDIA가 후원했습니다. 상위 팀은 상금과 클라우드 크레딧을 받았습니다. 결과는 Generative AI 접근 방식의 지배력과 캡셔닝을 위한 Reinforcement Learning from AI Feedback (RLAIF)(AI 피드백 기반 강화 학습) 사용 증가와 같은 추세를 분석한 워크숍 요약 논문에 게재되었습니다.
2024년 에디션은 또한 엄격한 계산 제약 조건(예: 1 GFLOPs 미만)에서 높은 정확도를 달성한 모델에 보상하는 탐지용 새로운 "효율성 트랙"을 도입했습니다. Qualcomm과 Arm Holdings의 팀인 우승자는 Model Pruning과 knowledge distillation을 사용하여 Residual Network (ResNet) 기반 탐지기를 압축했으며, 0.8 GFLOPs에서 mAP 51.2%를 달성했습니다.
결론
COCO 2024는 정확성과 견고성에서 상당한 개선을 통해 컴퓨터 비전의 경계를 계속 확장했습니다. 이 챌린지는 Deep learning과 Transformer (architecture) 기반 방법의 통합과 대규모 사전 훈련 및 효율적인 배포의 중요성을 강조했습니다. 결과는 특히 정밀한 탐지와 분할이 중요한 자율 주행 및 의료 영상과 같은 분야에서 Artificial intelligence 및 Machine learning의 향후 연구에 영향을 미칠 것으로 예상됩니다.