COCO(Common Objects in Context) 데이터셋은 객체 탐지, 분할, 이미지 캡셔닝 연구를 발전시키기 위해 설계된 대규모 이미지 모음입니다. 2014년 마이크로소프트, 페이스북 AI 리서치 및 기타 기관의 연구자들 협력으로 출시되었으며, 컴퓨터 비전 모델 평가를 위한 표준화된 벤치마크를 제공합니다. 이 데이터셋은 330,000개 이상의 이미지를 포함하며, 그중 200,000개 이상이 라벨링되어 있고, 80개 객체 범주에 걸쳐 250만 개의 라벨링된 인스턴스를 포함합니다. 맥락적 장면과 비전형적 객체에 대한 강조는 단일 객체 분류에 초점을 맞춘 ImageNet과 같은 초기 데이터셋과 차별화됩니다.
COCO는 기존 데이터셋의 한계, 특히 전형적이고 중앙에 위치한 객체에 대한 편향을 해결하기 위해 만들어졌습니다. 주석 과정은 각 객체에 대한 세부 다각형 분할을 포함하여 픽셀 수준 작업을 가능하게 했습니다. 이 데이터셋은 또한 150,000개 이상의 이미지에 대한 캡션을 포함하여 다중 모드 연구를 지원합니다. 출시 이후 COCO는 객체 탐지 및 분할 알고리즘 평가의 사실상 표준이 되었으며, 2020년까지 COCO 컨소시엄이 주최하는 연례 챌린지가 개최되었습니다.
데이터셋 구조 및 주석
COCO 데이터셋은 세 가지 주요 분할로 구성됩니다: 훈련(118,000개 이미지), 검증(5,000개 이미지), 테스트(20,000개 이미지, 챌린지 평가를 위해 주석 비공개). 각 이미지는 경계 상자, 분할 마스크, 사람 인스턴스의 키포인트로 주석이 달려 있습니다. 80개 객체 범주에는 사람, 자전거, 자동차, 개, 컵과 같은 일상적인 항목이 포함되어 일상 장면을 포괄하도록 선택되었습니다. 주석은 크라우드소싱 플랫폼을 통해 생성되었으며, 일관성을 보장하기 위한 품질 관리 메커니즘이 적용되었습니다. 이 데이터셋은 또한 캡셔닝 작업을 위해 이미지당 5개의 캡션을 포함하며, 인간 주석자가 생성했습니다.
컴퓨터 비전에 미친 영향
COCO는 머신 러닝 및 딥 러닝의 비전 작업 발전을 크게 촉진했습니다. 이 데이터셋의 복잡성 - 겹치는 객체, 다양한 규모, 복잡한 배경 - 은 연구자들이 더 강력한 모델을 개발하도록 추진했습니다. COCO 평가 지표, 특히 여러 Intersection over Union(IoU) 임계값에서의 평균 정밀도(AP) 도입은 알고리즘 비교의 표준이 되었습니다. COCO에서 훈련된 모델, 예를 들어 ResNet 기반 탐지기와 이후 Transformer 기반 아키텍처는 정확도에서 극적인 개선을 달성했습니다. 이 데이터셋은 또한 인스턴스 분할 연구를 촉진하여 Mask R-CNN과 같은 아키텍처 개발로 이어졌습니다.
챌린지 및 확장
2015년부터 2020년까지 개최된 연례 COCO 챌린지는 Google DeepMind, OpenAI, Amazon Web Services를 포함한 학계 및 산업계의 수백 개 팀을 끌어들였습니다. 이러한 대회는 탐지, 분할, 키포인트 추정, 파놉틱 분할과 같은 작업에 초점을 맞췄습니다. 2018년에는 COCO-Stuff 주석으로 데이터셋이 확장되어 장면 이해를 위한 91개 스터프 범주(예: 하늘, 잔디, 벽)가 추가되었습니다. COCO 데이터셋은 또한 범주 수를 1,200개 이상으로 확장한 LVIS(Large Vocabulary Instance Segmentation)와 같은 파생 데이터셋에 영감을 주었습니다. 오래되었음에도 불구하고 COCO는 사전 훈련 및 벤치마킹에 널리 사용되며, 많은 최근 신경망 모델이 검증 세트에서 성능을 보고합니다.
기술 사양 및 사용
COCO의 이미지는 JPEG 형식으로 저장되며 평균 해상도는 640x480 픽셀이지만 크기는 다양합니다. 주석은 JSON 형식으로 제공되며, 각 이미지에는 범주 ID, 경계 상자 좌표, 분할 다각형이 있는 객체 목록이 포함됩니다. 이 데이터셋은 허용적 라이선스 하에 학술 및 상업적 용도로 무료로 제공됩니다. 연구자들은 일반적으로 COCO에서 훈련할 때 일반화를 개선하기 위해 데이터 증강 기법을 사용합니다. 이 데이터셋의 크기와 복잡성은 상당한 계산 리소스를 요구합니다. COCO에서 최첨단 탐지기를 훈련하는 것은 종종 여러 GPU를 며칠 동안 사용해야 합니다. COCO API와 같은 도구는 주석 로딩 및 평가를 용이하게 하는 Python 라이브러리입니다.
유산 및 향후 방향
COCO의 영향은 객체 탐지를 넘어 생성형 AI 및 이미지 생성 영역으로 확장됩니다. 그 캡션은 텍스트 프롬프트에서 이미지를 생성하는 모델을 포함한 비전-언어 모델 훈련에 사용되었습니다. 이 데이터셋의 주석은 또한 파놉틱 분할 및 밀집 캡셔닝과 같은 작업에 재사용되었습니다. Open Images 및 Objects365와 같은 최신 데이터셋이 더 큰 규모를 제공하지만, COCO의 균형 잡힌 범주와 고품질 주석은 관련성을 유지합니다. 2024년 현재 COCO는 학술 논문의 주요 벤치마크로 남아 있으며, 그 지표는 매년 수백 개의 출판물에서 인용됩니다. 이 데이터셋의 설계 원칙 - 맥락적 다양성, 정밀한 주석, 표준화된 평가 - 은 향후 비전 데이터셋의 템플릿을 설정했습니다.