COCO 2014(Common Objects in Context)는 Microsoft COCO 데이터셋의 최초 공개 버전으로, 객체 탐지, 분할, 이미지 캡셔닝을 발전시키기 위해 설계된 대규모 이미지 컬렉션이다. 2014년 Tsung-Yi Lin, Michael Maire, Serge Belongie, James Hays, Pietro Perona, Deva Ramanan, Piotr Dollár, C. Lawrence Zitnick이 발표한 논문에서 처음 소개되었으며, 이 데이터셋은 80개 객체 범주에 걸쳐 250만 개 이상의 레이블링된 인스턴스를 포함한 328,000개의 이미지로 구성된다. 이 데이터셋의 정의적 특징은 객체가 자연스러운 공간 관계를 유지하는 일상적인 장면에 초점을 맞춘다는 점으로, 종종 중앙에 위치한 고립된 대상을 특징으로 했던 ImageNet과 같은 초기 데이터셋과 대조된다.
2014년 릴리스는 벤치마크 관례로 자리 잡은 표준 훈련/검증(val) 분할을 확립했다. 훈련 세트는 82,783개의 이미지를 포함하고, 검증 세트는 40,504개의 이미지를 보유하며, 별도의 테스트 세트(40,775개 이미지)는 평가에 사용되었지만 과적합을 방지하기 위해 한동안 레이블이 공개되지 않았다. 주석에는 경계 상자뿐만 아니라 인스턴스별 분할 다각형, 이미지당 5개의 자연어 캡션, 그리고 일부 하위 집합에 대해 인간 자세 추정을 위한 키포인트 주석(구체적으로 5,000개의 훈련 이미지와 2,000개의 검증 이미지에 17개 신체 관절)이 포함된다. 이 데이터셋은 또한 이미지 수준의 장면 범주와 맥락을 위한 "stuff" 범주(예: 하늘, 잔디)를 포함하지만, 이러한 요소는 이후 릴리스에서 더 완전하게 개발되었다.
주석 형식과 과제
COCO 2014는 업계 표준이 된 JSON 기반 주석 형식을 도입했다. 각 이미지는 다각형 좌표 배열로 저장되는 세그먼트와 연결되며, 인스턴스는 극단점에서 파생된 경계 상자를 가질 수도 있다. 실제 세계의 난이도를 반영하기 위해 데이터셋은 의도적으로 작고, 가려지고, 잘린 객체를 포함하며, 일부 인스턴스에는 많은 탐지 챌린지가 무시한 "어려움" 플래그가 지정된다. 공식 평가 지표인 여러 Intersection-over-Union(IoU) 임계값(0.5에서 0.95까지 0.05 단계)에서의 Average Precision(AP)은 정밀한 마스크와 상자를 생성하는 방법을 장려하여, 단순한 대략적 위치 파악을 넘어 분야를 발전시켰다.
컴퓨터 비전 연구에 미친 영향
COCO 2014 릴리스는 2015년 COCO 탐지 챌린지를 시작으로 일련의 챌린지를 촉발했으며, 이는 ICCV 및 CVPR과 같은 주요 학회와 함께 진행되었다. 우승 시스템은 전통적인 수작업 특징에서 합성곱 신경망 기반의 초기 딥러닝 모델로 빠르게 발전했다. 데이터셋의 규모와 주석 세부 수준 덕분에 연구자들은 분할 및 자세 추정을 위해 잔차 네트워크 및 기타 아키텍처를 훈련할 수 있었고, 이는 범주형 분할과 같은 후속 작업의 기초 자원이 되었다. 캡션은 또한 이미지 캡셔닝을 위한 시퀀스-투-시퀀스 모델 개발을 촉진하여 다중 모달 학습의 부상에 직접 기여했다.
현대 AI 개발에서의 역할
2020년대 기준으로 COCO 2014는 인공지능 분야에서 가장 많이 인용된 데이터셋 중 하나로 남아 있다. 이는 객체 탐지에서 신경망을 평가하기 위한 공통 테스트베드 역할을 하며, Detectron2 및 YOLO와 같은 프레임워크는 정기적으로 해당 지표를 보고한다. 2014년 분할은 특히 재현성 측면에서 가치가 있다. 훈련/검증 분할 크기를 변경하고 118k/5k 이미지로 전환한 이후의 COCO 2017 버전과 달리, 2014년 버전의 정확한 구성은 널리 보관되고 연구되었기 때문이다. 많은 머신 러닝 실무자는 사전 훈련된 모델과 코드베이스가 종종 2014년 디렉터리 구조와 주석 ID를 기대하기 때문에 여전히 원본을 다운로드한다.
이후 릴리스와의 차이점
COCO 2014는 여러 기술적 측면에서 2017년 버전과 구별된다. 2014년 훈련 세트는 82,783개의 이미지를 포함하는 반면, 2017년 훈련 세트는 118,287개를 가지며, 2014년 검증 세트(40,504개)는 2017년(5,000개)보다 훨씬 크다. 2017년 테스트 세트도 더 컸다. 또한 2014년 릴리스에는 공식적인 '레이블 없는' 하위 집합이 없었지만, 2017년에는 준지도 학습을 위해 123,000개의 레이블 없는 이미지가 추가되었다. 2014년의 키포인트 주석은 수천 개의 이미지에만 제공되는 반면, 2017년에는 모든 훈련 및 검증 이미지로 확장되었다. 이러한 차이점은 2014년 데이터를 사용할 때 현대 벤치마크와 결과를 비교하는 데 주의가 필요함을 의미하지만, 많은 고전 논문이 2014년 분할을 기반으로 보고했기 때문에 역사적 분석에서 여전히 관련성이 유지된다.
유산과 지속적 사용
COCO 2014의 성공은 풍부하게 주석이 달린 맥락 중심 데이터셋의 가치를 입증했으며, LVIS 및 Open Images와 같은 후속 작업에 영향을 미쳤다. 그 주석 스키마는 다각형 마스크를 파싱하고 인스턴스 분할을 평가하는 기본 도구로 남아 있는 COCO API와 같은 현대 도구에 지속된다. 새로운 데이터셋이 등장함에 따라, COCO 2014의 규모, 주석 깊이, 공개 분할 안정성의 조합은 알고리즘 개발을 위한 "이론적 표준"으로서의 역할을 보장한다. 분야가 더 큰 다중 모달 데이터셋으로 전환되었지만, COCO 2014는 여전히 수많은 박사 학위 논문과 산업 모델 평가를 뒷받침하며 비전 연구에서의 지속적인 유용성을 입증하고 있다.
같이 보기
- Data Augmentation - COCO 이미지 훈련 시 자주 사용되는 기법
- Loss Functions - 탐지 및 분할 손실에 사용되는 함수 유형
- AWS - COCO를 호스팅하고 처리하는 데 흔히 사용되는 클라우드 플랫폼
- Stanford AI Lab - COCO 기반 평가에 기여한 연구 그룹