COCO Captions 2015는 이미지 캡셔닝을 위해 널리 사용되는 벤치마크 데이터셋으로, Microsoft COCO(Common Objects in Context) 2014 및 2015 컬렉션의 각 이미지에 대해 독립적으로 작성된 다섯 개의 인간 설명으로 구성되어 있다. 이 데이터셋은 인공지능 및 기계 학습 연구, 특히 시각적 콘텐츠에 대한 자연어 설명을 생성하는 작업을 지원하기 위해 도입되었다. 각 캡션은 해당 이미지에 존재하는 객체, 동작 및 관계를 설명하는 완전한 문장으로, 정렬된 시각-언어 데이터의 풍부한 소스를 제공한다.
캡션은 Amazon Mechanical Turk를 통해 수집되었으며, 작업자들은 이미지의 모든 중요한 부분을 한 문장으로 설명하도록 지시받았다. 이 데이터셋은 330,000개 이상의 이미지를 포함하며, 각 이미지에 다섯 개의 캡션이 짝지어져 총 150만 개 이상의 캡션-이미지 쌍을 제공한다. COCO Captions 2015는 컴퓨터 비전과 자연어 처리에서 딥 러닝 기술을 결합한 모델, 특히 인코더-디코더 모델과 같은 신경망 아키텍처를 사용하는 모델의 표준 평가 세트가 되었다. 데이터셋의 설계는 서로 다른 주석자가 동일한 장면을 다양한 방식으로 설명함에 따라 표현의 다양성을 장려하며, 이는 모델이 유창하고 의미적으로 정확한 텍스트를 생성하는 능력을 시험한다.
구조 및 통계
COCO Captions 2015 데이터셋은 훈련, 검증 및 테스트 분할로 구성되며, 테스트 분할은 공개 테스트 세트와 공식 평가에 사용되는 비공개 테스트 세트로 더 나뉜다. 훈련 분할에는 약 82,783개의 이미지, 검증 분할에는 40,504개의 이미지, 테스트 분할에는 40,775개의 이미지가 포함된다. 각 이미지에는 다섯 개의 캡션이 연결되지만, 테스트 세트의 캡션은 과적합을 방지하기 위해 공개되지 않으며, 대신 연구자들은 평가 서버에 예측을 제출한다. 캡션의 길이는 다양하며, 일반적으로 8~25단어 범위이고, 사람, 동물, 차량 및 실내/실외 환경을 포함한 다양한 일상 장면을 다룬다.
평가 지표
COCO Captions 2015의 표준 평가 지표에는 BLEU, METEOR, ROUGE-L 및 CIDEr이 포함된다. CIDEr(Consensus-based Image Description Evaluation)는 이미지 캡셔닝을 위해 특별히 설계되었으며, TF-IDF 가중 n-gram 중첩을 사용하여 생성된 캡션과 인간 참조 세트 간의 합의를 측정한다. 데이터셋의 공식 평가 스크립트는 비공개 테스트 세트에서 이러한 지표를 계산하며, 리더보드는 최첨단 모델의 성능을 추적한다. 2015년에는 최고 성능 시스템이 BLEU-4 점수 약 0.30 및 CIDEr 점수 약 1.0을 달성했지만, 이후 트랜스포머 기반 아키텍처와 대규모 언어 모델 사전 훈련의 발전으로 이러한 수치는 크게 개선되었다.
모델 개발에서의 역할
COCO Captions 2015는 현대 이미지 캡셔닝 시스템 개발에 중요한 역할을 해왔다. 초기 접근 방식은 시각적 특징 추출을 위해 잔차 네트워크 또는 U-Net 백본을 사용하고, 텍스트 생성을 위해 순환 신경망을 결합했다. 이후 멀티 헤드 어텐션 및 크로스 어텐션 메커니즘은 트랜스포머 아키텍처에서 도입된 대로 순환 구성 요소를 대체하여 더 효율적인 병렬 훈련을 가능하게 했다. 이 데이터셋은 또한 데이터 증강 및 커리큘럼 학습 연구와 빔 서치 및 top-p 샘플링 디코딩 전략의 사용을 촉진했다. OpenAI 및 Google DeepMind의 모델을 포함한 많은 생성형 AI 모델이 COCO Captions 2015를 사전 훈련 또는 평가 벤치마크로 사용했지만, Flickr30k 및 Visual Genome과 같은 최신 데이터셋이 등장했다.
한계 및 유산
이 데이터셋에는 일반적인 객체와 단순한 문장 구조에 대한 편향과 크라우드 작업자로 인한 주석 노이즈 가능성을 포함한 알려진 한계가 있다. 또한 최신 벤치마크에 나타나는 세밀한 공간 관계 및 구성적 추론 과제가 부족하다. 이러한 문제에도 불구하고 COCO Captions 2015는 이미지 캡셔닝 방법을 비교하고 시각-언어 정렬을 연구하기 위한 기초 자원으로 남아 있다. 이미지당 다섯 개의 캡션 설계는 이후 데이터셋에 영향을 미쳤으며, 평가 프로토콜은 학술 연구에서 계속 사용되고 있다. 이 데이터셋은 학술적 사용을 위해 무료로 제공되며, 주석은 문헌에서 널리 인용된다.
관련 벤치마크 및 확장
COCO Captions 2015의 확장에는 중국어 캡션을 추가한 COCO-CN과 새로운 객체 캡셔닝에 초점을 맞춘 nocaps가 포함된다. 이 데이터셋은 또한 COCO 탐지 및 분할 작업과 중첩되어 다중 작업 학습을 가능하게 한다. 연구자들은 일반화를 개선하기 위해 COCO Captions 2015를 다른 데이터셋과 결합하는 경우가 많으며, 시각-언어 작업에서 시퀀스-투-시퀀스 모델을 테스트하는 일반적인 선택으로 남아 있다. 데이터셋의 영향은 클라우드 기반 모델 훈련을 위한 전처리 버전을 제공하는 Amazon Web Services 및 Google Cloud 제품으로 확장된다.