Conceptual Captions은 3백만 개 이상의 이미지-캡션 쌍으로 구성된 대규모 데이터셋으로, 비전-언어 모델의 훈련과 평가를 지원하기 위해 도입되었다. 이 데이터셋은 Google 연구진이 만들었으며, 초기 데이터셋의 제한된 어휘와 스타일을 넘어서는 다양하고 실제 세계의 이미지 설명을 제공하는 데 중점을 두었다. 이는 이미지 캡셔닝, 시각적 질의 응답, 다중 모달 표현 학습과 같은 작업을 위한 기초 자원으로 활용된다.
Conceptual Captions의 캡션은 웹 이미지의 alt-text 속성에서 파생되었으며, 이는 웹 작성자가 자연스럽게 작성한 설명이다. 이러한 수집 전략은 소수의 주석자와 제한된 어휘에 의존하는 인간 주석 데이터셋과 비교하여 더 광범위하고 다양한 언어 표현을 제공한다. 이 데이터셋은 심층 신경망을 효과적으로 훈련할 수 있을 만큼 충분히 크면서도, 실제 웹 콘텐츠의 도전 과제를 반영하는 합리적인 수준의 노이즈와 다양성을 유지하도록 설계되었다.
구축 및 필터링
Conceptual Captions의 구축은 품질과 관련성을 보장하기 위한 다단계 파이프라인을 포함한다. 먼저 대규모 웹 페이지 코퍼스를 크롤링하고, 관련 alt-text가 있는 이미지를 추출했다. alt-text는 원시 캡션으로 사용되었지만, 모든 텍스트가 적합한 것은 아니었다. 너무 짧거나 너무 길거나 해시태그, URL, 홍보성 언어와 같은 비설명적 콘텐츠를 포함한 캡션을 제거하기 위해 일련의 필터링 단계가 적용되었다. 또한 파이프라인은 사전 훈련된 이미지 분류기를 사용하여 사진이 아니거나 부적절한 콘텐츠를 포함한 이미지를 걸러냈다. 최종 데이터셋은 약 330만 개의 훈련 쌍과 약 15만 8천 개의 쌍으로 구성된 별도의 검증 세트로 이루어져 있으며, 벤치마킹을 위한 별도의 테스트 세트도 포함한다.
다른 데이터셋과의 비교
Conceptual Captions는 인간이 작성한 캡션이 있는 약 33만 개의 이미지를 포함하는 COCO(Common Objects in Context)와 같은 초기 데이터셋과 크게 다르다. COCO는 고품질의 수동 검증 주석을 제공하지만, 그 어휘와 문장 구조는 상대적으로 제한적이다. 반면 Conceptual Captions는 훨씬 더 풍부하고 다양한 언어 분포를 가진 한 자릿수 더 많은 데이터를 제공한다. 이러한 다양성은 실제 응용 프로그램에서 보지 못한 이미지 설명에 일반화해야 하는 모델을 훈련하는 데 유리하다. 그러나 그 대가로 캡션은 더 노이즈가 많고, 웹 alt-text의 비정제된 특성을 반영하여 때때로 부정확하거나 관련 없는 텍스트를 포함할 수 있다.
비전-언어 모델에서의 응용
Conceptual Captions는 비전과 언어를 연결하는 AI 모델을 훈련하고 평가하기 위한 표준 벤치마크가 되었다. 이는 이미지에서 캡션을 생성하는 Encoder-Decoder Architecture 모델과 같은 Transformer (architecture) 기반 아키텍처의 개발에 자주 사용된다. 이 데이터셋은 또한 이미지-텍스트 검색 및 제로샷 분류와 같은 작업을 위한 Machine learning 연구에도 활용되었다. OpenAI 및 Google DeepMind를 포함한 많은 최첨단 모델이 평가 제품군의 일부로 Conceptual Captions에 대한 결과를 보고했다. 이 데이터셋의 규모와 다양성은 강력한 표현을 학습하기 위해 많은 양의 데이터를 필요로 하는 Deep learning 접근 방식에 특히 적합하다.
한계 및 고려 사항
장점에도 불구하고 Conceptual Captions에는 알려진 한계가 있다. alt-text 소스는 웹 작성자가 문화적 또는 인구통계학적 편향을 반영하는 방식으로 이미지를 설명할 수 있기 때문에 편향을 도입할 수 있다. 또한 자동화된 필터링 프로세스는 특정 유형의 이미지나 캡션을 의도치 않게 제외하여 시각적 개념의 불완전한 표현을 초래할 수 있다. 연구자들은 Conceptual Captions로 훈련된 모델이 더 통제된 데이터셋에서 다르게 성능을 발휘할 수 있으며, 균형 잡힌 성능을 달성하기 위해 다른 데이터셋과 함께 사용되는 경우가 많다고 지적했다. 이 데이터셋은 또한 정적이므로 시간이 지남에 따른 웹 콘텐츠의 변화를 반영하지 않으며, 이는 지속적인 연구에 한계가 될 수 있다.
영향 및 유산
Conceptual Captions의 도입은 비전-언어 이해 분야에 상당한 영향을 미쳤다. 이는 대규모의 자유롭게 이용 가능한 자원을 제공하여 이미지 캡셔닝과 다중 모달 학습의 발전을 가속화했다. 웹 alt-text를 활용하는 접근 방식은 유사한 스크래핑 및 필터링 기술을 사용하여 더 큰 코퍼스를 만든 LAION-400M과 같은 후속 데이터셋에 영감을 주었다. 이 데이터셋은 학술 문헌에서 여전히 널리 인용되는 참고 자료로 남아 있으며, 새로운 모델의 기준선으로 계속 사용되고 있다. 그 생성은 현대 Generative AI 연구의 중심이 된 규모의 자연 발생 데이터 사용의 가치를 강조했다.
같이 보기
참고 문헌
- Sharma, P., Ding, N., Goodman, S., & Soricut, R. (2018). Conceptual Captions: A Cleaned, Hypernymed, Image Alt-text Dataset For Automatic Image Captioning. Proceedings of ACL.
- Chen, X., et al. (2015). Microsoft COCO Captions: Data Collection and Evaluation Server.
외부 링크
- Conceptual Captions 프로젝트 페이지 (Google Research)
- 데이터셋 도구용 GitHub 저장소