LAION-COCO는 이미지-텍스트 쌍으로 구성된 대규모 데이터셋으로, COCO(Common Objects in Context) 데이터셋 스타일의 캡션을 제공하는 것으로 유명하다. 이 데이터셋은 Artificial intelligence 연구를 위한 공개 데이터셋과 도구를 개발하는 비영리 조직인 LAION(Large-scale Artificial Intelligence Open Network)에 의해 만들어졌다. 이 데이터셋은 특히 시각적 및 텍스트 이해를 결합한 Machine learning 모델, 예를 들어 Generative AI 시스템과 시각-언어 작업에 사용되는 Neural network 아키텍처의 훈련과 평가를 지원하도록 설계되었다.
이 데이터셋은 대규모의 공개적으로 접근 가능한 이미지-텍스트 쌍 컬렉션에 대한 필요를 해결하기 위해 도입되었다. 세부 주석이 포함된 신중하게 선별된 이미지를 포함하는 원래 COCO 데이터셋과 달리, LAION-COCO는 웹에서 자동으로 수집된 이미지와 캡션으로 구축된다. 캡션은 COCO 주석의 전형적인 간결하고 설명적인 스타일을 따르도록 생성되거나 재구성되며, 이는 종종 이미지의 주요 객체와 동작을 직관적인 방식으로 설명한다.这使得 LAION-COCO는 이미지 캡셔닝, 텍스트-이미지 생성, 시각적 질문 응답과 같은 작업에 유용하다.
데이터셋 구축
LAION-COCO는 50억 개 이상의 이미지-텍스트 쌍을 포함하는 더 큰 LAION-5B 데이터셋에서 데이터를 필터링하고 처리하여 구축되었다. 제작자들은 자동화 도구와 모델의 조합을 사용하여 고품질의 관련성 있는 캡션을 가질 가능성이 높은 쌍을 선택했다. 그들은 Transformer (architecture) 기반 모델을 사용하여 캡션이 없는 이미지에 COCO 스타일 캡션을 생성하거나 기존 캡션을 원하는 스타일에 맞게 재구성했다. 이 과정에는 중복 제거, 저해상도 이미지 필터링, 불일치하거나 관련 없는 텍스트가 있는 쌍 제거가 포함되었다.
데이터셋은 여러 버전으로 출시되며, 가장 일반적인 것은 약 6억 개의 이미지-텍스트 쌍을 포함하는 LAION-COCO 600M이다. 이 규모는 다른 공개 데이터셋보다 훨씬 크며, 대규모 모델 훈련을 위한 귀중한 자원이 된다. 데이터는 압축 형식으로 배포되며, 각 레코드에는 이미지 URL, 관련 캡션, 이미지 크기 및 텍스트가 이미지와 얼마나 잘 일치하는지 나타내는 유사도 점수와 같은 메타데이터가 포함된다.
머신러닝에서의 응용
LAION-COCO는 특히 텍스트-이미지 생성 모델의 개발에 널리 사용되었다. 많은 인기 있는 생성 모델이 이 데이터셋의 하위 집합으로 훈련되었으며, 다양한 시각적 개념과 자연어 설명을 제공하기 때문이다. COCO 스타일 캡션은 장면의 세부적이고 정확한 설명을 생성해야 하는 모델에 특히 유용하며, 형식이 간결하고 객체 중심의 언어를 장려하기 때문이다.
연구자들은 또한 이미지와 텍스트를 모두 처리할 수 있는 Large language model 및 다중 모드 모델을 미세 조정하는 데 LAION-COCO를 사용했다. 데이터셋의 크기는 광범위한 데이터 분포에 대한 훈련을 가능하게 하여 모델이 새로운 작업에 일반화하는 능력을 향상시킬 수 있다. 또한 이미지 검색 및 캡션 생성과 같은 작업에 대한 벤치마크를 제공하여 시각-언어 모델의 성능 평가에도 사용되었다.
다른 데이터셋과의 비교
LAION-COCO는 COCO, Conceptual Captions, Visual Genome과 같은 다른 인기 데이터셋과 여러 면에서 다르다. 원래 COCO 데이터셋은 객체 경계 상자와 분할 마스크를 포함한 세부 인스턴스 수준 주석이 있는 약 33만 개의 이미지를 포함한다. 반면 LAION-COCO는 이미지 수준 캡션에 초점을 맞추며 이러한 세분화된 주석을 제공하지 않는다. 이는 정확한 객체 위치 파악보다 이미지의 전반적인 내용 이해가 필요한 작업에 더 적합하게 만든다.
또 다른 주요 차이점은 데이터의 출처이다. COCO 이미지는 Flickr에서 선별된 반면, LAION-COCO 이미지는 다양한 웹 소스에서 수집되어 더 많은 다양성을 제공하지만 더 많은 노이즈도 도입한다. LAION-COCO의 캡션은 종종 자동으로 생성되어 인간이 작성한 주석에 비해 부정확하거나 덜 설명적일 수 있다. 그러나 데이터의 방대한 양은 많은 응용 분야에서 이를 보완하며, 모델이 불완전한 데이터를 처리하는 방법을 학습할 수 있다.
윤리적 및 실용적 고려 사항
LAION-COCO와 같은 웹 크롤링 데이터셋의 사용은 특히 저작권과 개인정보 보호와 관련된 윤리적 우려를 제기한다. 이미지는 원래 제작자나 대상자의 명시적 동의 없이 인터넷에서 수집된다. 이는 상업 모델 훈련에 이러한 데이터를 사용하는 것의 합법성과 공정성에 대한 논쟁을 불러일으켰다. 일부 예술가와 사진작가는 자신의 작품이 이러한 데이터셋에 포함되는 것에 반대했으며, 여러 관할권에서 법적 도전이 있었다.
이러한 우려 중 일부를 해결하기 위해 LAION은 개인 정보나 노골적인 콘텐츠를 포함할 가능성이 있는 이미지를 제거하는 필터링 프로세스를 구현했다. 그러나 데이터셋의 방대한 규모로 인해 모든 개인정보 보호 및 저작권 규정을 완전히 준수하는 것은 어렵다. LAION-COCO를 사용하는 연구자와 기업은 이러한 문제를 고려하고 적용 가능한 법률과 지침을 따르도록 권장된다.
향후 개발
LAION은 데이터셋을 지속적으로 업데이트하고 확장하고 있으며, LAION-COCO는 AI 연구를 위한 공개 자원을 제공하려는 지속적인 노력의 일부이다. 향후 버전에는 개선된 필터링 방법, 더 정확한 캡션, 더 나은 문서화가 포함될 수 있다. 이 데이터셋은 또한 더 제어 가능하고 세부적인 이미지를 생성할 수 있는 모델을 개발하고 대규모 다중 모드 시스템의 동작을 연구하는 데 사용되고 있다. Generative AI 분야가 진화함에 따라 LAION-COCO와 같은 데이터셋은 규모와 출처와 관련된 과제에도 불구하고 새로운 모델을 훈련하고 평가하는 데 핵심적인 역할을 계속할 가능성이 높다.