LAION-5B는 비영리 단체인 LAION(Large-scale Artificial Intelligence Open Network)이 만든 58억 5천만 개의 이미지-텍스트 쌍으로 구성된 대규모 공개 데이터셋이다. 2022년에 공개되었으며, 이러한 종류의 데이터셋 중 가장 큰 공개 데이터셋 중 하나로, Stable Diffusion과 같은 생성 모델을 훈련하는 데 널리 사용되었다. 이는 인공지능 및 머신러닝 분야의 핵심 자원이다.
역사와 생성 과정
LAION-5B는 2021년 8월에 공개된 4억 개의 이미지-텍스트 쌍으로 구성된 LAION-400M의 뒤를 이었다. 더 큰 LAION-5B는 수십억 개의 웹 페이지를 보관하는 Common Crawl 웹 코퍼스를 크롤링하여 구축되었다. 팀은 OpenAI가 개발한 CLIP 모델을 사용하여 이미지와 관련 alt-text 또는 캡션의 임베딩을 계산했다. 이미지와 텍스트 임베딩 간의 코사인 유사도가 높은 쌍만 유지되었고, 품질이 낮거나 불일치하는 쌍은 제거되었다. 결과 데이터셋은 2022년 10월 "LAION-5B: An open large-scale dataset for training next generation image-text models"라는 논문으로 발표되었다. 생성 과정은 딥러닝 및 신경망의 기술, 특히 CLIP에 사용된 트랜스포머 아키텍처에 의존했다.
구성과 하위 집합
LAION-5B는 세 가지 하위 집합으로 구성된다: LAION-2B-en(23억 2천만 개의 영어 쌍), LAION-2B-multi(22억 7천만 개의 다국어 쌍), LAION-1B-nolang(12억 6천만 개의 언어 필터링 없는 쌍). 데이터셋은 이미지를 직접 저장하지 않고, 이미지 URL, alt-text, 크기, 유사도 점수와 같은 메타데이터를 제공한다. 이러한 설계 덕분에 연구자들은 필요에 따라 이미지를 다운로드할 수 있지만, 시간이 지나면서 일부 URL에 접근할 수 없게 될 수도 있다. 하위 집합은 다국어 및 교차 언어 학습 연구를 지원하도록 구성되어 있으며, 이는 대규모 언어 모델 및 다중 모드 시스템과 관련이 있다.
응용 분야
LAION-5B는 다양한 생성형 AI 모델을 훈련하는 데 사용되었다. 가장 주목할 만한 예는 2022년 8월 Stability AI가 공개한 텍스트-이미지 모델인 Stable Diffusion이다. Stable Diffusion은 U-Net 및 크로스 어텐션 레이어를 갖춘 잠재 확산 아키텍처를 사용하여 텍스트 프롬프트에서 이미지를 생성한다. 이 모델은 LAION-5B의 하위 집합으로 훈련되었으며, 공개 데이터와 오픈소스 방법으로 고품질 이미지 생성이 가능함을 입증했다. LAION-5B는 또한 이미지-텍스트 모델, 대조 모델 및 기타 다중 모드 시스템 훈련에도 사용된다. 이는 대규모 데이터에서 이러한 모델의 성능을 평가하는 벤치마크 역할을 한다. 데이터셋의 규모와 다양성은 특히 멀티 헤드 어텐션 기반 아키텍처에 유용하며, 이러한 아키텍처는 많은 양의 쌍 데이터의 이점을 얻는다.
논란과 한계
이 데이터셋은 개인정보, 저작권 및 편향에 대한 우려를 제기했다. 웹 크롤링에서 파생되었기 때문에 개인 사진, 저작권 있는 예술 작품, 잠재적으로 공격적이거나 유해한 콘텐츠가 포함되어 있다. LAION은 알려진 문제 자료를 걸러내려고 시도했지만, 데이터셋의 방대한 규모로 인해 완전한 제거는 어렵다. 2023년에는 법적 고소로 인해 데이터셋이 일시적으로 오프라인 상태가 되었지만, 추가 필터링을 거쳐 나중에 복원되었다. 연구자들은 또한 데이터셋이 성별 및 인종 고정관념을 포함한 웹에 존재하는 편향을 반영한다고 지적했다. 이러한 문제는 대규모 웹 스크래핑 데이터셋에서 흔히 발생하며 여전히 활발한 연구 분야이다.
영향과 유산
LAION-5B는 오픈소스 AI 커뮤니티에서 표준 자원이 되었다. 이는 민간 기업이 보유한 독점 데이터셋과 달리 자원봉사 조직이 대규모 데이터셋을 구축하고 공유할 수 있음을 입증했다. 이 데이터셋은 이후 공개 다중 모드 데이터셋을 만드는 노력에 영향을 주었으며, 생성형 AI 및 머신러닝 연구의 물결을 가능하게 했다. 또한 그 공개는 데이터 거버넌스의 중요성과 책임 있는 데이터셋 큐레이션의 필요성을 강조했다.