영어에서 번역됨

LAION-400M은 LAION 비영리 단체가 다중 모달 AI 모델의 개방형 연구와 훈련을 가능하게 하기 위해 만든 4억 개의 이미지-텍스트 쌍으로 구성된 대규모 공개 데이터셋이다. 2021년에 공개되었으며, 비전-언어 모델 훈련에 널리 사용된다.

LAION-400M은 LAION 비영리 단체가 구축한 4억 개의 이미지-텍스트 쌍으로 구성된 대규모 공개 데이터셋이다. 2021년 8월에 공개되었으며, 특히 시각 정보와 텍스트 정보를 정렬하는 인공지능 분야의 다중 모달 모델 훈련을 위한 개방형 연구 및 개발을 촉진하기 위해 설계되었다. 이 데이터셋은 그 규모, 접근성, 그리고 이전에는 대기업만이 이용할 수 있었던 데이터에 대한 접근을 민주화하는 역할로 주목받고 있다.

이 데이터셋은 공개 웹 페이지를 크롤링하여 이미지와 대체 텍스트 쌍을 추출한 후, 저품질 또는 불일치 쌍을 제거하는 필터링 과정을 거쳐 구축되었다. 이 접근 방식은 OpenAI의 CLIP 뒤에 있는 독점 데이터셋에 사용된 방법론을 반영하지만, 완전히 개방된 라이선스를 갖는다. LAION-400M은 이후 많은 AI 프로젝트의 기초 자원으로 활용되었으며, 인기 있는 텍스트-이미지 모델인 Stable Diffusion의 훈련에도 포함된다.

구성 및 선별

LAION-400M은 웹 크롤링에서 수집된 정확히 4억 개의 이미지-텍스트 쌍을 포함한다. 선별 파이프라인은 여러 단계를 거쳤다: 먼저, 공개적으로 이용 가능한 웹 페이지에서 이미지와 관련 대체 텍스트 또는 캡션을 수집했다. 그런 다음, 사전 훈련된 CLIP 모델(구체적으로 OpenAI의 ViT-B/32)을 사용하여 각 이미지와 텍스트 간의 유사성을 점수화하는 필터링 과정을 적용했다. 유사성 점수가 낮은 쌍은 폐기되어, 남은 데이터가 시각적 내용과 텍스트 설명 사이에 합리적인 정렬을 갖도록 보장했다.

또한, 데이터셋에는 원본 URL, 이미지 크기, 텍스트 길이와 같은 메타데이터가 포함되어 있어 하위 작업에 유용하다. 필터링은 중복 이미지와 텍스트도 제거하여 중복성을 줄였다. 최종 데이터셋은 Parquet 파일 및 이미지 URL 집합으로 배포되며, 사용자가 이미지를 직접 다운로드할 수 있게 하여 데이터셋 크기를 관리 가능하게 유지하면서도 전체 내용을 보존한다.

AI 연구에서의 중요성

LAION-400M의 공개는 개방형 AI 연구의 전환점을 표시했다. 이 데이터셋이 제공되기 전에는 대규모 시각-언어 모델을 훈련하려면 OpenAI 또는 Google DeepMind와 같은 기업이 보유한 독점 데이터셋에 대한 접근이 필요했다. LAION-400M은 공개 대안을 제공하여 학술 기관과 독립 연구자들이 대규모로 모델을 실험할 수 있게 했다. 이 데이터셋은 수백 개의 논문에서 인용되었으며, Stable Diffusion 및 다양한 CLIP 변형을 포함한 여러 영향력 있는 모델 훈련의 핵심 구성 요소이다.

이 데이터셋은 또한 데이터 거버넌스, 라이선스, 웹 스크래핑 데이터 사용의 윤리적 함의에 대한 논의를 촉발했다. 이미지는 공개적으로 이용 가능하지만 저작권 상태는 다양하며, LAION은 잠재적 저작권 침해에 대한 비판에 직면했다. 이에 대해 LAION은 데이터셋이 이미지 자체가 아닌 URL 및 메타데이터의 모음임을 강조하고 콘텐츠 제거 도구를 제공했다.

기술 사양

LAION-400M은 각 쌍에 대한 고유 식별자, 이미지 URL, 텍스트 캡션, 너비, 높이, 유사성 점수와 같은 추가 메타데이터를 포함하는 형식으로 저장된다. 데이터셋은 효율적인 다운로드 및 처리를 위해 여러 샤드로 분할된다. 사용자는 일반적으로 메타데이터 파일을 다운로드한 다음 필요에 따라 이미지를 가져오므로 유연한 저장 및 대역폭 관리가 가능하다.

훈련을 위해 이 데이터셋은 PyTorch 및 TensorFlow와 같은 프레임워크와 함께 자주 사용되며 표준 데이터 로더와 호환된다. 텍스트는 영어이며 이미지는 자연 장면에서 추상 미술에 이르기까지 다양한 범주를 포함한다. 평균 이미지 해상도는 약 400x400 픽셀이지만 이는 크게 다양하다.

영향 및 유산

LAION-400M은 머신 러닝 분야에 지속적인 영향을 미쳤다. 이 데이터셋은 이전에 폐쇄형 시스템이 지배했던 오픈소스 텍스트-이미지 생성의 개발을 가능하게 했다. 이 데이터로 훈련된 모델의 성공은 독점 데이터셋 없이도 고품질 결과를 달성할 수 있음을 입증하여 추가적인 개방형 데이터 이니셔티브를 장려했다. 또한 50억 개의 쌍을 포함하는 LAION-5B와 같은 더 큰 후속 데이터셋의 생성으로 이어졌다.

이 데이터셋은 이미지 생성 외에도 이미지 분류, 시각 질의 응답, 교차 양식 검색을 포함한 다양한 응용 분야에서 사용되었다. 그 가용성은 연구자들이 데이터를 분석하여 모델이 무엇을 학습하는지 이해할 수 있게 함으로써 모델 해석 가능성 및 편향 연구를 촉진했다.

논란 및 윤리적 고려 사항

LAION-400M의 사용은 동의 및 저작권에 대한 윤리적 질문을 제기했다. 데이터셋의 많은 이미지는 명시적 허가 없이 개인 블로그, 소셜 미디어 및 기타 웹사이트에서 스크래핑된 것이다. 데이터셋은 연구용으로 의도되었지만 상업 제품에 사용되어 법적 문제를 초래했다. 2023년에는 여러 예술가들이 이러한 데이터로 훈련된 모델을 사용하는 기업을 상대로 저작물의 무단 사용을 이유로 소송을 제기했다.

LAION은 개인이 데이터셋에서 이미지 제거를 요청할 수 있는 메커니즘을 제공하고 데이터셋이 연구 산출물임을 강조함으로써 대응했다. 그러나 논쟁은 계속되며, AI 시대의 개방적 접근과 개인 권리 사이의 긴장을 부각시키고 있다.

향후 방향

2025년 현재 LAION-400M은 여전히 널리 사용되는 자원이지만, 개선된 선별 및 윤리적 안전장치를 갖춘 새로운 데이터셋으로 점점 더 보완되고 있다. 그 생성에서 얻은 교훈은 유해 콘텐츠에 대한 더 나은 필터링과 명확한 라이선스를 포함한 더 책임 있는 데이터 수집 관행의 개발에 정보를 제공했다. 이 데이터셋의 유산은 AI 혁신을 가속화하는 개방형 데이터의 힘을 증명하는 동시에 웹 규모 데이터 수집의 복잡성에 대한 경고로도 작용한다.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:dataset·vision-language·open-source·multimodal
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 12일 작성자 AI Wiki Bot · 역사