LAION(대규모 인공지능 오픈 네트워크의 약자)은 오픈소스 인공지능 모델과 데이터셋을 개발하는 독일의 비영리 단체이다. 이 단체는 웹에서 수집한 대규모 이미지 및 캡션 데이터셋을 여러 개 공개한 것으로 가장 잘 알려져 있으며, 이러한 데이터셋은 Stable Diffusion 및 Imagen을 포함한 여러 유명 텍스트-이미지 모델을 훈련하는 데 사용되었다. 이 조직은 자원봉사자와 연구자로 구성된 커뮤니티 중심 네트워크로 운영되며, AI 훈련 데이터와 모델에 대한 접근을 민주화하는 것을 목표로 한다.
생성형 AI에 대한 관심이 높아지는 상황에서 설립된 LAION의 작업은 주요 AI 기업이 보유한 독점 데이터셋에 대한 대안을 제공하는 데 초점을 맞추고 있다. 데이터셋을 자유롭게 공개함으로써, 이 조직은 연구자와 소규모 기관이 기업의 자원에 의존하지 않고 머신러닝 연구에 참여할 수 있게 한다. 또한 LAION의 활동은 AI 훈련 데이터, 특히 저작권 및 콘텐츠 검열과 관련된 법적·윤리적 논쟁의 중심에 서게 했다.
역사와 설립
LAION은 독일에서 비영리 법인으로 설립되었으며, 그 이름은 대규모 인공지능 오픈 네트워크를 뜻한다. 이 계획은 OpenAI와 같은 상업 연구소가 사용하는 규모의 데이터셋을 재현하고자 한 AI 연구자와 애호가 커뮤니티에서 출발했다. 초기 노력은 공개 웹 데이터에서 대규모 이미지-텍스트 데이터셋을 구축하는 데 집중되었으며, 이 작업은 상당한 컴퓨팅 자원과 자원봉사자 협력이 필요했다.
2021년 8월, LAION은 첫 번째 주요 데이터셋인 LAION-400M을 공개했으며, 여기에는 4억 개의 이미지-캡션 쌍이 포함되어 있다. 이 데이터셋은 2014년부터 2021년 사이에 Common Crawl이 수집한 웹페이지의 무작위 하위 집합에서 파생되었다. 이 공개는 OpenAI가 CLIP 모델 훈련을 위해 수집한 4억 개의 이미지-캡션 쌍의 과정을 재현하려는 동기에서 비롯되었으며, OpenAI는 모델의 코드와 가중치는 오픈소스로 공개했지만 훈련 데이터셋은 공개하지 않았다. LAION-400M은 특히 텍스트-이미지 생성 분야에서 딥러닝 모델을 연구하는 연구자들에게 빠르게 중요한 자원이 되었다.
2022년 3월, LAION은 후속 데이터셋인 LAION-5B를 공개했으며, 여기에는 50억 개 이상의 이미지-캡션 쌍이 포함되어 있다. 공개 당시 이는 해당 종류의 데이터셋 중 가장 큰 자유 이용 가능한 데이터셋이었다. LAION-5B의 제작은 Doodlebot, Hugging Face, 그리고 이 데이터셋으로 훈련된 Stable Diffusion 텍스트-이미지 모델의 배후 회사인 Stability AI가 자금을 지원했다. 이 공개는 오픈 AI 연구의 중요한 이정표가 되었으며, 신경망 모델 훈련을 위한 전례 없는 규모의 데이터를 제공했다.
이미지 데이터셋
LAION의 이미지 데이터셋은 수집된 웹 페이지의 데이터셋인 Common Crawl에서 구축된다. 개발자들은 수집된 HTML에서 <img> 태그를 검색하고 해당 alt 속성을 캡션으로 처리했다. 그들은 트랜스포머 기반 모델인 CLIP을 사용하여 콘텐츠가 캡션과 일치하지 않는 것으로 보이는 이미지를 식별하고 폐기했다. 중요한 점은 LAION이 수집된 이미지의 콘텐츠 자체를 호스팅하지 않는다는 것이다. 대신 데이터셋에는 이미지를 가리키는 URL이 포함되어 있으며, 연구자들이 독립적으로 다운로드해야 한다.
2021년 8월에 공개된 LAION-400M은 2014년부터 2021년 사이에 수집된 웹페이지에서 추출한 4억 개의 이미지-캡션 쌍으로 구성되었다. 이는 2022년 Google Brain이 발표한 텍스트-이미지 모델인 Imagen을 훈련하는 데 내부 비공개 데이터셋과 함께 사용되었다. 이 데이터셋의 규모와 접근성은 초기 생성형 AI 연구의 기초 자원이 되었다.
2022년 3월에 공개된 LAION-5B는 50억 개 이상의 쌍으로 이 접근 방식을 확장했다. 공개 당시 이는 현존하는 가장 큰 자유 이용 가능한 이미지-캡션 쌍 데이터셋이었다. 이 데이터셋의 크기는 Stable Diffusion을 포함한 더 정교한 모델의 훈련을 가능하게 했으며, Stable Diffusion은 가장 널리 사용되는 오픈소스 텍스트-이미지 시스템 중 하나가 되었다. 데이터셋 구축에는 데이터 품질을 개선하기 위한 필터링 및 중복 제거 프로세스를 포함한 상당한 컴퓨팅 노력이 필요했다.
2024년 8월, LAION은 원본의 유해 콘텐츠에 대한 우려에 따라 Re-LAION-5B라는 정제된 버전의 데이터셋을 공개했다. 이 업데이트된 데이터셋은 AI 연구에 대한 유용성을 유지하면서 초기 공개에 대한 일부 비판을 해결하는 것을 목표로 했다.
법적 도전
LAION은 데이터셋과 관련된 여러 법적 분쟁에 연루되어 왔다. 2023년 2월, LAION은 Getty Images가 Stable Diffusion을 상대로 제기한 소송에서 비당사자로 언급되었다. Getty Images가 제기한 이 소송은 LAION-5B를 사용한 Stable Diffusion의 훈련 과정이 저작권이 있는 이미지의 무단 사용을 포함한다고 주장했다. LAION은 피고가 아니었지만 데이터셋의 출처 맥락에서 언급되었다.
2023년 4월, LAION은 훈련 세트에서 자신의 이미지를 제거해 달라고 요청한 독일 사진작가에 의해 직접 소송을 당했다. 사진작가는 자신의 저작권이 있는 작품이 허가 없이 LAION-5B에 포함되었다고 주장했다. 2024년 9월, 함부르크 지방 법원은 이 소송을 기각했으며, 이는 독일 및 EU 전반에서 "AI 훈련 데이터에 대한 TDM(텍스트 및 데이터 마이닝) 예외에 관한 획기적인 판결"로 묘사되었다. 이 판결은 유럽 저작권법 하에서 AI 훈련을 위해 웹에서 수집된 데이터를 사용하는 것의 합법성에 대한 중요한 선례로 간주되었다.
이러한 법적 절차는 AI 개발과 저작권법 사이의 더 넓은 긴장을 부각시켰으며, 이 주제는 대규모 언어 모델 및 기타 AI 시스템이 더 보편화됨에 따라 계속 진화하고 있다. 이러한 사건의 결과는 LAION뿐만 아니라 오픈 AI 연구 분야 전체에 영향을 미친다.
비판 및 콘텐츠 우려
여러 연구에 따르면 LAION-5B의 이미지에는 강간, 음란물, 악의적인 고정관념, 인종차별적·민족적 비방, 기타 극도로 문제가 되는 자료와 관련된 이미지 및 텍스트 쌍을 포함한 문제가 있는 콘텐츠가 포함되어 있다. 이러한 발견은 특히 공개 지향 애플리케이션에 배포되는 모델의 경우 AI 훈련에 이러한 데이터셋을 사용하는 것의 윤리적 영향에 대한 우려를 제기했다.
Bayerischer Rundfunk의 조사에 따르면 Hugging Face에 호스팅된 LAION의 데이터셋에는 공개 웹사이트에서 수집된 대량의 개인 및 민감한 데이터가 포함되어 있다. 이는 개인의 이미지와 개인 정보가 동의나 인지 없이 포함될 수 있기 때문에 개인정보 보호 우려를 제기했다.
2023년 12월, Stanford Internet Observatory는 LAION-5B에 대한 보고서를 발표하여 아동 성적 학대 자료 링크로 의심되는 3,226건을 발견했으며, 그중 1,008건은 외부에서 검증되었다. 이에 대응하여 LAION은 "불법 콘텐츠에 대한 무관용 정책"과 "과도한 주의"를 이유로 LAION-5B와 LAION-400M을 일시적으로 제거했다. 이 조치는 AI 연구 커뮤니티에서 표준 자원이 된 데이터셋에 대한 접근을 일시적으로 중단시켰기 때문에 중요한 단계였다.
2024년 8월 Re-LAION-5B의 공개는 이러한 문제를 해결하기 위한 LAION의 노력의 일부였다. 정제된 데이터셋은 연구 목적의 원본 유용성을 유지하면서 불법 및 유해 콘텐츠를 걸러내는 것을 목표로 했다. 그러나 이 사건은 웹 규모 데이터셋의 검열 과제와 AI 데이터 수집에서 지속적인 경계의 필요성을 강조했다.
OpenAssistant
OpenAssistant는 작업을 이해하고, 제3자 시스템과 상호 작용하며, 이를 위해 정보를 동적으로 검색할 수 있는 인공지능 오픈소스 채팅 기반 어시스턴트였다. 이 프로젝트는 LAION과 협력하여 자원봉사자 그룹이 개발했다. 개발 목표 중 하나에는 대기업에 AI 역량이 집중되는 문제를 해결하는 소비자 하드웨어에서 로컬로 실행할 수 있는 대규모 언어 모델에 대한 무료 접근이 포함되었다.
이 프로젝트는 600,000개의 인간 생성 데이터 포인트를 만든 13,500명 이상의 자원봉사자가 참여한 전 세계적인 크라우드소싱 노력으로 지원되었다. 이러한 데이터 포인트는 어시스턴트 모델을 훈련하는 데 사용되었으며, 독점 챗봇에 대한 투명하고 커뮤니티 중심의 대안을 만드는 것을 목표로 했다. 2023년 4월 15일, LAION과 기여자들은 OpenAssistant라는 오픈소스 AI 어시스턴트 챗봇을 공개적으로 출시했다.
초기의 가능성에도 불구하고, 이 프로젝트는 이후 중단되었다. 그러나 데이터셋과 모델은 Hugging Face에 계속 남아 있어 연구자들이 계속 사용하고 작업을 기반으로 구축할 수 있다. 이 프로젝트의 유산은 기업 환경 밖에서 AI 훈련 데이터와 모델을 만드는 데 크라우드소싱을 사용할 수 있다는 것을 보여준 데 있다.
영향 및 유산
LAION의 데이터셋은 인공지능 분야, 특히 텍스트-이미지 생성 영역에 깊은 영향을 미쳤다. 대규모 데이터셋에 대한 개방적 접근을 제공함으로써, LAION은 다양한 연구자와 개발자가 그렇지 않으면 접근할 수 없었을 AI 모델을 실험하고 배포할 수 있게 했다. 이 조직의 작업은 분야의 벤치마크가 된 Stable Diffusion과 같은 오픈소스 모델 개발에 중요한 역할을 했다.
이 조직의 접근 방식은 AI의 데이터 윤리와 저작권에 대한 논쟁에도 영향을 미쳤다. LAION 데이터셋과 관련된 법적 도전과 콘텐츠 우려는 데이터셋 제작자의 책임과 더 나은 콘텐츠 검열 도구의 필요성에 대한 논의를 촉발했다. 이러한 논의는 AI 연구에서 데이터 증강 및 필터링 기술과 같은 문제에 대한 관심 증가로 이어졌다.
LAION의 커뮤니티 중심 오픈소스 개발 모델은 OpenAI 및 Google DeepMind와 같은 기업의 더 폐쇄적인 접근 방식과 대조를 이룬다. 이 조직은 상당한 비판에 직면했지만, AI 연구의 민주화에 대한 기여는 널리 인정받고 있다. 2025년 현재 LAION은 계속 운영되고 있지만, 향후 활동은 AI 훈련 데이터를 둘러싼 진행 중인 법적·윤리적 논쟁에 의해 형성될 수 있다.