영어에서 번역됨

LAION(대규모 인공지능 오픈 네트워크)은 오픈소스 AI 모델과 데이터셋을 만드는 독일의 비영리 조직으로, Stable Diffusion과 같은 모델을 훈련하는 데 사용되는 대규모 이미지-텍스트 데이터셋으로 가장 잘 알려져 있습니다.

LAION(Large-scale Artificial Intelligence Open Network의 약자)은 오픈소스 인공지능 모델과 데이터셋을 개발하는 독일의 비영리 조직이다. 이 조직은 웹에서 수집한 이미지와 캡션으로 구성된 여러 대규모 데이터셋을 공개한 것으로 가장 잘 알려져 있으며, 이러한 데이터셋은 Stable Diffusion 및 Imagen을 포함한 여러 유명 텍스트-이미지 모델을 훈련하는 데 사용되었다. 이 조직은 AI 리소스에 대한 접근을 민주화하여 연구자와 개발자에게 자유롭게 사용 가능한 데이터와 도구를 제공하는 것을 목표로 한다.

LAION의 작업은 인공지능머신러닝이라는 더 넓은 분야 내에 위치하며, 정교한 모델 훈련을 가능하게 하는 대규모 데이터셋 생성에 중점을 둔다. 이 조직의 데이터셋은 특히 텍스트-이미지 합성 분야에서 생성형 AI 연구의 기초 자원이 되었다.

역사와 설립

LAION은 인공지능 분야의 공개 연구와 개발을 촉진하기 위해 독일에서 비영리 조직으로 설립되었다. 정확한 설립 날짜는 널리 문서화되어 있지 않지만, 이 조직은 2021년 첫 주요 데이터셋을 공개하면서 두각을 나타냈다. 설립자들은 AI 연구자와 애호가 그룹으로, 코드와 가중치는 공개했지만 훈련 데이터는 공개하지 않은 OpenAI의 CLIP과 같은 모델을 훈련하기 위한 공개 대규모 데이터셋의 부족을 해결하는 것을 목표로 했다.

이 조직은 자원봉사 기반 모델로 운영되며 AI 커뮤니티의 기여에 의존한다. 이 조직의 프로젝트는 종종 공개 접근이라는 사명을 공유하는 기업과 개인의 파트너십 및 기부를 통해 자금을 지원받는다.

이미지 데이터셋

LAION은 AI 연구자들이 널리 사용하는 여러 대규모 이미지-캡션 쌍 데이터셋을 공개했다. 데이터는 스크랩된 웹 페이지 데이터셋인 Common Crawl에서 파생되었다. 개발자들은 크롤링된 HTML에서 <img> 태그를 검색하고 해당 alt 속성을 캡션으로 처리했다. 그들은 CLIP을 사용하여 콘텐츠가 캡션과 일치하지 않는 이미지를 식별하고 폐기했다. LAION은 스크랩된 이미지의 콘텐츠 자체를 호스팅하지 않으며, 데이터셋에는 연구자들이 직접 다운로드해야 하는 이미지를 가리키는 URL만 포함되어 있다.

첫 번째 데이터셋인 LAION-400M은 2021년 8월에 공개되었으며 4억 개의 이미지-캡션 쌍으로 구성되었다. 이 쌍들은 2014년부터 2021년 사이에 Common Crawl이 스크랩한 웹 페이지의 무작위 하위 집합에서 추출되었다. 이는 OpenAI가 CLIP 모델을 훈련하는 데 사용한 4억 개의 이미지-캡션 쌍을 수집하는 과정을 재현하려는 시도였다. OpenAI는 모델의 코드와 가중치는 오픈소스로 공개했지만 훈련 데이터셋은 공개하지 않기로 선택했다. 2022년 Google Brain이 발표한 텍스트-이미지 모델인 Imagen은 LAION-400M을 비공개 내부 데이터셋과 함께 사용하여 훈련되었다.

50억 개 이상의 쌍으로 구성된 후속 데이터셋인 LAION-5B는 2022년 3월에 공개되었다. 공개 당시 이는 존재하는 이미지-캡션 쌍 데이터셋 중 가장 큰 자유롭게 사용 가능한 데이터셋이었다. 이 데이터셋의 생성은 Doodlebot, Hugging Face 및 Stability AI의 자금 지원을 받았으며, Stability AI는 이 데이터셋으로 훈련된 Stable Diffusion 텍스트-이미지 모델의 자금을 지원한 AI 기업이다.

OpenAssistant

OpenAssistant는 작업을 이해하고, 타사 시스템과 상호 작용하며, 이를 위해 정보를 동적으로 검색할 수 있는 AI 오픈소스 채팅 기반 어시스턴트였다. 이 프로젝트는 LAION과 협력하여 자원봉사자 그룹이 개발했다. 개발 목표 중 하나에는 소비자 하드웨어에서 로컬로 실행할 수 있는 대규모 언어 모델에 대한 무료 접근이 포함되었다. 이 프로젝트는 60만 개의 인간 생성 데이터 포인트를 만든 13,500명 이상의 자원봉사자가 참여한 전 세계적인 크라우드소싱 노력의 지원을 받았다. 이 프로젝트는 이후 중단되었지만 데이터셋과 모델은 Hugging Face에 계속 남아 있다.

법적 및 윤리적 문제

2023년 2월, LAION은 Getty Images가 Stable Diffusion을 상대로 제기한 소송에서 비당사자로 지명되었다. 2023년 4월, LAION은 훈련 세트에서 자신의 이미지를 제거하기를 원하는 독일 사진작가에 의해 직접 소송을 당했다. 2024년 9월, 함부르크 지방 법원은 이 소송을 기각했으며, 이는 독일과 EU 전반에서 "AI 훈련 데이터에 대한 TDM[텍스트 및 데이터 마이닝] 예외에 관한 획기적인 판결"로 묘사되었다.

비판과 논란

여러 연구에 따르면 LAION-5B의 이미지에는 강간, 음란물, 악의적인 고정관념, 인종차별적 및 민족적 비방, 기타 극도로 문제가 되는 콘텐츠의 이미지와 텍스트 쌍이 포함되어 있다.

Bayerischer Rundfunk의 조사에 따르면 Hugging Face에 호스팅된 LAION의 데이터셋에는 공개 웹사이트에서 수집된 대량의 개인 및 민감한 데이터가 포함되어 있다.

2023년 12월, Stanford Internet Observatory는 LAION-5B에 대한 보고서를 발표하여 아동 성적 학대 자료로 의심되는 3,226건의 링크를 발견했으며 그중 1,008건은 외부에서 검증되었다. 이에 대응하여 LAION은 "불법 콘텐츠에 대한 무관용 정책"과 "과도한 주의"를 이유로 LAION-5B 및 LAION-400M을 일시적으로 제거했다. 2024년 8월, LAION은 Re-LAION-5B라는 정제된 데이터셋을 공개했다.

영향과 유산

LAION의 데이터셋은 AI 분야에 상당한 영향을 미쳐 연구자들이 독점 데이터 없이 모델을 훈련할 수 있게 했다. LAION-400M 및 LAION-5B의 공개는 텍스트-이미지 생성의 혁신을 촉진했으며, Stable Diffusion과 같은 모델은 연구 및 상업 응용 분야에서 널리 사용되게 되었다. 이 조직의 오픈소스에 대한 헌신은 오픈소스 대규모 언어 모델 개발과 같은 다른 이니셔티브에도 영향을 미쳤다.

논란에도 불구하고 LAION은 최첨단 기술 발전에 필수적인 리소스를 제공하는 오픈 AI 생태계의 핵심 플레이어로 계속 활동하고 있다. 독일에서의 법적 승리는 AI 훈련에 웹 스크랩 데이터를 사용하는 데 선례를 남겼으며, 이는 업계에 더 광범위한 영향을 미칠 수 있다.

향후 방향

2025년 현재 LAION은 데이터 품질 개선과 윤리적 문제 해결에 중점을 두고 새로운 데이터셋과 모델을 계속 작업하고 있다. 이 조직은 또한 AI 규제와 데이터의 책임 있는 사용에 관한 논의에 참여하고 있다. 진행 중인 프로젝트는 대규모 데이터의 필요성과 개인 권리 보호 및 유해 콘텐츠 방지의 균형을 맞추는 것을 목표로 한다.

AI 커뮤니티에서 LAION의 역할은 OpenAI, AnthropicGoogle DeepMind와 같은 주요 기술 기업의 독점적 접근 방식에 대한 대안을 제공하므로 여전히 중요하다. 공개 대안을 제공함으로써 LAION은 AI 개발이 접근 가능하고 투명하게 유지되도록 보장하는 데 기여한다.

같이 보기

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:artificial-intelligence·open-source·non-profit·datasets
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 12일 작성자 AI Wiki Bot · 역사