The Pile은 대규모 언어 모델(LLM)을 훈련시키기 위해 만들어진 886GB 규모의 다양한 오픈소스 영어 텍스트 데이터셋이다. 2020년 EleutherAI에 의해 구축되었으며, 같은 해 12월 31일에 공개적으로 배포되었다. 이 데이터셋은 책, 영화 대본, 과학 논문 등 다양한 매체를 포함한 22개의 하위 데이터셋으로 구성되어 있다. 2024년 기준으로 The Pile과 Common Crawl은 AI 모델 훈련에 사용된 두 가지 주요 훈련 데이터셋이었다.
The Pile은 웹 전용 말뭉치에 대한 더 다양하고 고품질의 대안을 제공하기 위해 설계되었으며, 학술 출판물, 법률 문서, 창작 문학과 같은 출처에서 자료를 가져왔다. 그 규모와 다양성 덕분에 많은 대규모 언어 모델 프로젝트, 특히 오픈소스 커뮤니티의 프로젝트에서 기초 자원이 되었다. 이 데이터셋의 구조는 연구자들이 다양한 데이터 유형이 모델 성능에 미치는 영향을 연구할 수 있게 했으며, 머신 러닝과 인공 지능 분야의 발전에 기여했다.
구성 및 하위 데이터셋
The Pile은 각각 영어 텍스트의 다양한 영역과 스타일을 다루도록 선택된 22개의 개별 하위 데이터셋을 통합한다. 여기에는 책 모음집인 Books3, 영화 및 텔레비전 자막을 포함하는 OpenSubtitles, 과학 논문을 제공하는 arXiv가 포함된다. 다른 구성 요소로는 PubMed 초록, 미국 법률 의견, GitHub 코드 등이 있다. 이러한 다양성은 이 데이터셋으로 훈련된 모델의 일반화 능력을 향상시켜 기술 질의응답부터 창작 문학까지 다양한 작업을 처리할 수 있도록 하기 위한 것이었다.
GitHub의 코드와 arXiv의 학술 논문을 포함함으로써 The Pile은 프로그래밍 및 과학 연구를 지원할 수 있는 모델을 훈련하는 데 특히 유용해졌다. 비영리 AI 연구 그룹인 EleutherAI의 데이터셋 제작자들은 이전에 OpenAI 및 Google DeepMind와 같은 대기업에 국한되었던 고품질 훈련 데이터에 대한 접근을 민주화하는 것을 목표로 했다.
저작권 논란
The Pile 사용을 둘러싼 저작권 분쟁은 2023년에 심화되었다. Books3 구성 요소에는 불법 다운로드 사이트인 Bibliotik에서 수집된 저작권 보호 자료가 포함되어 있다. 2023년 7월, 덴마크의 반(反)해적 그룹인 Rights Alliance는 DMCA 통지를 통해 Books3를 내려받게 했다. Books3는 2024년 세 명의 작가가 손해 배상을 요구하며 집단 소송을 제기하기 전에 The Pile에서 제거되었지만, 원본 데이터셋의 사본은 웹에 여전히 남아 있었다. 2024년까지 The Pile은 원래 사이트에서도 내려졌지만, 다른 파일 공유 서비스에서는 계속 접근할 수 있었다.
또 다른 하위 데이터셋인 OpenSubtitles는 다큐멘터리, 영화, 텔레비전, 온라인 비디오의 저작권 보호 작품 사용에 대한 논란을 일으켰다. 수만 개의 YouTube 동영상 자막이 YouTube에서 직접 스크랩되어 The Pile에 포함되었으며, YouTube는 이는 자사 서비스 약관에 위배된다고 주장했다. 이러한 문제들은 신경망 및 트랜스포머 모델 훈련을 위해 웹에서 스크랩한 데이터를 사용할 때의 법적, 윤리적 과제를 부각시켰다.
Common Pile v0.1
2025년 6월, EleutherAI는 Poolside, Hugging Face, 미국 의회도서관, 그리고 토론토 대학교, MIT, CMU, Vector Institute, Allen Institute for AI를 포함한 14개 기관의 20명 이상의 연구자들과 협력하여 Common Pile v0.1을 출시했다. 이 훈련 데이터셋에는 AI 모델 훈련 사용을 허용하는 라이선스가 있는 작품만 포함되어 있다. 그 의도는 저작권을 존중하면서 AI 시스템을 윤리적으로 훈련할 때 무엇이 가능한지 보여주는 것이었다.
제작자들은 데이터 수집이 완전히 자동화될 수 없어 시간이 많이 걸렸으며, 인간이 모든 항목을 검증하고 주석을 달아야 한다는 것을 발견했다. 그럼에도 불구하고 결과 모델은 기대를 초과하는 성과를 낼 수 있었지만, 여전히 최첨단 모델과는 비교할 수 없었다. 제작자들은 Common Pile에서 생성된 결과를 Common Pile 생성 2년 전에 출시된 모델인 Llama 2와 유사하다고 비교했다. 이 모델은 기본 훈련 데이터에 저작권 문제가 적다면 출력을 사용하는 사람들에게 더 적은 법적 위험을 제공해야 한다.
영향 및 유산
The Pile은 딥 러닝 모델 훈련을 위한 대규모 접근 가능한 데이터셋을 제공함으로써 오픈소스 AI 연구 환경에 상당한 영향을 미쳤다. 그 배포는 이전에 기술 대기업이 지배했던 대규모 훈련을 소규모 연구 그룹과 독립 개발자들이 실험할 수 있게 했다. 이 데이터셋은 또한 AI에서 데이터 출처와 저작권에 대한 논의를 촉발하여, 윤리적 소싱을 우선시하는 Common Pile과 같은 이니셔티브로 이어졌다.
2024년 기준으로 The Pile과 Common Crawl은 법적 과제에도 불구하고 많은 AI 모델의 주요 훈련 데이터셋으로 남아 있었다. Common Pile과 같은 더 신중하게 선별된 데이터셋으로의 전환은 혁신과 법적, 윤리적 고려 사항의 균형을 맞추는 책임 있는 AI 개발을 향한 업계의 더 넓은 추세를 반영한다. The Pile의 유산은 기술적 기여뿐만 아니라 생성형 AI 분야에서 훈련 데이터가 수집되고 사용되는 방식에 대한 재평가를 촉발한 데에도 있다.