OpenWebText는 Reddit 게시물에서 추출한 웹 페이지로 구성된 오픈소스 데이터셋으로, OpenAI의 GPT-2 언어 모델을 학습하는 데 사용된 비공개 WebText 코퍼스를 재현하기 위해 만들어졌다. 이 데이터셋은 대규모 언어 모델을 학습하고 평가하기 위한 방대하고 다양한 텍스트 코퍼스를 제공한다.
배경 및 동기
OpenWebText는 2019년 당시 각각 메릴랜드 대학교와 존스홉킨스 대학교에 소속된 연구자였던 Aaron Gokaslan과 Vanya Cohen이 도입했다. 동기는 OpenAI가 GPT-2 학습에 사용된 전체 WebText 데이터셋을 공개하지 않기로 한 결정에서 비롯되었다. WebText는 최소 3 카르마를 받은 Reddit 게시물의 외부 링크로 구성되었으며, 총 약 40GB의 텍스트였다. 재현 가능성과 추가 연구를 가능하게 하기 위해 Gokaslan과 Cohen은 2005년부터 2018년 4월까지의 Reddit 게시물에서 모든 외부 링크를 수집하고, 동일한 카르마 기준을 적용하고, 영어 콘텐츠로 필터링하여 OpenWebText를 만들었다. 결과적으로 생성된 데이터셋은 800만 개 이상의 문서를 포함하며 총 약 38GB의 텍스트로, 원본 WebText의 규모와 다양성을 밀접하게 반영한다.
데이터셋 특성
OpenWebText는 대규모의 비정형 텍스트 코퍼스이다. Wikipedia나 책과 같은 선별된 데이터셋과 달리 뉴스 기사, 블로그 게시물, 포럼 토론, 개인 웹사이트를 포함한 다양한 글쓰기 스타일, 주제, 형식을 포착한다. 이러한 다양성은 범용 언어 모델을 학습하는 데 가치를 제공한다. 데이터셋은 텍스트 파일 모음으로 제공되며, 각 문서는 줄바꿈으로 구분된다. 연구 커뮤니티에서 다음 단어 예측 및 기타 언어 모델링 작업에 대한 모델 성능을 평가하는 벤치마크로 흔히 사용된다. 그러나 공개 웹 콘텐츠에서 파생되었기 때문에 중복 콘텐츠, 저품질 텍스트, 온라인 담론에 존재하는 잠재적 편향과 같은 문제를 상속받는다.
언어 모델 학습에서의 활용
OpenWebText는 자연어 처리(NLP) 분야에서 널리 채택되었다. 이는 GPT-2 변형 및 기타 트랜스포머 기반 아키텍처를 포함한 많은 오픈소스 언어 모델의 표준 학습 코퍼스 역할을 한다. 예를 들어, Hugging Face는 미세 조정 및 평가에 흔히 사용되는 사전 처리된 OpenWebText 버전을 제공한다. 연구자들은 GPT-2와 비교 가능한 학습 분포를 제공하므로 GPT-2에 대한 모델 성능을 비교하는 데 자주 사용한다. 이 데이터셋은 데이터 큐레이션, 모델 스케일링, 학습 데이터가 모델 동작에 미치는 영향에 관한 연구에서도 사용되었다. 그 가용성은 특히 생성형 AI의 맥락에서 대규모 언어 모델 개발의 재현 가능한 연구를 촉진했다.
영향 및 한계
OpenWebText는 대규모 웹 코퍼스에 대한 접근을 민주화함으로써 오픈소스 AI 커뮤니티에 상당한 영향을 미쳤다. 독점 데이터셋에 접근할 수 없는 연구자들이 GPT-2와 유사한 규모의 모델을 학습하고 평가할 수 있게 해주었다. 그러나 이 데이터셋에는 한계가 있다. 선별된 코퍼스만큼 깨끗하지 않으며, 상당량의 보일러플레이트 텍스트, 내비게이션 요소, 기타 노이즈를 포함한다. 또한 Reddit 카르마에 기반한 수집 방법론은 Reddit 사용자에게 호소력이 있는 콘텐츠를 선호하는 선택 편향을 도입한다. 이 데이터셋은 또한 포함된 많은 웹 페이지에 대한 명시적 라이선스 정보가 부족하여 저작권 문제를 제기한다. 이러한 문제에도 불구하고 OpenWebText는 대규모 언어 모델 개발의 기초 자료로 남아 있으며 학술 문헌에서 계속 인용되고 있다.
관련 데이터셋 및 진화
OpenWebText는 NLP에서 사용되는 웹 규모 텍스트 데이터셋의 광범위한 생태계의 일부이다. 다른 주목할 만한 예로는 웹의 대규모 크롤링인 Common Crawl과 다양한 소스의 선별된 컬렉션인 The Pile이 있다. C4(Colossal Clean Crawled Corpus) 및 RefinedWeb과 같은 더 최근의 데이터셋은 원시 웹 크롤링에 존재하는 노이즈 및 품질 문제 중 일부를 해결하기 위해 개발되었다. 이러한 최신 데이터셋은 더 정교한 필터링 및 중복 제거 기술을 사용한다. 그럼에도 불구하고 OpenWebText는 역사적 벤치마크이자 데이터 큐레이션 방법을 평가하기 위한 기준선으로서 여전히 관련성이 있다. 또한 그 생성은 인공지능 분야에서 공개 데이터의 중요성을 부각시켰으며, 공공 사용을 위한 학습 코퍼스 공개에 대한 후속 노력에 영향을 미쳤다.