C4(Colossal Clean Crawled Corpus의 약자)는 대규모 언어 모델 사전 훈련에 사용되는 대규모 텍스트 데이터셋이다. 이 데이터셋은 2019년 Google 연구자들이 원래 Transformer (architecture) 기반 T5(Text-to-Text Transfer Transformer) 프로젝트의 일부로 도입했다. 이 데이터셋은 수년에 걸쳐 수집된 수십억 개의 웹 페이지를 포함하는 공개 저장소인 Common Crawl 웹 아카이브에서 추출한 수백 기가바이트의 영어 텍스트로 구성된다. C4는 일반적으로 탐색용 보일러플레이트 텍스트, 중복 콘텐츠, 저품질 또는 기계 생성 텍스트와 같은 상당한 노이즈를 포함하는 원시 웹 크롤 데이터에 대한 더 깨끗하고 관리하기 쉬운 대안을 제공하도록 설계되었다.
C4의 생성에는 원시 Common Crawl 데이터에 적용된 다단계 필터링 파이프라인이 포함되었다. 초기 단계에서는 거의 동일한 문장과 문서를 제거하여 데이터셋을 중복 제거했으며, 이는 중복성을 줄이고 훈련 효율성을 개선하는 데 도움이 되었다. 다음으로, 파이프라인은 "lorem ipsum" 또는 일반적인 보일러플레이트 문구와 같은 자리 표시자 텍스트를 포함하는 페이지를 제거하고, 언어 분류기에 의해 결정된 대로 주로 영어가 아닌 페이지를 폐기했다. 또한, 파이프라인은 특정 키워드나 용어를 포함한 공격적이거나 부적절한 콘텐츠가 있는 페이지를 걸러냈다. 최종 데이터셋은 약 750 기가바이트의 텍스트, 즉 약 1560억 개의 토큰으로 구성되었으며, 당시 공개적으로 사용 가능한 가장 큰 사전 훈련 코퍼스 중 하나가 되었다.
구성 및 특성
C4 데이터셋은 규모와 다양성으로 유명하다. 여기에는 뉴스 기사, 블로그, 포럼, 학술 페이지를 포함한 다양한 웹 도메인의 텍스트가 포함된다. 그러나 웹 크롤에서 파생되었기 때문에 데이터셋은 특정 주제의 과대 대표와 다른 주제의 과소 대표와 같은 웹 콘텐츠의 편향과 한계를 반영한다. 필터링 과정은 또한 비공식적이거나 비표준적인 많은 텍스트를 제거하여 공식적이고 잘 쓰인 영어에 대한 편향을 도입했다. 연구자들은 이후 테스트 세트가 훈련 데이터와 겹치는 데이터 오염과 개인 식별 정보의 존재와 같은 문제에 대해 C4를 분석했으며, 이로 인해 C4-200M 및 C4-en-1.0과 같은 더 정제된 버전이 개발되었다.
사전 훈련에서의 사용
C4는 원래 모든 자연어 처리 작업을 텍스트 간 변환 문제로 구성한 T5 모델을 사전 훈련하는 데 사용되었다. 데이터셋의 규모와 청결성은 수십억 개의 매개변수를 가진 모델을 훈련하는 데 적합하게 만들었다. T5 이후, C4는 데이터 큐레이션 기술을 평가하기 위한 표준 벤치마크가 되었으며 BERT 및 GPT 변형을 포함한 많은 후속 모델에 채택되었다. 예를 들어, OpenAI GPT-3 모델은 정확한 C4 데이터셋은 아니지만 유사한 필터링된 Common Crawl 접근 방식을 사용했다. 이 데이터셋은 또한 100개 이상의 언어를 다루는 mC4와 같은 다국어 확장의 기반이 되었다.
영향 및 유산
C4의 도입은 머신 러닝 및 인공 지능 분야에 상당한 영향을 미쳤다. 이는 대규모 모델 사전 훈련에서 데이터 품질의 중요성을 입증했으며, 신중한 필터링이 다운스트림 작업 성능의 실질적인 개선으로 이어질 수 있음을 보여주었다. C4는 또한 저장, 처리 및 윤리적 고려 사항을 포함한 웹 규모 데이터 작업의 실질적인 과제를 강조했다. 오픈 데이터셋으로의 공개는 전 세계 연구자들이 자체 웹 크롤을 수집할 필요 없이 대규모 사전 훈련을 실험할 수 있게 하여 고품질 훈련 데이터에 대한 접근을 민주화했다.
한계 및 비판
널리 사용됨에도 불구하고 C4는 비판을 받아왔다. 필터링 과정은 노이즈를 제거하는 데 효과적이었지만 코드 스니펫이나 비표준 영어 방언과 같은 특정 작업에 유용할 수 있는 콘텐츠도 제거했다. 데이터셋의 영어 전용 텍스트 의존성은 다국어 모델에 대한 적용 가능성을 제한했지만, 이는 나중에 mC4로 해결되었다. 또한, 원래 C4는 문서 수준에서 완전히 중복 제거되지 않아 반복 콘텐츠로 인한 잠재적 편향이 발생했다. 연구자들은 또한 데이터셋이 2019년까지의 웹 크롤에서 파생되었기 때문에 오래된 정보를 포함하고 있으며, 저작권이 있는 자료를 포함할 수 있어 상업적 모델에서의 사용에 대한 법적 및 윤리적 질문을 제기한다고 지적했다.
같이 보기
- Common Crawl
- T5
- 데이터 큐레이션
- 사전 훈련