C4-EN은 공개 웹에서 추출한 대규모의 선별된 영어 텍스트 모음입니다. 이는 Google 연구자들이 머신 러닝 모델, 특히 대규모 언어 모델을 훈련시키기 위한 고품질의 다양한 텍스트 소스를 제공하기 위해 만든 C4(Colossal Clean Crawled Corpus) 데이터셋의 하위 집합입니다. C4-EN 하위 집합은 영어 콘텐츠에 중점을 두어 비영어 페이지를 걸러내고 데이터 품질을 개선하기 위해 추가 정제 단계를 적용합니다.
이 데이터셋은 2019년에 자연어 처리 작업을 위한 통합 프레임워크의 초기 사례인 T5(Text-to-Text Transfer Transformer) 모델 작업의 일환으로 소개되었습니다. 이후 C4-EN은 Artificial intelligence 및 Machine learning 분야에서 널리 사용되는 벤치마크이자 훈련 자원이 되었으며, 후속 데이터셋과 모델의 개발에 영향을 미쳤습니다.
구축 및 정제
원래 C4 데이터셋은 공개적으로 이용 가능한 웹 페이지 아카이브인 Common Crawl의 스냅샷에서 구축되었습니다. 구축 과정은 저품질 또는 관련 없는 콘텐츠를 제거하기 위한 여러 단계의 필터링과 정제를 포함했습니다. C4-EN의 경우, 주요 단계는 언어 식별로, 분류기를 사용하여 주로 영어로 된 페이지만 유지했습니다. 그 다음에는 중복 제거, 보일러플레이트 텍스트(예: 탐색 메뉴 및 바닥글) 제거, 공격적이거나 부적절한 콘텐츠가 포함된 페이지 필터링이 이어졌습니다.
추가 휴리스틱은 매우 짧은 문서, 과도한 구두점이나 횡설수설이 있는 페이지, 비텍스트 요소 비율이 높은 페이지를 버리는 데 적용되었습니다. 그 결과 수십억 단어를 포함하는 약 750기가바이트의 텍스트 코퍼스가 생성되었습니다. 정제 과정은 크기와 품질의 균형을 맞추도록 설계되어, 데이터셋이 대규모 모델 훈련을 지원할 만큼 충분히 크면서도 잡음이 많거나 반복적인 콘텐츠의 암기와 같은 일반적인 문제를 피할 만큼 깨끗하도록 보장했습니다.
언어 모델 훈련에서의 역할
C4-EN은 많은 Large language model 및 Transformer (architecture) 기반 아키텍처의 훈련에 중요한 역할을 해왔습니다. 주요 용도는 사전 훈련 코퍼스로, 모델이 특정 작업에 미세 조정되기 전에 일반적인 언어 패턴, 문법 및 세계 지식을 학습합니다. 수백만 개의 웹 도메인에서 얻은 데이터셋의 다양성은 모델이 다양한 글쓰기 스타일과 주제에 걸쳐 일반화하는 데 도움이 됩니다.
특히 C4-EN은 원래 T5 모델을 훈련하는 데 사용되었으며, 이 모델은 작업을 텍스트 간 문제로 구성함으로써 단일 모델이 광범위한 작업에 적용될 수 있음을 보여주었습니다. 이후 많은 다른 모델과 연구 프로젝트가 C4-EN 또는 그 변형을 채택했습니다. 예를 들어, 데이터 품질, 모델 확장 및 성능에 대한 중복 제거의 영향에 대한 연구에 사용되었습니다. 데이터셋은 또한 다양한 전처리 기술과 훈련 전략을 비교하기 위한 공통 벤치마크 역할을 합니다.
변형 및 확장
특정 연구 요구를 해결하기 위해 C4-EN의 여러 변형이 개발되었습니다. 주목할 만한 예로는 스팸 및 저품질 콘텐츠를 제거하기 위해 추가 필터링을 적용하는 C4-EN-No-Spam이 있습니다. 또 다른 예로는 반복 구문을 모델이 암기하는 것을 방지하는 데 도움이 되는 더 공격적인 중복 제거를 사용하는 C4-EN-Dedup이 있습니다. 이러한 변형을 통해 연구자는 다양한 정제 결정이 모델 동작에 미치는 영향을 분리할 수 있습니다.
또한 mC4와 같은 C4의 다국어 버전은 영어를 여러 언어 중 하나로 포함하지만, C4-EN은 영어에만 전적으로 초점을 맞춘 사람들을 위한 별개의 자원으로 남아 있습니다. 데이터셋은 또한 지시 튜닝 및 기타 하위 작업을 위한 합성 데이터셋을 만드는 데 사용되어 단순한 사전 훈련 이상으로 유용성을 확장했습니다.
영향 및 비판
C4-EN은 자연어 처리 분야에 상당한 영향을 미쳐 재현 가능하고 접근 가능한 자원을 제공하여 연구를 가속화했습니다. 그 가용성은 소규모 연구 그룹과 학술 기관이 이전에 자금이 충분한 산업 연구소에 국한되었던 대규모 모델 훈련에 참여할 수 있게 했습니다.
그러나 데이터셋은 또한 비판에 직면했습니다. 정제 단계에도 불구하고 개인 정보, 저작권 보호 자료 및 편향되거나 유해한 콘텐츠의 존재에 대한 우려가 제기되었습니다. 연구자들은 C4-EN에 민감한 데이터가 포함된 사례를 문서화하여 개인 정보 보호 및 웹 스크래핑 코퍼스의 윤리적 사용에 대한 논의로 이어졌습니다. 이에 대응하여 일부는 더 엄격한 필터링이나 대체 데이터셋 사용을 제안했지만, C4-EN은 새로운 방법을 평가하기 위한 표준 참조 지점으로 남아 있습니다.
미래 방향
C4-EN의 진화는 AI 시스템용 훈련 데이터 개발의 광범위한 추세를 반영합니다. 모델이 더 커지고 더 강력해짐에 따라 고품질, 다양하고 윤리적으로 출처가 명확한 데이터에 대한 수요는 계속 증가하고 있습니다. 미래 작업은 더 정교한 필터링 기술, 더 나은 언어 식별 및 문제가 있는 콘텐츠를 제외하는 메커니즘을 포함할 수 있습니다. C4-EN에서 얻은 교훈은 규모와 책임의 균형을 맞춰야 하는 차세대 데이터셋에 정보를 제공할 가능성이 높습니다.
나이가 들었음에도 불구하고 C4-EN은 기준선이자 지속적인 연구 주제로 여전히 관련성이 있습니다. 그 영향은 많은 현대 모델과 데이터셋에서 볼 수 있으며, 학술 논문에서 계속 인용되고 실제 응용 프로그램에서 사용됩니다. 2020년대 중반 현재, 더 새로운 코퍼스가 그 한계를 해결하기 위해 개발되고 있지만 여전히 이 분야의 기초 자원으로 간주됩니다.