Common Crawl은 비영리 조직이자, 정기적으로 업데이트되는 수 페타바이트 규모의 웹 크롤링 데이터 아카이브의 이름으로, 수십억 개의 웹 페이지를 체계적으로 크롤링하여 원시 HTML, 추출된 텍스트, 메타데이터를 공개 다운로드용으로 제공한다. 2007년 Gil Elbaz가 설립한 Common Crawl은 현대의 대규모 언어 모델 시대보다 10년 이상 앞서 있었지만, 2010년대 후반과 2020년대에 연구자들이 웹 규모 데이터로 대규모 텍스트 모델을 훈련하기 시작하면서 그 아카이브는 LLM 사전 훈련의 가장 중요한 원자재 중 하나가 되었다.
Common Crawl은 대략 매월 새로운 크롤링을 공개하며, 2020년대 중반까지 누적 아카이브는 수천억 개의 웹 페이지에 달해, 라이선스 및 큐레이션된 데이터셋과 함께 AI 훈련에 사용 가능한 가장 큰 단일 원시 텍스트 소스 중 하나가 되었다.
역사 및 운영
Common Crawl은 이전에는 주로 대형 검색 엔진 기업만 이용할 수 있었던 웹 규모 데이터에 대한 접근을 민주화한다는 명시적 사명으로 비영리 조직으로 설립되었으며, 연구자, 스타트업, 독립 개발자에게 Google이나 Microsoft가 내부적으로 크롤링할 수 있는 규모와 비교할 만한 자원을 제공했다. 이 조직은 수년간 여러 기술 기업과 재단으로부터 자금과 지원을 받아왔다. 그 크롤러는 robots.txt 및 기타 표준 크롤링 관행에 따라 공개 웹의 링크를 대체로 무차별적으로 따라가며, 이는 원시 아카이브가 고가치 참고 자료부터 스팸, 마케팅 텍스트, 최근 크롤링의 저품질 AI 생성 콘텐츠에 이르기까지 매우 다양한 콘텐츠 품질을 포함함을 의미한다.
AI 훈련에서의 역할
Common Crawl의 원시 아카이브는 필터링되지 않고 매우 이질적이기 때문에, 대부분의 AI 연구소는 이를 직접 훈련에 사용하지 않고 그 위에 파생된 필터링 데이터셋을 구축한다. 잘 알려진 예로는 Google의 T5 모델 훈련에 사용된 C4 데이터셋, GPT-2 및 GPT-3와 같은 초기 GPT 모델의 기반이 된 데이터셋, 그리고 2020년대에 Hugging Face 계열 및 기타 연구 그룹이 공개 기반 모델 훈련을 위해 공개한 필터링 및 중복 제거된 Common Crawl 파생물인 RefinedWeb과 FineWeb이 있다. 이러한 파생 데이터셋은 중복 제거, 언어 식별, Wikipedia와 같은 큐레이션된 참조 텍스트를 모방하도록 훈련된 품질 분류기, 유해성 또는 스팸 필터링 등의 단계를 적용하며, 일반적으로 원래 크롤링된 페이지의 일부만 유지한다.
비판 및 논란
Common Crawl이 상업적 AI 훈련의 기초 입력으로서 수행하는 역할은 2023년부터 시작된 AI 저작권 소송의 광범위한 물결과 함께 점점 더 많은 조사를 받게 되었다. 아카이브에는 저작권이 있는 뉴스 기사, 서적, 기타 자료가 권리 보유자의 명시적 허가 없이 스크래핑되어 포함되어 있으며, 이는 검색 엔진이 오랫동안 의존해 온 동일한 웹 크롤링 규범에 따라 수집되었지만 새롭고 더 논쟁적인 용도에 적용된 것이다. 일부 출판사는 2023년 이후 robots.txt를 통해 Common Crawl의 크롤러인 CCBot을 차단하여 콘텐츠가 AI 훈련 파이프라인으로 유입되는 것을 막기 시작했으며, 이는 많은 사이트에서 AI 관련 크롤러를 전반적으로 차단하는 대응과 유사하다. Common Crawl은 이러한 옵트아웃을 준수하며 중립적인 데이터 수집 서비스로 운영된다고 밝히고, 하류 사용에 대한 책임은 아카이브에서 훈련 데이터셋을 구축하는 조직에 있다고 주장한다.
중요성
Common Crawl이 독점 웹 인덱스에 대한 무료 개방형 대안으로 계속 존재하는 것은 EleutherAI 및 Allen Institute for AI와 같은 조직의 연구자들에 의해, 자체 비공개 크롤링 인프라를 갖춘 자금이 풍부한 폐쇄형 연구소가 점점 지배하는 분야에서 비상업적 및 오픈소스 AI 연구가 계속 가능하도록 하는 데 중요하다고 언급되었다.