학습 데이터는 머신러닝 모델을 가르치는 데 사용되는 예시의 집합체로, 모델은 훈련 과정에서 이 데이터로부터 통계적 패턴을 학습한다. 현대의 대규모 언어 모델의 경우, 학습 데이터는 일반적으로 공개 웹에서 수집한 방대한 양의 텍스트, 라이선스가 부여된 데이터셋, 서적, 코드 저장소, 그리고 점차적으로 다른 모델이 생성한 합성 데이터로 구성되며, 이 데이터의 규모, 다양성, 품질은 스케일링 법칙에 설명된 바와 같이 모델 크기 및 연산량과 함께 모델 성능의 주요 동인 중 하나로 작용한다.
학습 데이터의 구성과 출처는 2023년경부터 법적, 윤리적, 비즈니스적 논쟁의 중요한 지점이 되었다. 저자, 예술가, 출판사 및 기타 권리 보유자들이 저작권 보호 자료의 사용을 이유로 AI 개발자들을 상대로 소송을 제기했고, 점점 더 커지는 모델의 데이터 수요에 비해 쉽게 수집 가능한 고품질 텍스트가 상대적으로 부족해졌기 때문이다.
출처와 구성
대규모 언어 모델 훈련 코퍼스는 일반적으로 여러 출처의 혼합에서 얻어진다: Common Crawl과 같은 광범위한 웹 크롤링, GPT-3와 그 후속 모델의 기반이 된 데이터셋과 같은 선별되고 필터링된 웹 하위 집합, 디지털화된 서적, 위키백과 및 기타 참고 사이트, GitHub과 같은 저장소의 프로그래밍 코드, 학술 논문, 그리고 출판사, 스톡 미디어 회사 및 기타 권리 보유자와의 상업적 계약을 통해 얻은 라이선스 콘텐츠가 포함된다. 이러한 라이선스 관행은 2023년 이후 주요 연구소들 사이에서 무허가 스크래핑의 대안으로 크게 증가했다. 데이터는 일반적으로 중복 제거되고, 품질과 유해성 측면에서 필터링되며, 코드, 교과서, 추론 밀도가 높은 텍스트와 같은 고가치 범주에 가중치를 두거나 업샘플링되는데, 이는 데이터 품질과 구성이 단순한 양만큼이나 중요하다는 연구 결과를 반영한 것이다.
데이터 벽
2024년과 2025년까지 여러 연구자와 연구소 지도자들은 다가오는 데이터 벽에 대해 공개적으로 논의했다. 공개 인터넷에서 쉽게 얻을 수 있는 고품질 인간 생성 텍스트의 유한한 공급량(수십조 개의 토큰으로 추정)이 가장 큰 모델들의 훈련 실행에 의해 접근되거나 초과되고 있었던 것이다. 제안된 대응책으로는 합성 데이터의 사용 증가, 아카이브, 비공개 포럼, 비디오 대본과 같이 이전에 스크래핑에 사용할 수 없었던 데이터에 대한 라이선스 계약, 텍스트뿐만 아니라 이미지, 오디오, 비디오에서 신호를 추출하는 멀티모달 훈련, 그리고 사전 훈련 데이터의 비례적 증가 없이 더 많은 성능을 추출하기 위한 테스트 시점 연산 스케일링을 포함한 아키텍처적 또는 알고리즘적 접근 방식이 포함된다.
법적 및 윤리적 논란
학습 데이터 관행은 2023년 이후 제기된 일련의 AI 저작권 소송의 핵심이다. 여기에는 뉴욕타임스, 작가 그룹, 시각 예술가, 음악 레이블이 OpenAI, Meta, Stability AI, Midjourney를 포함한 기업들을 상대로 제기한 사건이 포함되며, 일반적으로 저작권 보호 저작물이 허가나 보상 없이 모델 훈련에 사용되었다고 주장하는 반면, 피고들은 일반적으로 훈련이 AI와 저작권 법률 하에서 공정 사용 또는 이에 상응하는 원칙을 구성한다고 주장해 왔다. 별도로, 연구자와 언론인들은 일부 훈련 데이터셋에 동의 없이 스크래핑된 개인 데이터가 포함되어 있음을 문서화했으며, 이미지 모델에 사용된 LAION 데이터셋과 관련된 최소 한 건의 문서화된 사례에서는 긴급한 시정 조치가 필요한 불법 자료가 포함되어 있어 데이터셋 큐레이션 및 공개 관행에 대한 더 광범위한 조사를 촉발했다. 이는 EU AI 법을 포함한 규제 기관이 점점 더 문서화를 요구하는 영역이다.