WikiText는 검증된 위키백과 문서에서 추출한 영어 텍스트 데이터셋 모음으로, 언어 모델의 훈련과 벤치마킹을 위해 설계되었습니다. 이 데이터셋은 Penn Treebank와 같은 초기 데이터셋보다 더 크고 현실적인 말뭉치를 제공하기 위해 도입되었으며, 제목, 목록, 링크를 포함한 원본 문서 구조를 보존하는 데 중점을 둡니다. 이 데이터셋은 기계 학습 및 딥 러닝 연구에서 다음 단어 예측 및 모델 평가와 같은 작업에 일반적으로 사용됩니다.
주요 버전은 WikiText-2와 WikiText-103으로, 각각 2백만 개와 1억 3백만 개의 토큰을 포함합니다. 이 데이터셋은 표와 목록을 제외하도록 선별되었으며, 알 수 없는 단어에 대한 특수 토큰과 함께 원시 텍스트를 유지하여 모델이 대규모 어휘와 장기 의존성을 처리하는 능력을 테스트하는 데 적합합니다. WikiText는 이 분야의 표준 벤치마크가 되었으며, 신경망 및 대규모 언어 모델에 관한 수많은 논문에서 인용되었습니다.
데이터셋 구축
WikiText는 2016년 Salesforce Research에 의해 만들어졌으며, 이전 옵션보다 더 도전적인 말뭉치를 제공하는 것을 목표로 했습니다. 추출 과정은 위키백과 커뮤니티에서 '우수' 또는 '추천' 등급을 받은 문서를 가져와 높은 품질과 일관성을 보장했습니다. 그런 다음 텍스트는 마크업을 제거하기 위해 정리되었지만, 원래의 대소문자, 구두점 및 숫자는 보존되었으며, 이는 이전 데이터셋이 모든 것을 소문자로 변환한 것과는 차이가 있습니다.
주요 특징은 WikiText-103에 267,735개 단어 어휘를 사용한다는 점이며, 여기에는 훈련 세트에서 최소 세 번 이상 나타나는 모든 단어가 포함됩니다. 드문 단어는 '<unk>' 토큰으로 대체됩니다. 이 대규모 어휘는 모델이 많은 단어에 대한 표현을 학습하도록 강제하여 일반화 능력을 테스트합니다. 데이터셋은 훈련, 검증 및 테스트 세트로 분할되며, 테스트 세트는 누출을 방지하기 위해 다른 기간의 문서를 포함합니다.
언어 모델링 응용
WikiText는 주로 단어 시퀀스의 확률을 예측하는 언어 모델을 평가하는 데 사용됩니다. 연구자들은 이를 사용하여 모델이 다음 단어를 얼마나 잘 예측하는지 나타내는 지표인 혼란도를 측정합니다. 혼란도 점수가 낮을수록 더 좋으며, WikiText-103은 OpenAI 및 Google DeepMind에서 개발된 것과 같은 트랜스포머 기반 모델을 비교하는 표준이 되었습니다.
예를 들어, GPT-2 및 BERT와 같은 모델은 WikiText-103에서 평가되었으며, 보고된 혼란도 점수는 시간이 지남에 따라 개선되었습니다. 평균 약 3,000단어에 달하는 이 데이터셋의 긴 문서는 모델의 장거리 맥락 처리 능력을 테스트하며, 이는 문서 요약 및 질문 응답과 같은 작업에 중요합니다. 이는 WikiText를 인공 지능 연구를 발전시키는 귀중한 자원으로 만듭니다.
다른 데이터셋과의 비교
WikiText 이전에는 Penn Treebank(PTB)가 표준 벤치마크였으며, Wall Street Journal 기사에서 약 1백만 개의 토큰만 포함합니다. PTB는 더 작고 제한된 어휘를 가지고 있어 모델이 낮은 혼란도를 달성하기 더 쉽습니다. WikiText는 더 큰 어휘와 더 긴 문서를 사용하여 보다 현실적인 도전을 제공하며, 실제 텍스트를 더 잘 반영합니다.
또 다른 데이터셋인 One Billion Word Benchmark는 더 크지만 문장이 섞여 있어 문서 구조가 손실됩니다. WikiText는 원본 문서 순서를 유지하여 모델이 일관된 서사에서 학습할 수 있게 합니다. 이러한 구조적 차이는 모델이 문장과 단락 전반의 맥락을 이해해야 하는 생성형 AI 시스템에 중요한 능력입니다.
한계 및 비판
널리 사용됨에도 불구하고 WikiText에는 한계가 있습니다. 이 데이터셋은 위키백과에서 파생되었으며, 이는 형식적이고 백과사전적인 스타일을 가지므로 비공식적이거나 대화적인 언어를 대표하지 않을 수 있습니다. 또한 정리 과정에서 표와 목록이 제거되는데, 이는 특정 작업에 유용한 정보가 될 수 있습니다. 일부 연구자들은 '<unk>' 토큰 처리가 평가에 편향을 줄 수 있으며, 모델이 드문 단어를 학습하기보다는 이를 의존할 수 있다고 지적했습니다.
또 다른 비판은 WikiText-103이 크지만 Anthropic이나 Microsoft (AI)과 같은 기업의 대규모 언어 모델을 훈련하는 데 사용되는 현대 웹 규모 데이터셋보다 여전히 작다는 것입니다. 2025년 기준으로 많은 모델이 수조 개의 토큰으로 훈련되므로, WikiText는 생산 시스템의 훈련 소스보다는 학술 연구를 위한 벤치마크에 가깝습니다. 그럼에도 불구하고 이 분야에서 재현 가능한 비교를 위한 표준으로 남아 있습니다.
향후 방향
WikiText의 개발은 The Pile 및 RedPajama와 같은 다른 데이터셋의 생성을 촉진했으며, 이들은 여러 소스를 결합합니다. 이러한 최신 데이터셋은 다양한 텍스트 유형과 더 큰 규모를 포함하여 WikiText의 한계를 해결하는 것을 목표로 합니다. 그러나 WikiText의 단순성과 사용 편의성은 특히 딥 러닝 기초를 연구하는 사람들에게 교육 및 연구에서 계속 관련성을 유지하게 합니다.
연구자들은 또한 WikiText를 다국어 및 다중 모달 작업에 적응시키는 방법을 탐구하고 있지만, 원래 버전은 영어 전용입니다. AI 모델이 진화함에 따라 고품질의 구조화된 데이터셋에 대한 필요성은 지속되며, WikiText는 이러한 자원을 구축하는 방법의 기초적인 예시로 작용합니다. 수많은 논문에서 기준선으로 인용되는 그 유산은 기계 학습 발전 역사에서 그 위치를 보장합니다.