WikiText ist eine Sammlung von englischen Textdatensätzen, die aus verifizierten Wikipedia-Artikeln extrahiert wurden und für das Training und die Bewertung von Sprachmodellen entwickelt wurde. Es wurde eingeführt, um einen größeren und realistischeren Korpus als frühere Datensätze wie den Penn Treebank bereitzustellen, wobei der Fokus auf der Beibehaltung der ursprünglichen Artikelstruktur, einschließlich Überschriften, Listen und Links, liegt. Der Datensatz wird häufig in der Forschung zu maschinellem Lernen und Deep Learning für Aufgaben wie die Vorhersage des nächsten Wortes und die Modellbewertung verwendet.
Die primären Versionen sind WikiText-2 und WikiText-103, die 2 Millionen bzw. 103 Millionen Token enthalten. Diese Datensätze werden kuratiert, um Tabellen und Listen auszuschließen, und sie behalten den Rohtext mit speziellen Token für unbekannte Wörter bei, was sie für Tests der Fähigkeit von Modellen geeignet macht, einen großen Wortschatz und langfristige Abhängigkeiten zu verarbeiten. WikiText ist zu einem Standard-Benchmark in diesem Bereich geworden und wird in zahlreichen Arbeiten über neuronale Netze und große Sprachmodelle zitiert.
Datensatzkonstruktion
WikiText wurde 2016 von Salesforce Research erstellt, mit dem Ziel, einen anspruchsvolleren Korpus als frühere Optionen bereitzustellen. Der Extraktionsprozess umfasste die Auswahl von Wikipedia-Artikeln, die von der Wikipedia-Community als „Lesenswert“ oder „Exzellent“ eingestuft wurden, um hohe Qualität und Konsistenz zu gewährleisten. Der Text wurde anschließend bereinigt, um Markup zu entfernen, aber die ursprüngliche Groß- und Kleinschreibung, Interpunktion und Zahlen wurden beibehalten, was eine Abweichung von früheren Datensätzen darstellt, die oft alles in Kleinbuchstaben umwandelten.
Ein zentrales Merkmal ist die Verwendung eines Wortschatzes von 267.735 Wörtern für WikiText-103, der alle Wörter umfasst, die im Trainingssatz mindestens dreimal vorkommen. Seltene Wörter werden durch ein <unk>-Token ersetzt. Dieser große Wortschatz zwingt Modelle dazu, Darstellungen für viele Wörter zu lernen, und testet ihre Fähigkeit zur Generalisierung. Der Datensatz ist in Trainings-, Validierungs- und Testsets unterteilt, wobei das Testset Artikel aus einem anderen Zeitraum enthält, um Datenlecks zu vermeiden.
Anwendungen in der Sprachmodellierung
WikiText wird hauptsächlich zur Bewertung von Sprachmodellen verwendet, die die Wahrscheinlichkeit einer Wortfolge vorhersagen. Forscher nutzen es, um die Perplexität zu messen, eine Metrik, die angibt, wie gut ein Modell das nächste Wort vorhersagt. Niedrigere Perplexitätswerte sind besser, und WikiText-103 hat sich als Standard für den Vergleich von Modellen auf Basis von Transformatoren etabliert, wie sie beispielsweise von OpenAI und Google DeepMind entwickelt wurden.
So wurden beispielsweise Modelle wie GPT-2 und BERT auf WikiText-103 evaluiert, wobei die berichteten Perplexitätswerte im Laufe der Zeit verbessert wurden. Die langen Artikel des Datensatzes, die durchschnittlich etwa 3.000 Wörter umfassen, testen die Fähigkeit eines Modells, langreichweitige Kontexte zu verarbeiten, was für Aufgaben wie Dokumentzusammenfassung und Fragebeantwortung entscheidend ist. Dies macht WikiText zu einer wertvollen Ressource für die Förderung der Forschung im Bereich künstliche Intelligenz.
Vergleich mit anderen Datensätzen
Vor WikiText war der Standard-Benchmark der Penn Treebank (PTB), der nur etwa 1 Million Token aus Artikeln des Wall Street Journal enthält. PTB ist kleiner und hat einen eingeschränkten Wortschatz, was es Modellen erleichtert, niedrige Perplexität zu erreichen. WikiText bietet eine realistischere Herausforderung, indem es einen größeren Wortschatz und längere Dokumente verwendet, die den realen Text besser widerspiegeln.
Ein weiterer Datensatz, der One Billion Word Benchmark, ist größer, besteht jedoch aus gemischten Sätzen, wodurch die Dokumentstruktur verloren geht. WikiText behält die ursprüngliche Artikelreihenfolge bei, sodass Modelle aus kohärenten Erzählungen lernen können. Dieser strukturelle Unterschied ist bedeutsam für das Training von Modellen, die Kontext über Sätze und Absätze hinweg verstehen müssen, eine Schlüsselfähigkeit für Systeme der generativen KI.
Einschränkungen und Kritik
Trotz seiner Beliebtheit hat WikiText Einschränkungen. Der Datensatz stammt aus Wikipedia, das einen formalen, enzyklopädischen Stil aufweist, sodass er möglicherweise keine informelle oder konversationelle Sprache repräsentiert. Darüber hinaus entfernt der Bereinigungsprozess Tabellen und Listen, die für bestimmte Aufgaben informativ sein könnten. Einige Forscher haben angemerkt, dass die Handhabung des <unk>-Tokens die Bewertung verzerren kann, da Modelle sich darauf verlassen könnten, anstatt seltene Wörter zu lernen.
Ein weiterer Kritikpunkt ist, dass WikiText-103, obwohl groß, immer noch kleiner ist als moderne Web-Scale-Datensätze, die für das Training von großen Sprachmodellen wie denen von Anthropic oder Microsoft verwendet werden. Stand 2025 werden viele Modelle mit Billionen von Token trainiert, was WikiText eher zu einem Benchmark für akademische Forschung als zu einer Quelle für Produktionssysteme macht. Dennoch bleibt es ein Standard für reproduzierbare Vergleiche in diesem Bereich.
Zukünftige Richtungen
Die Entwicklung von WikiText hat die Erstellung anderer Datensätze wie The Pile und RedPajama beeinflusst, die mehrere Quellen kombinieren. Diese neueren Datensätze zielen darauf ab, die Einschränkungen von WikiText zu überwinden, indem sie vielfältige Textarten und größere Umfänge einbeziehen. Die Einfachheit und Benutzerfreundlichkeit von WikiText gewährleisten jedoch seine anhaltende Relevanz in der Bildung und Forschung, insbesondere für Studien zu den Grundlagen des Deep Learning.
Forscher untersuchen auch Möglichkeiten, WikiText für mehrsprachige und multimodale Aufgaben anzupassen, obwohl die ursprüngliche Version nur Englisch umfasst. Mit der Weiterentwicklung von KI-Modellen bleibt der Bedarf an hochwertigen, strukturierten Datensätzen bestehen, und WikiText dient als grundlegendes Beispiel für die Konstruktion solcher Ressourcen. Sein Vermächtnis zeigt sich in den vielen Arbeiten, die es als Basislinie in der Entwicklung des maschinellen Lernens zitieren.