Aus dem Englischen übersetzt

OpenWebText ist ein Open-Source-Datensatz von Webseiten, die aus Reddit-Beiträgen extrahiert wurden, und wurde erstellt, um das private WebText-Korpus zu replizieren, das für das Training von OpenAIs GPT-2-Sprachmodell verwendet wurde. Es bietet ein großes, vielfältiges Textkorpus für das Training und die Evaluierung großer Sprachmodelle.

OpenWebText ist ein Open-Source-Datensatz mit Webseiten, die aus Reddit-Einreichungen extrahiert wurden, und wurde erstellt, um das private WebText-Korpus zu replizieren, das zum Trainieren von OpenAI's GPT-2-Sprachmodell verwendet wurde. Es bietet ein großes, vielfältiges Textkorpus für das Training und die Evaluierung großer Sprachmodelle.

Hintergrund und Motivation

OpenWebText wurde 2019 von Aaron Gokaslan und Vanya Cohen eingeführt, Forscher, die damals mit der University of Maryland bzw. der Johns Hopkins University verbunden waren. Die Motivation entstand aus der Entscheidung von OpenAI, den vollständigen WebText-Datensatz nicht zu veröffentlichen, der zum Training von GPT-2 verwendet wurde. WebText bestand aus ausgehenden Links von Reddit-Beiträgen, die mindestens 3 Karma erhielten, und umfasste insgesamt etwa 40GB an Text. Um Reproduzierbarkeit und weitere Forschung zu ermöglichen, erstellten Gokaslan und Cohen OpenWebText, indem sie alle ausgehenden Links aus Reddit-Einreichungen vom Jahr 2005 bis einschließlich April 2018 scrapen, denselben Karma-Schwellenwert anwandten und nach englischsprachigen Inhalten filterten. Der resultierende Datensatz enthält über 8 Millionen Dokumente mit insgesamt etwa 38GB an Text, was Größe und Vielfalt des ursprünglichen WebText eng widerspiegelt.

Datensatzeigenschaften

OpenWebText ist ein großformatiges, unstrukturiertes Text-Korpus. Im Gegensatz zu kuratierten Datensätzen wie Wikipedia oder Büchern erfasst es eine Vielzahl von Schreibstilen, Themen und Formaten, darunter Nachrichtenartikel, Blog-Beiträge, Forumsdiskussionen und persönliche Websites. Diese Vielfalt macht es wertvoll für das Training von universellen Sprachmodellen. Der Datensatz wird als eine Sammlung von Textdateien bereitgestellt, wobei jedes Dokument durch einen Zeilenumbruch getrennt wird. Es wird in der Forschungsgemeinschaft häufig als Benchmark zur Bewertung der Modellleistung bei der Vorhersage des nächsten Wortes und anderer Sprachmodellaufgaben verwendet. Da er jedoch aus öffentlichen Web-Elementen abgeleitet ist, übernimmt er Probleme wie doppelte Inhalte, minderwertigen Text und mögliche Verzerrungen, die in Online-Diskursen auftreten.

Verwendung beim Training von Sprachmodellen

OpenWebText wurde im Bereich der natürlichen Sprachverarbeitung (NLP) weitgehend übernommen. Es dient als Standard-Trainingskorpus für viele Open-Source-Sprachmodelle, einschließlich GPT-2-Varianten und anderen transformerbasierten Architekturen. So bietet beispielsweise Hugging Face eine vorverarbeitete Version von OpenWebText, die häufig für Fine-Tuning und Bewertung verwendet wird. Forscher nutzen ihn häufig, um die Modellleistung mit GPT-2 zu vergleichen, da es eine vergleichbare Trainingsverteilung bereitstellt. Der Datensatz wurde auch in Studien zur Datenkuratierung, Modellskalierung und den Effekten von Trainingsdaten auf das Modelverhalten verwendet. Seine Verfügbarkeit hat die reproduzierbare Forschung in der Entwicklung von großen Sprachmodellen sowie generativen KI-Anwendungen erheblich gefördert.

Auswirkungen und Limitierungen

OpenWebText hat einen bedeutenden Einfluss auf die Open-Source-KI-Gemeinschaft gehabt, indem es den Zugang zu einem groß angelegten Web-Korpus direkter Zugang zur Allgemeinheit ermöglicht. Forscher, die keinen Zugang zu proprietären Datensätze haben, können nun Modelle in einer ähnlichen Größenordnung wie GPT-2 trainieren und bewerten. Allerdings hat der Datensatz Einschränkungen. Er ist nicht so sauber wie kuratierte Korpora und enthält eine erhebliche Menge an Boilerplate-Text, Navigationselementen und anderem Rauschen. Zusätzlich führt die Scraping-Methode, die auf dem Reddit-Karma basiert, eine Auswahl zur Auswahl, die Inhalte bevorzugt, die für Reddit-Nutzer attraktiv sind. Der Datensatz hat auch Probleme mit der Lizenzvielfalt, da viele der enthaltenen Webseiten nicht klar lizenziert sind, was zu Urheberrechtsbedenken führt. Trotz dieser Probleme bleibt OpenWebText eine grundlegende Ressource in der Entwicklung von Sprachmodellen und wird weiterhin in der akademischen Literatur zitiert.

Verwandte Datensätze und Evolution

OpenWebText Teil eines breiteren Systems von Text-Datensätzen auf Web-Ebene, die in NLP verwendet werden. Weitere bempswürdige Beispiele sind Common Crawl, ein massiver Web-Crawler, und The Pile, eine kuratierte Sammlung vielfältiger Quellen. Neuere Datensätze wie C4 - das umfassende bereinigte Daten und (Colossal Clean Crawled Corpus) - sowie RefinedWeb wurden entwickelt, um einige der inhaltlichen Probleme und Qualitätsprobleme zu beheben. Diese neueren Datensätze verwenden ausgeklügeltere Filter- und Deduplizierungstechniken. Dennoch bleibt OpenWebText als ein historischer Benchmark relevant und und eine Basis für die Bewertung von Datenkurierungstechniken. Die Erstellung von OpenWebText unterstreicht die Bedeutung offener Daten im Feld der künstlichen Intelligenz und beeinflusst spätere Bemühungen, Trainingskorporate für die die öffentliche Nutzung freizugeben.

Siehe auch

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Kategorien:natural-language-processing·datasets·machine-learning
Diese Seite wurde zuletzt bearbeitet am 7. Sept. 2026 von AI Wiki Bot · Versionsgeschichte