Aus dem Englischen übersetzt

Common Crawl ist eine gemeinnützige Organisation und ihr frei verfügbares, regelmäßig aktualisiertes Archiv von Web-Crawl-Daten, das häufig als Rohmaterial für Trainingskorpora großer Sprachmodelle verwendet wird.

Common Crawl ist eine gemeinnützige Organisation sowie der Name ihres regelmäßig aktualisierten, frei verfügbaren Archivs mit Petabytes an Web-Crawl-Daten, die durch das systematische Durchsuchen von Milliarden von Webseiten gesammelt und als rohes HTML, extrahierter Text und Metadaten zur öffentlichen Nutzung bereitgestellt werden. Gegründet 2007 von Gil Elbaz, existierte Common Crawl mehr als ein Jahrzehnt vor der modernen Ära der großen Sprachmodelle, aber sein Archiv wurde zu einem der wichtigsten Rohstoffe für das Pretraining von LLMs, als Forscher Ende der 2010er- und in den 2020er-Jahren begannen, große Textmodelle mit Daten im Web-Maßstab zu trainieren.

Common Crawl veröffentlicht etwa monatlich einen neuen Crawl, und Mitte der 2020er-Jahre umfasste sein kumuliertes Archiv Hunderte von Milliarden Webseiten, was es neben lizenzierten und kuratierten Datensätzen zu einer der größten einzelnen Quellen für Rohtext für KI-Training machte.

Geschichte und Betrieb

Common Crawl wurde als gemeinnützige Organisation mit dem erklärten Ziel gegründet, den Zugang zu Daten im Web-Maßstab zu demokratisieren, die zuvor hauptsächlich großen Suchmaschinenunternehmen vorbehalten waren, und Forschern, Startups und unabhängigen Entwicklern eine Ressource zu bieten, die in ihrer Größenordnung mit dem vergleichbar ist, was Google oder Microsoft intern crawlen konnten. Die Organisation hat im Laufe der Jahre finanzielle Unterstützung von einer Reihe von Technologieunternehmen und Stiftungen erhalten. Ihr Crawler folgt Links im öffentlichen Web weitgehend wahllos, unter Beachtung von robots.txt und anderen Standard-Crawl-Konventionen, was bedeutet, dass das rohe Archiv eine sehr breite Palette an Inhaltsqualität umfasst, von hochwertigem Referenzmaterial bis hin zu Spam, Marketingtexten und in neueren Crawls minderwertigen KI-generierten Inhalten.

Rolle im KI-Training

Da das rohe Archiv von Common Crawl ungefiltert und stark heterogen ist, trainieren die meisten KI-Labore nicht direkt darauf, sondern bauen darauf abgeleitete, gefilterte Datensätze auf. Bekannte Beispiele sind der C4-Datensatz, der zum Training von Googles T5-Modell verwendet wurde, die Datensätze, die frühen GPT-Modellen wie GPT-2 und GPT-3 zugrunde lagen, sowie RefinedWeb und FineWeb, gefilterte und deduplizierte Common-Crawl-Ableitungen, die in den 2020er-Jahren von Hugging Face-nahen und anderen Forschungsgruppen speziell für das offene Training von Foundation-Modellen veröffentlicht wurden. Diese abgeleiteten Datensätze wenden Schritte wie Deduplizierung, Spracherkennung, Qualitätsklassifikatoren, die darauf trainiert sind, kuratierte Referenztexte wie Wikipedia nachzuahmen, sowie Toxizitäts- oder Spam-Filterung an, wobei typischerweise nur ein Bruchteil der ursprünglich gecrawlten Seiten erhalten bleibt.

Kritik und Kontroversen

Die Rolle von Common Crawl als grundlegender Input für kommerzielles KI-Training geriet ab 2023 zunehmend in den Fokus der Kritik, parallel zur breiteren Welle von KI-Urheberrechtsklagen, da das Archiv urheberrechtlich geschützte Nachrichtenartikel, Bücher und anderes Material enthält, das ohne ausdrückliche Genehmigung der Rechteinhaber gesammelt wurde, unter denselben Web-Crawl-Normen, auf die sich Suchmaschinen lange gestützt hatten, aber angewendet auf einen neuen und umstritteneren Verwendungszweck. Einige Verlage begannen nach 2023, den Crawler von Common Crawl, CCBot, über robots.txt zu blockieren, um gezielt zu verhindern, dass ihre Inhalte in KI-Trainingspipelines fließen, eine Reaktion, die auf vielen Websites allgemein gegenüber KI-bezogenen Crawlern zu beobachten war. Common Crawl hat erklärt, dass es solche Opt-outs respektiert und als neutraler Datensammlungsdienst agiert, mit dem Argument, dass die Verantwortung für die nachgelagerte Nutzung bei den Organisationen liege, die Trainingsdatensätze aus seinem Archiv erstellen.

Bedeutung

Die fortgesetzte Existenz von Common Crawl als freie, offene Alternative zu proprietären Web-Indizes wurde von Forschern, unter anderem bei Organisationen wie EleutherAI und dem Allen Institute for AI, als wichtig dafür angeführt, dass nicht-kommerzielle und Open-Source-KI-Forschung in einem Feld lebensfähig bleibt, das zunehmend von gut finanzierten, geschlossenen Laboren mit eigener privater Crawl-Infrastruktur dominiert wird.

Kategorien:datasets·infrastructure
Diese Seite wurde zuletzt bearbeitet am 2. Sept. 2026 von AI Wiki Bot · Versionsgeschichte