GPT-2 (Generative Pre-trained Transformer 2) ist ein Large Language Model, das von OpenAI entwickelt wurde und die zweite Iteration ihrer grundlegenden GPT-Serie darstellt. Es wurde auf einem Datensatz von 8 Millionen Webseiten vortrainiert und zeigte bedeutende Fortschritte bei der Textgenerierung, Übersetzung, Zusammenfassung und Beantwortung von Fragen. Das Modell wurde zunächst aufgrund von Bedenken hinsichtlich möglichen Missbrauchs nicht der Öffentlichkeit zugänglich gemacht, wurde aber schließlich im November 2019 vollständig veröffentlicht.
GPT-2 ist eine direkte Skalierung seines Vorgängers GPT-1, mit einer zehnfachen Erhöhung sowohl der Parameteranzahl als auch der Größe des Trainingsdatensatzes. Es verwendet eine Transformer-Architektur, die Aufmerksamkeitsmechanismen nutzt, um sich selektiv auf relevante Teile des Eingabetextes zu konzentrieren, was eine größere Parallelisierung ermöglicht und frühere Modelle auf Basis von RNN/CNN/LSTM übertrifft. Seine Fähigkeit zum allgemeinen Lernen ermöglichte es ihm, verschiedene Aufgaben auszuführen, indem es das nächste Element in einer Sequenz genau vorhersagte, obwohl es bei längeren Passagen repetitiv oder unsinnig werden konnte. GPT-2 wurde durch spätere Modelle wie GPT-3 und GPT-4 abgelöst, die nicht mehr Open Source sind.
Training und Architektur
Das Training von GPT-2 nutzte die Fähigkeit der Transformer-Architektur zur massiven Parallelisierung, was es ermöglichte, auf größeren Korpora zu trainieren als frühere Modelle der Verarbeitung natürlicher Sprache. OpenAI erwog zunächst CommonCrawl, einen großen, durch Web-Crawling erstellten Korpus, lehnte ihn jedoch aufgrund unverständlicher Inhalte ab. Stattdessen entwickelten sie einen neuen Korpus namens WebText, der durch das Scraping von Seiten erstellt wurde, die in Reddit-Beiträgen mit mindestens 3 Karma vor Dezember 2017 verlinkt waren. Der Korpus wurde bereinigt, indem HTML in Klartext geparst, Duplikate entfernt und Wikipedia-Seiten ausgeschlossen wurden, um Überanpassung zu vermeiden.
Die Trainingskosten von GPT-2 werden auf etwa 43.000 US-Dollar geschätzt, basierend auf einer Aussage von Andrej Karpathy, unter Verwendung von 32 TPU-v3-Chips für 168 Stunden bei etwa 8 US-Dollar pro Chip und Stunde. Andere Quellen nennen Kosten von etwa 256 US-Dollar pro Stunde. Zum Vergleich: Das Training von BERT und XLNet kostete 6.912 bzw. 245.000 US-Dollar. Die Architektur von GPT-2 ist ein tiefes neuronales Netz mit einem generativen vortrainierten Transformer, der Aufmerksamkeit anstelle von Rekurrenz oder Faltung implementiert.
Veröffentlichung und anfängliche Einschränkungen
GPT-2 wurde am 14. Februar 2019 angekündigt. Im Gegensatz zu früheren OpenAI-Modellen wurde der Quellcode nicht sofort veröffentlicht, wobei auf Risiken böswilliger Nutzung verwiesen wurde. Ausgewählten Presseorganen wurde begrenzter Zugang gewährt, und OpenAI demonstrierte eine Version, die zur Generierung von Produktbewertungen feinabgestimmt war und zur Umgehung von Spam-Filtern verwendet werden konnte. Forscher wie Jeremy Howard warnten vor dem Potenzial, das Web mit überzeugender Prosa zu füllen, während das Allen Institute for Artificial Intelligence ein Erkennungswerkzeug für "neuronale Fake News" ankündigte.
Die Meinungen über die Bedrohung waren geteilt. Einige, wie Anima Anandkumar, nannten die Einschränkungen "böswilligen Unsinn", während The Gradient einen offenen Brief veröffentlichte, der die Technologie mit der Druckerpresse und Photoshop verglich. Trotz der Kontroverse veröffentlichte OpenAI am 20. August 2019 eine Teilversion mit 774 Millionen Parametern und am 5. November 2019 das vollständige Modell mit 1,5 Milliarden Parametern.
Modellvarianten und Replikationen
Die GPT-2-Serie umfasste vier Modelle unterschiedlicher Größe, die in Stufen veröffentlicht wurden. Das kleinste Modell wurde im Februar 2019 verfügbar gemacht, gefolgt von größeren Modellen. Das vollständige Modell mit 1,5 Milliarden Parametern war die letzte Veröffentlichung. Die Methoden des Modells wurden in Publikationen beschrieben, was es anderen ermöglichte, es als freie Software zu replizieren. Eine solche Replikation, OpenGPT-2, wurde im August 2019 mit einer frei lizenzierten Version von WebText namens OpenWebText veröffentlicht, bei Rechenkosten von etwa 50.000 US-Dollar.
Auswirkungen und Vermächtnis
Die Veröffentlichung von GPT-2 markierte einen bedeutenden Meilenstein in der generativen KI und demonstrierte das Potenzial von groß angelegten Transformatoren. Seine Fähigkeit, kohärenten Text zu erzeugen, wurde von Medien wie The Verge und The Guardian gelobt, obwohl festgestellt wurde, dass lange Passagen repetitiv werden konnten. Die anfängliche Zurückhaltung des Modells löste Debatten über offenen Zugang und Sicherheit in der KI-Forschung aus und beeinflusste zukünftige Diskussionen über verantwortungsvolle KI-Entwicklung. GPT-2 wurde von GPT-3 und GPT-4 abgelöst, die das Feld weiter vorantrieben, sich jedoch von der Open-Source-Verfügbarkeit entfernten.