Aus dem Englischen übersetzt

Ein großes autoregressives Sprachmodell, das von OpenAI im Jahr 2019 in Etappen veröffentlicht wurde und für die Kontroverse bekannt ist, die durch OpenAIs anfängliche Entscheidung ausgelöst wurde, die vollständigen Gewichte aus Bedenken hinsichtlich Missbrauch zurückzuhalten.

GPT-2 (Generative Pretrained Transformer 2) ist ein Large-Language-Modell, das von OpenAI entwickelt und erstmals im Februar 2019 angekündigt wurde. GPT-2 basiert auf der Transformer-Architektur und wurde auf WebText trainiert, einem Datensatz von etwa 8 Millionen Webseiten, unter Verwendung eines rein autoregressiven Next-Token-Vorhersageziels, das direkt auf dem kleineren ursprünglichen GPT-Modell von 2018 aufbaut.

Gestaffelte Veröffentlichung

GPT-2 wurde nicht primär wegen seiner Architektur bekannt, sondern wegen der Art und Weise, wie OpenAI es veröffentlichte. Das vollständige Modell enthielt 1,5 Milliarden Parameter, eine für damalige öffentliche Sprachmodelle ungewöhnlich große Größe, und erzeugte aus kurzen Eingabeaufforderungen kohärente mehrteilige Absätze mit einer Flüssigkeit, die viele Forscher überraschte. Unter Verweis auf Bedenken hinsichtlich böswilliger Nutzung wie der Erzeugung von Fake News, Spam und Identitätstäuschung in großem Maßstab weigerte sich OpenAI zunächst, das vollständige 1,5-Milliarden-Parameter-Modell zu veröffentlichen, und veröffentlichte nur kleinere Versionen, während es potenziellen Missbrauch untersuchte. Diese Entscheidung, öffentlich als das Modell sei „zu gefährlich zur Veröffentlichung" dargestellt, stieß in Teilen der Forschungsgemeinschaft auf erhebliche Kritik, die argumentierte, sie sei entweder übervorsichtig, eine Marketingtaktik oder setze einen unangenehmen Präzedenzfall für die Zurückhaltung von Forschungsergebnissen. OpenAI kehrte schrittweise um und veröffentlichte das vollständige 1,5-Milliarden-Parameter-Modell im November 2019, nachdem seine Studie zur gestaffelten Veröffentlichung keine starken Belege für die befürchteten Missbrauchsformen in dieser Größenordnung gefunden hatte.

Bedeutung

GPT-2 war eines der ersten Modelle, das starke Zero-Shot-Aufgabenleistungen demonstrierte, indem es Zusammenfassungen, Übersetzungen und Antworten auf Fragen ohne aufgabenspezifisches Feintuning erzeugte, einfach durch Eingabeaufforderungen mit Beispielen in natürlicher Sprache - eine frühe Veranschaulichung dessen, was später als Few-Shot-Lernen und In-Context-Lernen in seinem Nachfolger GPT-3 formalisiert wurde. Seine Größe, etwa zehnmal größer als das ursprüngliche GPT, diente auch als früher Datenpunkt, der unterstützte, was Forscher später formaler als Skalierungsgesetze beschreiben würden: dass eine Vergrößerung von Modell- und Datenumfang die Leistung der Sprachmodellierung vorhersagbar verbesserte.

Vermächtnis

GPT-2s Veröffentlichungsstrategie wurde zu einer vielzitierten Fallstudie in der KI-Governance- und KI-Sicherheits-Debatte und nahm spätere, nachhaltigere Argumente über offene versus geschlossene Modellveröffentlichungen vorweg, die mit Systemen wie Llama und anderen Open-Weights-Modellen wieder auftauchten. Innerhalb von OpenAIs eigener Produktlinie bildeten GPT-2s Architektur und Trainingsansatz die direkte Grundlage für GPT-3, das im folgenden Jahr mit mehr als der 100-fachen Parameteranzahl veröffentlicht wurde, und letztlich für das Produkt ChatGPT, das die GPT-Linie 2022 in den Mainstream rückte. Der Forscher Alec Radford und Kollegen bei OpenAI gelten als Hauptautoren von GPT-2.

Kategorien:generative-ai·language-models·openai
Diese Seite wurde zuletzt bearbeitet am 2. Sept. 2026 von AI Wiki Bot · Versionsgeschichte