GPT-3, kurz für Generative Pre-trained Transformer 3, ist ein großes Sprachmodell, das 2020 von OpenAI als Teil der GPT-Serie des Unternehmens veröffentlicht wurde. Es ist ein reines Decoder-Transformer-Modell, das einen Aufmerksamkeitsmechanismus nutzt, um sich auf relevante Teile des Eingabetextes zu konzentrieren, und damit rekurrente und faltungsbasierte Architekturen ablöst. Mit 175 Milliarden Parametern war GPT-3 zum Zeitpunkt seiner Veröffentlichung das größte nicht-sparse Sprachmodell und benötigte aufgrund der 16-Bit-Präzision pro Parameter 350 GB Speicherplatz. Es verfügt über ein Kontextfenster von 2.048 Token und zeigte starke Zero-Shot- und Few-Shot-Lernfähigkeiten bei vielen Aufgaben.
Die Veröffentlichung von GPT-3 markierte einen Meilenstein in der generativen KI und zeigte das Potenzial der Skalierung transformerbasierter neuronaler Netze. Seine Fähigkeiten beeinflussten nachfolgende Entwicklungen bei großen Sprachmodellen und lösten Diskussionen über die Vorteile und Risiken solcher Systeme aus.
Hintergrund
Die Entwicklung von GPT-3 basierte auf Fortschritten im maschinellen Lernen in den 2010er Jahren, die durch verbesserte Algorithmen, leistungsfähigere Computer und zunehmend digitalisierte Daten vorangetrieben wurden. Die 2017 eingeführte Transformer-Architektur wurde zu einer wichtigen Grundlage für die Verarbeitung natürlicher Sprache. Der erste generative vortrainierte Transformer von OpenAI (GPT-1) wurde im Juni 2018 eingeführt, gefolgt von GPT-2 im Februar 2019, das die Parameter- und Datensatzgröße um den Faktor 10 skalierte und 1,5 Milliarden Parameter erreichte. Im Februar 2020 führte Microsoft Turing Natural Language Generation (T-NLG) mit 17 Milliarden Parametern ein, das damals das größte Sprachmodell war.
Training und Fähigkeiten
Am 28. Mai 2020 beschrieb ein arXiv-Preprint von 31 OpenAI-Forschern GPT-3, das die Kapazität im Vergleich zu GPT-2 um mehr als zwei Größenordnungen erhöhte. Der Trainingsdatensatz bestand zu 60 % aus gefiltertem Common Crawl (410 Milliarden Token), zu 22 % aus WebText2, zu 8 % aus Books1, zu 8 % aus Books2 und zu 3 % aus Wikipedia. GPT-3 wurde mit Hunderten von Milliarden Wörtern trainiert und konnte auch in Sprachen wie CSS, JSX und Python programmieren. Lambda Labs schätzte die Trainingskosten auf etwa 4,6 Millionen US-Dollar und 355 Jahre auf einer einzelnen GPU, obwohl Parallelisierung die tatsächliche Zeit reduzierte.
Die allumfassenden Trainingsdaten von GPT-3 bedeuteten, dass es für verschiedene Aufgaben kein Feintuning benötigte, aber es konnte aufgrund von Verzerrungen in den Daten toxische Sprache erzeugen. Eine Studie der University of Washington fand heraus, dass seine Toxizität mit der von GPT-2 und CTRL vergleichbar war. OpenAI implementierte Schutzmaßnahmen, und bis November 2021 wurde der Zugang zur API uneingeschränkt. Im Januar 2022 wurden InstructGPT-Modelle zum Standard, die besser auf die Absichten der Nutzer abgestimmt waren und weniger toxische Inhalte erzeugten.
Auswirkungen und Rezeption
Die Fähigkeit von GPT-3, kohärenten Text zu erzeugen, den Menschen nicht leicht von menschlich verfassten Inhalten unterscheiden konnten, weckte sowohl Chancen als auch Bedenken. In einem Experiment beurteilten 80 US-Probanden kurze Artikel nur in 52 % der Fälle korrekt, nahe am Zufall. Das Potenzial des Modells für Fehlinformationen, Spam und Phishing wurde im ursprünglichen Papier erwähnt. GPT-3 beeinflusste auch das breitere Feld der künstlichen Intelligenz und führte zu weiterer Forschung an großen Sprachmodellen und generativer KI.
Kommerzialisierung und Lizenzierung
Am 22. September 2020 kündigte Microsoft eine exklusive Lizenz für GPT-3 an, die Zugang zum zugrunde liegenden Modell gewährte, während andere weiterhin die öffentliche API nutzen konnten. Dieser Deal hob den kommerziellen Wert fortschrittlicher KI-Modelle hervor und setzte einen Präzedenzfall für zukünftige Partnerschaften in der Branche. Die Lizenzvereinbarung war Teil der breiteren Investition von Microsoft in OpenAI und deren Integration in Produkte wie Azure.
Vermächtnis
Die Veröffentlichung von GPT-3 beschleunigte den Fortschritt in der Verarbeitung natürlicher Sprache und inspirierte nachfolgende Modelle verschiedener Organisationen, darunter Anthropic und Google DeepMind. Seine Architektur und sein Trainingsansatz wurden zu Maßstäben für spätere Entwicklungen wie InstructGPT und andere Nachfolger. Das Modell regte auch Diskussionen über KI-Ethik, Sicherheit und die Notwendigkeit von Inhaltsmoderation an und prägte die Entwicklung von maschinellem Lernen in Forschung und Einsatz.