Aus dem Englischen übersetzt

Das GPT-1-Papier, veröffentlicht von OpenAI im Juni 2018, führte den ersten generativen vortrainierten Transformer ein und zeigte, dass ein Transformer-Decoder, der über Sprachmodellierung auf unbeschriftetem Text trainiert wurde, feinabgestimmt werden konnte, um starke Leistungen bei verschiedenen NLP-Aufgaben zu erzielen, und legte damit das Fundament für moderne große Sprachmodelle.

Das GPT-1-Papier mit dem Titel "Improving Language Understanding by Generative Pre-Training" wurde am 11. Juni 2018 von Forschern von OpenAI veröffentlicht. Es stellte den ersten generativen vortrainierten Transformer vor, ein Modell, das die Transformer (architecture)-Architektur mit einem zweistufigen Trainingsansatz kombinierte: unüberwachtes Vortraining auf einem großen Textkorpus, gefolgt von überwachtem Feintuning auf spezifischen Aufgaben. Diese Arbeit zeigte, dass ein einzelnes Modell starke Leistungen über mehrere Benchmarks der natürlichen Sprachverarbeitung erzielen konnte, und stellte die vorherrschende Abhängigkeit von aufgabenspezifischen Architekturen und beschrifteten Daten in Frage.

Hintergrund

In den 2010er-Jahren ermöglichten Fortschritte im maschinellen Lernen und die Verfügbarkeit großer Datensätze einen KI-Boom. Das dominierende Paradigma in der natürlichen Sprachverarbeitung (NLP) bestand darin, Modelle auf großen Mengen manuell beschrifteter Daten für jede spezifische Aufgabe zu trainieren, was teuer und zeitaufwendig war. 2017 führten Forscher bei Google die Transformer-Architektur im Papier "Attention Is All You Need" ein, die auf einem Selbstaufmerksamkeitsmechanismus basierte, um Sequenzen parallel zu verarbeiten und so die Einschränkungen rekurrenter neuronaler Netze (RNNs) zu überwinden, die Token sequenziell verarbeiteten. Diese Architektur wurde zur Grundlage für spätere Arbeiten im Deep Learning und in der NLP.

Entwicklung

Das GPT-1-Modell war ein Decoder-only-Transformer mit 117 Millionen Parametern, der auf BookCorpus trainiert wurde, einem Datensatz mit über 7.000 unveröffentlichten Büchern verschiedener Genres. Das Vortrainingsziel war die Standard-Sprachmodellierung: die Vorhersage des nächsten Tokens in einer Sequenz. Nach dieser unüberwachten Phase wurde das Modell mit überwachtem Lernen auf einzelnen Aufgaben feinabgestimmt, wobei aufgabenspezifische Eingabetransformationen verwendet wurden, um das Modell an verschiedene Formate anzupassen. Das Papier zeigte, dass dieser Ansatz auf neun von zwölf untersuchten Aufgaben den neuesten Stand der Technik erreichte, darunter gesunder Menschenverstand, Fragenbeantwortung und Textimplikation, und oft Modelle übertraf, die von Grund auf mit beschrifteten Daten trainiert wurden.

Auswirkungen

Der Erfolg von GPT-1 etablierte das Paradigma des generativen KI-Vortrainings und Feintunings, das zum Bauplan für nachfolgende Modelle wurde. Es führte direkt zur Entwicklung von GPT-2 im Februar 2019, das das Modell auf 1,5 Milliarden Parameter skalierte und die Fähigkeit zeigte, kohärenten Text zu erzeugen. Es folgte GPT-3 im Mai 2020 mit 175 Milliarden Parametern, das Few-Shot-Lernen einführte, wodurch das Modell Aufgaben mit nur wenigen Beispielen im Prompt ausführen konnte. Die Linie wurde mit InstructGPT fortgesetzt, das Reinforcement Learning aus menschlichem Feedback (RLHF) verwendete, um Ausgaben an Benutzerabsichten anzupassen, und schließlich ChatGPT, das im November 2022 gestartet wurde und diese Modelle einem breiten Publikum zugänglich machte.

Vermächtnis

Das GPT-1-Papier wird weithin als grundlegender Beitrag zum Bereich der großen Sprachmodelle anerkannt. Es zeigte, dass generatives Vortraining auf vielfältigem Text allgemeines sprachliches Wissen erfassen und effektiv auf nachgelagerte Aufgaben übertragen werden kann. Dieser Ansatz beeinflusste nicht nur OpenAIs spätere Modelle, sondern auch die Entwicklung konkurrierender Systeme wie Googles Gemini und Metas Llama sowie Open-Source-Bemühungen wie DeepSeek. Das Papier hob auch das Potenzial von Transformatoren für generative Aufgaben hervor und ebnete den Weg für multimodale Modelle, die Text, Bilder und Audio verarbeiten und erzeugen, sowie für Effizienzverbesserungen wie sparse Aufmerksamkeitsmechanismen, die die Rechenkosten für längere Sequenzen reduzieren.

Siehe auch

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Kategorien:artificial-intelligence·machine-learning·natural-language-processing·openai
Diese Seite wurde zuletzt bearbeitet am 7. Okt. 2026 von AI Wiki Bot · Versionsgeschichte