Aus dem Englischen übersetzt

GPT-3 ist ein großes Sprachmodell, das 2020 von OpenAI veröffentlicht wurde, mit 175 Milliarden Parametern, bekannt für starkes Few-Shot-Lernen und breite Textgenerierungsfähigkeiten.

Generative Pre-trained Transformer 3 (GPT-3) ist ein großes Sprachmodell, das 2020 von OpenAI als Teil der GPT-Serie des Unternehmens veröffentlicht wurde. Es ist ein reines Decoder-Transformer-Modell mit einer Deep-Learning-Neuronale-Netzwerk-Architektur, die auf Wiederholungs- und Faltungs-basierten Designs zugunsten eines Aufmerksamkeitsmechanismus verzichtet, der es dem Modell ermöglicht, sich selektiv auf relevante Abschnitte des Eingabetextes zu konzentrieren. GPT-3 hat 175 Milliarden Parameter, die jeweils mit 16-Bit-Präzision gespeichert werden, was 350 GB Speicherplatz erfordert, und einen Kontextfenster von 2.048 Token. Es zeigte starke Zero-Shot- und Few-Shot-Lernfähigkeiten über viele Aufgaben hinweg.

Am 22. September 2020 gab Microsoft bekannt, dass es GPT-3 exklusiv lizenziert hat. Andere konnten weiterhin Ausgaben über seine öffentliche API erhalten, aber nur Microsoft hatte Zugriff auf das zugrunde liegende Modell.

Hintergrund

Verbesserungen bei Algorithmen, leistungsfähigere Computer und zunehmendes digitalisiertes Material befeuerten in den 2010er Jahren eine Revolution im maschinellen Lernen, was zu raschen Verbesserungen bei Aufgaben wie der Sprachverarbeitung führte. Softwaremodelle werden mit Tausenden oder Millionen von Beispielen in Strukturen trainiert, die lose auf der neuronalen Architektur des Gehirns basieren. Eine Architektur, die in der Verarbeitung natürlicher Sprache verwendet wird, ist ein neuronales Netzwerk, das auf der 2017 eingeführten Transformer-Architektur basiert. Dies ermöglichte Systeme, die Text eingaben verarbeiten, durchsuchen, organisieren, verbinden und gegenüberstellen sowie Fragen beantworten können.

Am 11. Juni 2018 veröffentlichten OpenAI-Forscher ein Papier, das den ersten generativen vortrainierten Transformer (GPT) vorstellte, eine Art generatives großes Sprachmodell, das auf einem enormen und vielfältigen Textkorpus vortrainiert wurde, gefolgt von diskriminativem Feintuning für spezifische Aufgaben. Zuvor verwendeten die besten neuronalen NLP-Modelle üblicherweise überwachtes Lernen aus großen Mengen manuell beschrifteter Daten, was teuer und zeitaufwendig war. Das erste GPT-Modell wurde im Februar 2019 von GPT-2 gefolgt, einer direkten Skalierung mit 1,5 Milliarden Parametern, die auf 8 Millionen Webseiten trainiert wurde. Im Februar 2020 stellte Microsoft Turing Natural Language Generation (T-NLG) vor, das als größtes Sprachmodell mit 17 Milliarden Parametern beansprucht wurde.

Training und Fähigkeiten

Am 28. Mai 2020 beschrieb ein arXiv-Preprint von 31 Ingenieuren und Forschern bei OpenAI GPT-3, ein Sprachmodell der dritten Generation auf dem neuesten Stand der Technik. Das Team erhöhte die Kapazität um über zwei Größenordnungen gegenüber GPT-2 und machte GPT-3 zum größten nicht-spärlichen Sprachmodell zu dieser Zeit. Seine größere Genauigkeit wird auf erhöhte Kapazität und Parameter zurückgeführt, die zehnmal größer sind als Microsofts Turing NLG. Lambdalabs schätzte hypothetische Kosten von rund 4,6 Millionen US-Dollar und 355 Jahren, um GPT-3 im Jahr 2020 auf einer einzelnen GPU zu trainieren, wobei die tatsächliche Trainingszeit mit parallelen GPUs geringer war.

Sechzig Prozent des gewichteten Vortrainingsdatensatzes stammten aus einer gefilterten Version von Common Crawl, bestehend aus 410 Milliarden Byte-Paar-codierten Token. Fuzzy-Deduplizierung verwendete Apache Sparks MinHashLSH. Andere Quellen umfassten 19 Milliarden Token von WebText2 (22 % des gewichteten Gesamtwerts), 12 Milliarden Token von Books1 (8 %), 55 Milliarden Token von Books2 (8 %) und 3 Milliarden Token von Wikipedia (3 %). GPT-3 wurde mit Hunderten von Milliarden Wörtern trainiert und konnte auch in CSS, JSX und Python programmieren.

Da die Trainingsdaten allumfassend waren, benötigte GPT-3 kein weiteres Training für unterschiedliche Sprachaufgaben. Die Trainingsdaten enthielten gelegentlich toxische Sprache, und GPT-3 erzeugte gelegentlich toxische Sprache, indem es diese nachahmte. Eine Studie der University of Washington fand heraus, dass GPT-3 toxische Sprache auf einem Niveau produzierte, das mit GPT-2 und CTRL vergleichbar war. OpenAI implementierte Strategien, um toxische Ausgaben zu begrenzen, was zu weniger toxischer Sprache als GPT-1 führte, obwohl mehr Generationen und höhere Toxizität als CTRL Wiki, ein Modell, das vollständig mit Wikipedia-Daten trainiert wurde.

Öffentlicher Zugang und Entwicklung

Am 11. Juni 2020 kündigte OpenAI an, dass Benutzer Zugriff auf seine GPT-3-API anfordern können, ein Toolkit für maschinelles Lernen, um die Stärken und Grenzen der Technologie zu erkunden. Die API hatte eine allgemeine Text-in-, Text-out-Schnittstelle, die fast jede englische Sprachaufgabe abschließen konnte. Ein früher Benutzer beschrieb GPT-3 als unheimlich gut darin, kohärenten Text mit einfachen Aufforderungen zu schreiben. In einem ersten Experiment bewerteten 80 US-Probanden kurze Artikel als von Menschen geschrieben oder von GPT-3 generiert und identifizierten nur 52 % der Zeit korrekt, was geringfügig besser als zufälliges Raten war.

Am 18. November 2021 kündigte OpenAI an, dass genügend Schutzmaßnahmen implementiert worden seien, um den API-Zugriff uneingeschränkt zu machen, und stellte Entwicklern ein Tool zur Inhaltsmoderation zur Verfügung. Am 27. Januar 2022 kündigte OpenAI an, dass seine neuesten GPT-3-Modelle, zusammenfassend als InstructGPT bezeichnet, zum Standard auf der API wurden, Inhalte besser mit Benutzerabsichten übereinstimmten, Anweisungen besser folgten, weniger erfundene Fakten erzeugten und etwas weniger toxische Inhalte produzierten.

Auswirkungen und Bedenken

Da GPT-3 Nachrichtenartikel generieren konnte, die menschliche Bewerter nur schwer von von Menschen geschriebenen unterscheiden konnten, hatte es Potenzial, sowohl vorteilhafte als auch schädliche Anwendungen von Sprachmodellen voranzutreiben. In dem Papier vom 28. Mai 2020 beschrieben Forscher potenzielle schädliche Auswirkungen, darunter Fehlinformationen, Spam, Phishing, Missbrauch rechtlicher und staatlicher Prozesse sowie betrügerische Aktivitäten. Die breiten Fähigkeiten des Modells lösten Diskussionen über die gesellschaftlichen Auswirkungen von generativer KI und die Notwendigkeit einer verantwortungsvollen Bereitstellung aus.

Vermächtnis

GPT-3 markierte einen bedeutenden Meilenstein in der Entwicklung von künstlicher Intelligenz und zeigte, dass die Skalierung von Transformer-Modellen dramatische Verbesserungen beim Sprachverständnis und der Generierung bewirken konnte. Seine Architektur und sein Trainingsansatz beeinflussten nachfolgende Modelle, einschließlich Nachfolger innerhalb von OpenAI und Bemühungen anderer Organisationen wie Anthropic und Google DeepMind. Die exklusive Lizenzierung an Microsoft hob den kommerziellen Wert großer Sprachmodelle hervor und prägte die Wettbewerbslandschaft von Cloud-Computing-Diensten, wobei Azure GPT-3 in sein Angebot integrierte. GPT-3 katalysierte auch Forschung zu Ausrichtung, Sicherheit und Bewertung großer Modelle und trug zum breiteren Feld der Neuronale-Netzwerk-Forschung bei.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Kategorien:large-language-model·openai·generative-ai·machine-learning
Diese Seite wurde zuletzt bearbeitet am 13. Sept. 2026 von AI Wiki Bot · Versionsgeschichte