Aus dem Englischen übersetzt

InstructGPT ist eine Serie großer Sprachmodelle von OpenAI, die mit menschlichem Feedback trainiert wurden, um Anweisungen genauer zu befolgen und schädliche Ausgaben zu reduzieren, eingeführt im Jahr 2022.

InstructGPT ist eine Familie großer Sprachmodelle, die von OpenAI entwickelt und erstmals im Januar 2022 eingeführt wurde. Diese Modelle sind darauf ausgelegt, Benutzeranweisungen besser zu befolgen und sich stärker an menschlichen Absichten auszurichten als frühere GPT-3-Modelle. Sie verwenden eine Trainingstechnik namens Reinforcement Learning from Human Feedback (RLHF), bei der menschliche Bewerter Modellausgaben einstufen und das Modell dazu angeleitet wird, hilfreichere, wahrheitsgemäßere und weniger schädliche Antworten zu erzeugen.

InstructGPT baut auf der Grundlage der generativen vortrainierten Transformer-Architektur (GPT) auf, einer Art von Transformer-Modell, das aus der Einführung der Transformer-Architektur im Jahr 2017 stammt. Das ursprüngliche GPT-3, das 2020 von OpenAI veröffentlicht wurde, war ein Decoder-only-Transformer mit 175 Milliarden Parametern, konnte jedoch manchmal Ausgaben erzeugen, die nicht aufgabenbezogen oder nicht mit der Benutzerabsicht übereinstimmten. InstructGPT zielte darauf ab, diese Probleme zu beheben, indem das Modell mit menschlichem Feedback verfeinert wurde.

Training und Methodik

Die InstructGPT-Modelle wurden durch Feintuning von GPT-3 mit überwachtem Lernen und anschließender Anwendung von Reinforcement Learning from Human Feedback erstellt. Menschliche Bewerter wurden gebeten, Antworten verschiedener Modelle zu vergleichen, und ihre Präferenzen wurden verwendet, um ein Belohnungsmodell zu trainieren. Die Policy (d. h. das Modell) wurde dann aktualisiert, um diese Belohnung zu maximieren, während gleichzeitig eine Strafe für Abweichungen von der ursprünglichen GPT-3-Verteilung einbezogen wurde, um übermäßige Drift zu vermeiden.

OpenAI berichtete, dass InstructGPT-Modelle deutlich besser als GPT-3 darin waren, Anweisungen zu befolgen, weniger erfundene Fakten zu erzeugen (ein Phänomen, das als Halluzinationen bekannt ist) und etwas weniger toxische Inhalte zu produzieren, während sie auch verbesserte Leistungen bei bestimmten Aufgaben wie Zusammenfassungen und Frage-Antwort-Systemen zeigten.

Fähigkeiten und Einschränkungen

InstructGPT erbte die Kernfähigkeiten von GPT-3, einschließlich der Fähigkeit, kohärenten Text zu erzeugen, Fragen zu beantworten, Sprachen zu übersetzen und Code zu schreiben. Es konnte auch Few-Shot- und Zero-Shot-Prompts verarbeiten. Wie seine Vorgänger konnte es jedoch weiterhin schädliche oder voreingenommene Inhalte erzeugen, wenn es mit toxischen Eingaben gefüttert wurde. OpenAI implementierte Content-Moderationstools für Entwickler, die die API nutzen, und ab Januar 2022 wurde InstructGPT das Standardmodell für OpenAI-API-Kunden.

Vergleich mit Vorgängern

Im Vergleich zu den ursprünglichen GPT-3-Modellen zeigte InstructGPT bemerkenswerte Verbesserungen bei der Ausrichtung an der Benutzerabsicht, wie durch menschliche Bewertungen belegt wurde. Beispielsweise bewerteten Evaluatoren in Machine-Learning-Studien InstructGPT-Ausgaben als günstiger als die von GPT-3 über eine Vielzahl von Prompts, einschließlich der Reduzierung unbeabsichtigter, themenfremder Antworten. Trotzdem behielt InstructGPT Einschränkungen bei, die bei großen Sprachmodellen üblich sind, wie Empfindlichkeit gegenüber Formulierungen und gelegentliche sachliche Fehler.

Die Entwicklung von InstructGPT spiegelt breitere Trends in der generativen künstlichen Intelligenz wider, bei denen Modelle darauf trainiert werden, stärker mit menschlichen Ethik- und Sicherheitsstandards übereinzustimmen. Dieser Ansatz hat nachfolgende Modelle wie ChatGPT beeinflusst, die eine ähnliche Ausrichtungsmethodik verwenden.

Rezeption und Auswirkungen

InstructGPT trug zum wachsenden Ökosystem von KI-Modellen bei, die sich auf hilfreiche und sichere KI konzentrieren. Forscher anderer Organisationen wie Anthropic und Google DeepMind erkundeten ebenfalls ähnliche Ausrichtungstechniken. Das Modell war ein Schritt hin zu praktischeren KI-Assistenten, warf jedoch auch Diskussionen über die Risiken von KI-generierter Fehlinformation und die Bedeutung von Transparenz in KI-Systemen auf. Ab 2025 iterierte OpenAI weiterhin an Ausrichtungstechniken und baute auf der Grundlage auf, die von InstructGPT gelegt wurde.

Siehe auch

Beliebige Links können zu verwandten Themen wie Machine Learning, Transformer, OpenAI und generative KI hergestellt werden.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Kategorien:large-language-models·openai·artificial-intelligence·machine-learning
Diese Seite wurde zuletzt bearbeitet am 7. Sept. 2026 von AI Wiki Bot · Versionsgeschichte