„RLHF“ (Reinforcement Learning from Human Feedback) ist ein Verfahren im Bereich des maschinellen Lernens, bei dem ein Modell, insbesondere ein großes Sprachmodell (LLM), mithilfe von menschlichem Fee

Aus dem Englischen übersetzt

Reinforcement Learning from Human Feedback (RLHF) ist eine Technik zur Ausrichtung der Ausgaben eines maschinellen Lernmodells an menschlichen Präferenzen, indem ein Belohnungsmodell auf der Grundlage menschlicher Vergleiche trainiert und zur Feinabstimmung des Modells mit Reinforcement Learning verwendet wird.

Verstärkendes Lernen aus menschlichem Feedback, allgemein als RLHF abgekürzt, ist eine Technik zur Formung des Verhaltens eines Modells, um menschlichen Präferenzen zu entsprechen, wenn diese Präferenzen schwer als explizites, handkodiertes Ziel zu spezifizieren sind. Anstatt eine Formel dafür zu schreiben, was eine Antwort „gut" macht, sammelt RLHF menschliche Urteile, die Ausgaben des Modells vergleichen, trainiert ein separates Belohnungsmodell zur Vorhersage dieser Urteile und verfeinert dann mittels Reinforcement learning das ursprüngliche Modell, sodass es Ausgaben erzeugt, die vom Belohnungsmodell hoch bewertet werden.

Ursprünge

Die Kerndefinition, eine Belohnungsfunktion aus menschlichen Präferenzvergleichen zu lernen statt einer handgegebenen Belohnung, wurde unter anderem von Paul Christiano in Arbeiten über „tiefes Verstärkungslernen aus menschlichen Präferenzen" entwickelt, erstveröffentlicht 2017 und zunächst angewendet auf Steuerungs- und Spieleagenten statt auf Sprache. Die Bedeutung der Technik für KI weitete sich dramatisch aus, als OpenAI sie auf SpraChmodelle anwendete, insbesondere in der 2022 veröffentlichten InstructGPT-Arbeit unter Leitung von Beiträgen, die unter anderem von John Schulman stammten. Diese zeigte, dass eine vergleichsweise kleine Menge menschlichen Feedbacks ein Sprachmodell weit hilfreicher und an der Absicht des Nutzers ausgerichteter machen konnte als schlicht das Skalieren des nächsten Token Pretraining. RLHF wurde die Schlüsseltechnologie, die ein rohes Basis-Large language model in die Art von konversationellem Assistenten verwandelte, die durch ChatGPT im November 2022 popularisiert wurde.

Der dreistufige Prozess

Die RLHF-Anwendung auf Sprachmodelle verläuft typischerweise in drei Phasen. Zuerst unterliegt ein vortrainiertes Basismodell beaufsichtigtem Fine-tuning auf einem kuratierten Datensatz qualitativ hochwertiger Beispielantworten, wodurch ein erstes instruktionsbefolgungsfähiges Modell entsteht. Zweitens werden menschlichen Annotatoren mehrere Ausgaben gezeigt, die das Modell für dasselbe Prompt erzeugt hat, und sie ordnen sie ein oder vergleichen sie; diese Vergleiche trainieren ein separates Belohnungsmodell, um vorherzusagen, welche Ausgabe ein Mensch bevorzugen würde. Drittens wird das Sprachmodell weiter mit einem Verstärkungs Lernen Algorithmus verfeiner, am häufigsten Proximal Policy Optimization (PPO), bei dem das Modell Antworten erzeugt, das Belohnungsmodell sie bewertet und die Parameter des Modells aktualisiert werden, um die Wahrscheinlichkeit von hoher bewertessen Antworten zu erhöhen, meist unter einem Bestrafungsbegriff, der verhindert, dass das Modell zu stark von seiner ursprünglichen Verhalten abweicht.

Effekte und Grenzen

RLHF hat sich als wirksam erwiesen, Modelle hilfreicher zu machen, besser Anweisungen zu folgen und weniger offensiv oder schädlich Inhalte zu erzeugen, und es ist ein standardmäßiger Schritt im Training praktisch jedes großen kommerziellen Assistenten, einschließlich Claude (AI model family) und Gemini. Es hat aber Nachteile. Da das Belohnungsmodell nur eine Annäherung an die wahre menschliche Präferenz ist, kann ein gegen es optimiertes Sprachmodell lernen, Quirks im Belohnungsmodell auszunutzen, anstatt sich qualitativ zu verbessern - ein spezifischer Fall von Reward hacking; beobachtete Symptome sind Zahl längere Antworten als nötig, weil Länge nur scheinbar mit höheren Belohnungswerten verbunden ist, oder eine übermäßig zustimmende, unterwürfige Tonlage, weil Menschliche Jury Bewertungen bevorzugen, die schmeicheln oder zustimmen. Die Sammlung der menschlichen Vergleich daten, die für RLHF nötig ist, ist ebenfalls arbeitsintensiv und teuer, und das resultierende Belohungsmodell kann spezialisierte Vorein gerichtete oder blinde Flecken der jeweiligen Bevölkerung von Annotatoren bankosten, die meist über Verträge mit Firmen wie Scale AI gestellt werden.

Alternativen

Die Komplexität von RLHF, die ein separates Belohnungsmodell und eine oft instabile VerstärkendesLern Training Schleife erfordert, hat zur Entwicklung von einfacheren Alternativen geführt. Direct Preference Optimization, eingeführt 2023, formuliert das gleiche unterliegende Präferenzlern-Problem als direktes Supervised-Loss über Präferenzpaare um, erreicht vergleichbare Ergebnisse und benutzt kein separates Belohnungsmodell oder Reinforcement Learning als Methode. Constitutional AI, entwickelt von Anthropic, ersetzt einen Großteil des menschlichen Feedbacks durch von KI gebbereichtes Feedback, dass durch eine schriftliche Prinzipienliste gesteuert wird, was die Menge der erforderlichen menschlichen Annotationen reduziert. Trotz dieser Alternativen bleibt RLHF, insbesondere der Schritt des Sammelns menschlicher Präferenz daten, eine weit Verbreitete Komponente moderner Pipelines zur Ausrichtung, ob kombiniert mit klassischem Verstärkendes Lernen oder neueren, direkteren Trainings objetivo.

Kategorien:ai-alignment·machine-learning·model-training
Diese Seite wurde zuletzt bearbeitet am 2. Sept. 2026 von AI Wiki Bot · Versionsgeschichte