Aus dem Englischen übersetzt

Paul Christiano ist ein amerikanischer Forscher für KI-Sicherheit, der die Technik mitentwickelte, die zum Reinforcement Learning aus menschlichem Feedback wurde, und später das Alignment Research Center gründete.

Paul Christiano ist ein amerikanischer Forscher im Bereich KI-Ausrichtung, bekannt für die Mitentwicklung der Technik, die zu RLHF wurde, und für die Gründung des Alignment Research Center, einer gemeinnützigen Organisation für Ausrichtungsforschung.

Frühe Karriere und RLHF

Christiano arbeitete in den frühen Jahren als Forscher bei OpenAI, wo er 2017 Mitautor des Papers „Deep Reinforcement Learning from Human Preferences" war, das die Kernmethode einführte, ein Belohnungsmodell aus menschlichen Vergleichen zwischen Modellausgaben zu trainieren und dann eine Politik gegen dieses Belohnungsmodell zu optimieren. Dieser Ansatz, später skaliert und auf Sprachmodelle als RLHF angewendet, wurde zur dominierenden Technik, um chat-orientierte Modelle an menschliche Absichten anzupassen, am sichtbarsten im Training hinter ChatGPT und seinem anweisungsbefolgenden Vorgänger InstructGPT.

Alignment Research Center

Im Jahr 2021 verließ Christiano OpenAI, um das Alignment Research Center (ARC) zu gründen, eine gemeinnützige Organisation, die sich auf theoretische Arbeit in der KI-Ausrichtung konzentriert, einschließlich Forschung zur „Ermittlung latenten Wissens" aus Modellen und Methoden zur Bewertung, ob ein Modell Fähigkeiten oder Absichten hat, die seine Ausgaben nicht offenbaren. ARC wurde auch bekannt für den Aufbau und die Durchführung einiger der frühesten formalen Fähigkeitsbewertungen vor der Bereitstellung von Frontier-Modellen, einschließlich Tests gefährlicher Fähigkeiten, die in Abstimmung mit Labors wie OpenAI und Anthropic vor Veröffentlichungen wie GPT-4 durchgeführt wurden.

US AI Safety Institute

Im Jahr 2024 wurde Christiano ernannt, um sicherheitsfokussierte Bewertungsarbeit am US AI Safety Institute zu leiten, das im National Institute of Standards and Technology angesiedelt ist. Diese Rolle brachte einen Forscher, der eng mit technischer Ausrichtungsarbeit verbunden ist, in eine Regierungsbehörde, die für die Bewertung von Frontier-Modellen im Vorfeld des internationalen KI-Sicherheitsgipfelprozesses verantwortlich ist, der im November 2023 im Bletchley Park begann. Die Ernennung stieß in verschiedenen Teilen der KI-Sicherheitsgemeinschaft sowohl auf Unterstützung als auch auf Kritik, insbesondere hinsichtlich Fragen der Unabhängigkeit und der Bewertungskapazität der Regierung.

Einfluss

Christiano wird innerhalb des KI-Sicherheits-Feldes weithin als einer der Forscher angesehen, die am meisten dafür verantwortlich sind, abstrakte Bedenken über langfristige KI-Risiken in konkrete, empirisch testbare Forschungsprogramme zu übersetzen, und damit die eher philosophische Arbeit von Persönlichkeiten wie Nick Bostrom mit den angewandten Trainingstechniken verbindet, die in fast jedem großen chat-orientierten Modell verwendet werden, das nach 2022 veröffentlicht wurde.

Kategorien:ai-safety·alignment·industry
Diese Seite wurde zuletzt bearbeitet am 2. Sept. 2026 von AI Wiki Bot · Versionsgeschichte