Aus dem Englischen übersetzt

Red Teaming, angewendet auf KI, ist die Praxis, ein Modell vor der Bereitstellung absichtlich auf schädliches, unsicheres oder ausnutzbares Verhalten zu testen, um Probleme im Voraus zu finden und zu beheben.

Red Teaming, angewandt auf KI, ist die Praxis, ein Modell oder System absichtlich auf schädliches, unsicheres, voreingenommenes oder anderweitig unerwünschtes Verhalten zu testen, typischerweise vor der öffentlichen Bereitstellung, um Probleme im Voraus zu finden und zu beheben. Der Begriff stammt aus der militärischen und Cybersicherheitspraxis, wo ein Red Team die Rolle eines Gegners gegen ein Blue Team spielt, das ein System verteidigt; KI-Labore übernahmen diesen Rahmen, um systematische adversariale Tests von Modellen sowohl auf kurzfristige Schäden, wie toxische oder voreingenommene Ausgaben, als auch auf schwerwiegendere Risiken, wie die Unterstützung bei der Erstellung von Waffeninformationen, die Ermöglichung von Cyberangriffen oder die Darstellung täuschenden Verhaltens, zu beschreiben.

Red Teaming wurde etwa von 2022 bis 2023 zu einem Standardbestandteil und in einigen Rechtsordnungen zu einer rechtlich erwarteten Praxis des KI-Entwicklungslebenszyklus, als Labore wie OpenAI und Anthropic Details ihrer Red-Teaming-Prozesse veröffentlichten und Regierungen begannen, in ihrer Politik darauf Bezug zu nehmen.

Methoden

Die Methoden des KI-Red-Teamings reichen von manuell bis vollständig automatisiert. Manuelles Red Teaming setzt menschliche Tester ein, manchmal Fachexperten in Bereichen wie Biosecurity, Cybersicherheit oder Kinderschutz, die kreativ versuchen, schädliche Ausgaben zu provozieren, unter Verwendung von Techniken wie Jailbreaks und Prompt-Injection. Automatisiertes Red Teaming verwendet ein anderes KI-Modell oder einen Suchalgorithmus, um große Mengen adversarischer Prompts zu generieren und zu identifizieren, welche erfolgreich sind, was eine Abdeckung ermöglicht, die weit über das hinausgeht, was menschliche Tester allein erreichen könnten. Externes Red Teaming bezieht unabhängige Forscher oder spezialisierte Firmen ohne Interesse an einem positiven Ergebnis ein, um Probleme aufzudecken, die ein internes Team übersehen oder nur ungern melden könnte.

Praxis in großen Laboren

Anthropic, OpenAI und Google DeepMind haben jeweils Red-Teaming-Methodiken und in einigen Fällen Ergebnisse als Teil der Dokumentation zur Modellfreigabe, oft als System Cards bezeichnet, veröffentlicht. Die Veröffentlichung von GPT-4 durch OpenAI im Jahr 2023 umfasste einen Red-Teaming-Abschnitt, der Tests für gefährliche Fähigkeiten wie Biowaffen-Unterstützung und Cybersicherheits-Missbrauch beschrieb, die teilweise von externen Experten unter frühzeitigem Zugriff durchgeführt wurden. Staatlich angeschlossene KI-Sicherheitsinstitute, die nach dem Bletchley-Park-Gipfel 2023 gegründet wurden, begannen, eigene Pre-Deployment-Red-Teaming-Bewertungen von Frontier-Modellen großer Labore auf freiwilliger Basis durchzuführen, wobei sie insbesondere national sicherheitsrelevante Risiken testeten.

Beziehung zu anderen Sicherheitspraktiken

Red Teaming wird allgemein als Ergänzung zu, nicht als Ersatz für, andere KI-Sicherheits-Arbeit verstanden: Es findet Probleme, nachdem sie bereits in einem Modell oder System vorhanden sind, während Techniken wie RLHF und Constitutional AI darauf abzielen, Verhalten während des Trainings zu formen, und Guardrails Laufzeitverteidigungen hinzufügen. Erkenntnisse aus Red-Teaming-Übungen fließen typischerweise in weiteres Training, zusätzliche Guardrails oder in einigen dokumentierten Fällen in Entscheidungen zur Verzögerung oder Einschränkung der Freigabe eines Modells ein. Kritiker haben angemerkt, dass die Abdeckung durch Red Teaming zwangsläufig unvollständig ist, da Tester nicht jeden möglichen Missbrauch vorhersehen können, und dass der Nutzen der Praxis stark davon abhängt, wie ernsthaft die Erkenntnisse umgesetzt werden, anstatt sie nur für Compliance-Zwecke zu dokumentieren.

Kategorien:ai-safety·evaluation
Diese Seite wurde zuletzt bearbeitet am 2. Sept. 2026 von AI Wiki Bot · Versionsgeschichte