Ein System-Prompt ist eine Reihe von Anweisungen, die einem konversationellen KI-Modell vor der eigentlichen Eingabe des Benutzers gegeben werden und die Persona des Modells, seine Verhaltensregeln und die Aufgabenrahmung für den Rest einer Interaktion festlegen. Anders als eine gewöhnliche Benutzernachricht wird ein System-Prompt in der Regel vom Anwendungsentwickler festgelegt und nicht vom Endbenutzer und wird normalerweise nicht im sichtbaren Gespräch angezeigt.
Funktion
System-Prompts werden verwendet, um zu konfigurieren, wie sich ein Assistent über eine gesamte Sitzung hinweg verhalten soll: welchen Ton er annehmen soll, welche Themen er vermeiden soll, welchem Ausgabeformat er folgen soll und welche Persona, falls vorhanden, er präsentieren soll. Produkte, die auf Large Language Models basieren, darunter ChatGPT und Claude, bieten auch Endbenutzern Formen dieses Mechanismus an, die "benutzerdefinierte Anweisungen" ermöglichen, die über Gespräche hinweg bestehen bleiben, ohne jedes Mal neu eingegeben werden zu müssen. Entwickler, die Anwendungen auf einer KI-Agenten- oder Chatbot-API aufbauen, verlassen sich stark auf System-Prompts, um das Verhalten ihres Produkts vom Standardverhalten des zugrunde liegenden Modells zu unterscheiden, selbst wenn mehrere Produkte auf demselben Basismodell basieren.
Beziehung zum Sicherheitstraining
System-Prompts stehen neben dem Sicherheitsverhalten, das während des Trainingsprozesses eines Modells verankert wird, etwa durch RLHF oder Constitutional AI, sind aber davon weiterhin zu unterscheiden. Ein gut gestalteter System-Prompt kann zusätzliche Einschränkungen über die trainierten Standardwerte eines Modells legen, kann jedoch Verhalten, das das Modell zu verweigern trainiert wurde, nicht vollständig überschreiben. Das Gegenteil gilt ebenfalls nicht immer: Ein schlecht gestalteter System-Prompt kann unbeabsichtigt die Einhaltung des trainierten Sicherheitsverhaltens eines Modells schwächen. Aufgrund dieses Zusammenspiels veröffentlichen Anbieter Anleitungen, wie System-Prompts geschrieben werden sollten, die das Training eines Modells verstärken und nicht damit in Konflikt geraten.
Sicherheitsauswirkungen
Da System-Prompts oft proprietäre Anweisungen eines Produkts kodieren, ist das Extrahieren oder Überschreiben dieser Anweisungen zu einem häufigen Ziel von Gegnern geworden. Ein Jailbreak kann versuchen, ein Modell davon zu überzeugen, seinen System-Prompt vollständig zu ignorieren, während Prompt-Injection-Angriffe Anweisungen in externe Inhalte einbetten, die das Modell verarbeitet, um die Autorität des System-Prompts mit Inhalten zu überschreiben, die nie dazu gedacht waren, irgendwelche Anweisungen zu tragen. Mehrschichtige Moderations-Prüfungen werden häufig zusammen mit System-Prompts eingesetzt, insbesondere um Fälle abzufangen, in denen die prompt-basierten Anweisungen nicht standhalten.
Verwendung in agentischen Systemen
Da Sprachmodelle in Agentensysteme eingebettet wurden, die in der Lage sind, Werkzeuge zu nutzen und mehrstufige Aktionen zu ergreifen, sind System-Prompts länger und strukturierter geworden, wobei sie häufig verfügbare Werkzeuge, Ausgabeschemata und explizite Entscheidungsverfahren angeben, anstatt einfache Verhaltensrichtlinien aufzustellen. Diese Verschiebung hat das Design von System-Prompts zu einem bedeutenden Teil des Aufbaus zuverlässiger Produktions-KI-Systeme gemacht, das sich von der eher explorativen Praxis der Endbenutzer-Prompt-Technik unterscheidet.