KI-Wasserzeichen bezeichnet Techniken zur Einbettung eines erkennbaren Signals in Inhalte, die von einem KI-System erzeugt wurden, etwa Text, Bilder, Audio oder Video, sodass die Inhalte später als maschinengeneriert identifiziert werden können. Im Gegensatz zu einem sichtbaren Wasserzeichen, das über ein Bild gelegt wird, sind die meisten KI-Wasserzeichen-Schemata darauf ausgelegt, für Menschen nicht wahrnehmbar zu sein, während sie für einen Abgleichalgorithmus statistisch nachweisbar bleiben – und in einigen Designs auch robust gegenüber gängigen Bearbeitungen wie Zuschneiden, Komprimieren oder Umschreiben sind.
Das Interesse an KI-Wasserzeichen wuchs parallel zum breiteren Generative-KI-Boom ab 2022, angetrieben durch Bedenken hinsichtlich qualitativ minderwertiger synthetischer Inhalte, die das Internet überfluten, sowie durch Wahlbezogene Deepfakes und Fragen der akademischen und journalistischen Integrität. Das Thema wurde auch in politischen Diskussionen aufgegriffen, darunter die freiwilligen KI-Verpflichtungen des Weißen Hauses von 2023 und die Transparenzanforderungen für synthetische Inhalte im EU-KI-Gesetz.
Techniken
Bei Text funktionieren Wasserzeichen-Schemata typischerweise, indem sie die Token-Auswahl eines großen Sprachmodells subtil beeinflussen – etwa indem sie bei jedem Generierungsschritt eine pseudo-zufällig ausgewählte Teilmenge ähnlich wahrscheinlicher Token bevorzugen. Dies erzeugt ein Muster, das für Leser unsichtbar ist, aber statistisch nachweisbar bleibt, wenn der gleiche pseudo-zufällige Schlüssel verwendet wird, der auch bei der Generierung zum Einsatz kam. Bei Bildern und Videos, die von Systemen wie Text-zu-Bild- und Text-zu-Video-Modellen erzeugt werden, bettet Google DeepMinds SynthID, das 2023 eingeführt wurde, ein Signal direkt in die Pixelwerte ein – entweder während oder nach der Generierung –, das typische Transformationen wie Größenänderungen oder Komprimierung übersteht, ohne das Bild sichtbar zu verändern. Bei Audio werden Wasserzeichen ähnlich in Frequenzbereiche eingebettet, die außerhalb des typischen menschlichen Hörbereichs liegen.
Grenzen
Wasserzeichen stehen vor erheblichen technischen und praktischen Herausforderungen. Text-Wasserzeichen lassen sich oft durch Umschreiben, Übersetzen oder die Aufforderung an ein anderes Modell zur Neufassung entfernen, und die Erkennung kann zu falsch positiven Ergebnissen führen, wenn menschlicher Text zufällig dem statistischen Muster entspricht. Zudem sind Wasserzeichen nur wirksam, wenn das erzeugende System sie tatsächlich anwendet – offene oder modifizierte Modelle können den Schritt einfach weglassen. Bislang hat kein Schema nachgewiesen, dass es gegen einen entschlossenen Angreifer robust ist, der gezielt versucht, das Wasserzeichen zu entfernen. Bis 2025 war die Einführung von Wasserzeichen zudem uneinheitlich: Einige Anbieter wie Google und Meta setzten sie für ihre eigenen Bild- und Videogeneratoren ein, während es an branchenweit einheitlichen Standards noch mangelte.
Verwandte Ansätze
KI-Wasserzeichen wird oft im Zusammenhang mit – und manchmal verwechselt mit – Content-Provenienz-Standards wie C2PA diskutiert. Dieser Rahmen befestigt stattdessen kryptografisch signierte Metadaten, die die Bearbeitungsgeschichte eines Bildes beschreiben. Dieser Ansatz ist komplementär, nicht konkurrierend, da Metadaten durch einfaches Neuspeichern einer Datei entfernt werden können, während ein robustes Pixel-Wasserzeichen dies überstehen kann. Da Modelle zunehmend auch mit Daten aus dem Internet trainiert werden, ist es zudem wichtig geworden, echte Trainingsdaten von synthetischen KI-Ausgaben zu unterscheiden, um die Verschlechterung künftiger Modelle zu verhindern – ein weiterer Anreiz für Provenienz- und Wasserzeichen-Techniken, der über reine Desinformationsbedenken hinausgeht.