AIウォーターマーキングとは、AIシステムによって生成されたコンテンツ(テキスト、画像、音声、動画など)に検出可能な信号を埋め込む技術を指し、後からそのコンテンツが機械生成であると識別できるようにするものである。画像に重ねて表示される目に見えるウォーターマークとは異なり、ほとんどのAIウォーターマーキング方式は、人間には知覚できない一方で、照合アルゴリズムによって統計的に検出可能であり、一部の設計では、切り抜き、圧縮、言い換えなどの一般的な編集に対しても頑健であるように設計されている。
AIウォーターマーキングへの関心は、2022年以降の生成AIブームとともに急激に高まり、低品質な合成コンテンツがインターネットにあふれることへの懸念、選挙関連のディープフェイク、学術・ジャーナリズムの誠実性への懸念がその背景にあり、2023年のホワイトハウスの自主的AIコミットメントや、EU AI法の合成コンテンツに関する透明性要件など、政策議論でも言及された。
技術
テキストの場合、ウォーターマーキング方式は通常、大規模言語モデルの次のトークンサンプリングを微妙に偏らせることで機能する。例えば、各生成ステップで、同程度に可能性の高いトークンの擬似ランダムに選択されたサブセットを別のサブセットよりも優先するといった方法で、読者には見えないが、生成時に使用された同じ擬似ランダム鍵があれば統計的に検出可能なパターンを作り出す。テキストから画像やテキストから動画モデルなどのシステムによって生成された画像や動画については、2023年に開始されたGoogle DeepMindのSynthIDが、生成中または生成後にピクセル値に直接信号を埋め込み、リサイズや圧縮などの一般的な変換を経ても生き残り、画像を目に見えて変えることなく検出を可能にする。音声ウォーターマーキングも同様に、通常の人間の知覚範囲外の周波数帯域に信号を埋め込む。
限界
ウォーターマーキングは、技術的および導入上の重大な課題に直面している。テキストのウォーターマークは、言い換え、翻訳、別のモデルに書き直させることによって除去できることが多く、検出は、統計的パターンに偶然一致する人間が書いたテキストに対して偽陽性を生じる可能性がある。ウォーターマークは、生成システムがそれを適用することを選択した場合にのみ有用であり、オープンソースまたは改変されたモデルは単にウォーターマーキングのステップを省略できる。また、意図的に除去しようとする攻撃者に対して頑健性を示した方式はまだない。2025年時点で、ウォーターマーキングの導入はプロバイダー間で一貫しておらず、GoogleやMetaを含む一部は自社の画像・動画生成ツールに導入しているが、業界全体での広範な相互運用可能な標準はまだ形成途上である。
関連するアプローチ
AIウォーターマーキングは、C2PAフレームワークなどのコンテンツ来歴標準と並んで議論されることが多く、混同されることもある。C2PAは、画像の編集履歴を記述する暗号署名付きメタデータを添付するもので、メタデータはファイルの再保存によって除去される可能性がある一方で、頑健なピクセルレベルのウォーターマークは生き残る可能性があるため、補完的であり競合するアプローチではない。モデルがウェブから収集したデータの一部で訓練されることが増えるにつれて、本物の訓練データと合成AI出力を区別することは、将来のモデルの劣化を防ぐためにも重要になっており、誤情報への懸念に加えて、来歴とウォーターマーキングへの取り組みの追加の動機となっている。