AI 워터마킹은 텍스트, 이미지, 오디오 또는 비디오와 같은 AI 시스템이 생성한 콘텐츠에 감지 가능한 신호를 삽입하여, 해당 콘텐츠가 나중에 기계 생성물로 식별될 수 있도록 하는 기술을 의미한다. 이미지 위에 겹쳐진 가시적인 워터마크와 달리, 대부분의 AI 워터마킹 방식은 인간에게는 인지되지 않으면서도 매칭 알고리즘에 의해 통계적으로 감지 가능하도록 설계되며, 일부 설계에서는 자르기, 압축 또는 의역과 같은 일반적인 편집에도 견고하다.
AI 워터마킹에 대한 관심은 2022년 이후 생성형 AI 붐과 함께 급격히 증가했으며, 이는 인터넷을 범람하는 저품질 합성 콘텐츠, 선거 관련 딥페이크, 학계 및 언론의 무결성에 대한 우려에 의해 주도되었고, 2023년 백악관 자발적 AI 약속과 EU AI 법의 합성 콘텐츠 투명성 요구 사항을 포함한 정책 논의에서도 언급되었다.
기법
텍스트의 경우, 워터마킹 방식은 일반적으로 대규모 언어 모델의 다음 토큰 샘플링을 미묘하게 편향시켜 작동한다. 예를 들어, 각 생성 단계에서 유사한 확률의 토큰 하위 집합 중 하나를 의사 무작위로 선택하여 선호하게 만드는 방식으로, 독자에게는 보이지 않지만 생성 중 사용된 동일한 의사 무작위 키가 주어지면 통계적으로 감지 가능한 패턴을 만든다. 텍스트-이미지 및 텍스트-비디오 모델과 같은 시스템으로 생성된 이미지와 비디오의 경우, 2023년에 출시된 구글 딥마인드의 SynthID는 생성 중 또는 생성 후에 픽셀 값에 직접 신호를 삽입하여 크기 조정이나 압축과 같은 일반적인 변환에도 견디면서도 이미지를 눈에 띄게 변경하지 않는다. 오디오 워터마킹은 유사하게 일반적인 인간 인지 범위 밖의 주파수 대역에 신호를 삽입한다.
한계
워터마킹은 상당한 기술적 및 채택 측면의 과제에 직면해 있다. 텍스트 워터마크는 의역, 번역 또는 다른 모델에 콘텐츠 재작성을 요청함으로써 제거될 수 있는 경우가 많으며, 감지 과정에서 우연히 통계적 패턴과 일치하는 인간 작성 텍스트에 대해 오탐(false positive)이 발생할 수 있다. 워터마크는 생성 시스템이 이를 적용하기로 선택한 경우에만 유용하므로, 오픈소스 또는 수정된 모델은 단순히 워터마킹 단계를 생략할 수 있으며, 이를 제거하려는 결심한 적대자에 대한 견고성을 입증한 방식은 아직 없다. 2025년 기준으로 워터마킹 채택은 제공업체 간에 일관되지 않았으며, 구글과 메타를 포함한 일부 업체는 자체 이미지 및 비디오 생성기에 이를 배포했지만, 업계 전반의 광범위한 상호운용 가능한 표준은 여전히 형성 중이다.
관련 접근법
AI 워터마킹은 종종 C2PA 프레임워크와 같은 콘텐츠 출처 표준과 함께 논의되며 때로는 혼동되기도 한다. C2PA는 대신 이미지의 편집 이력을 설명하는 암호화 서명된 메타데이터를 첨부하는 방식으로, 파일을 다시 저장할 때 메타데이터가 제거될 수 있는 반면 견고한 픽셀 수준 워터마크는 생존할 수 있으므로 상호 보완적이지 경쟁적이지 않은 접근법이다. 모델이 점점 더 웹에서 수집된 데이터로 훈련됨에 따라, 진정한 훈련 데이터와 합성 AI 출력을 구별하는 것은 미래 모델의 성능 저하를 방지하는 데 중요해졌으며, 이는 오정보 우려를 넘어 출처 추적 및 워터마킹 노력에 대한 추가적인 동기가 되고 있다.