딥페이크는 딥러닝 기술을 사용하여 생성되거나 조작된 합성 미디어로, 대부분 비디오나 오디오 형태이며, 실제 인물이 실제로 말하거나 행동하지 않은 것을 설득력 있게 묘사한다. 이 용어는 딥러닝과 가짜의 합성어로, 2017년 후반 Reddit 포럼에서 유래했으며, 한 사용자가 초기 생성적 적대 신경망 기반 얼굴 교체 도구를 사용하여 처음에는 유명인을 대상으로 한 얼굴 교체 비디오를 게시한 데서 시작되었다.
딥페이크 기술은 2010년대 후반과 2020년대 초반에 빠르게 발전하여, 조잡하고 쉽게 감지되는 얼굴 교체에서 매우 설득력 있는 비디오와 점점 더 실시간 음성 복제 및 전신 합성으로 이동했으며, 이는 비동의 포르노, 정치적 허위 정보, 사기 등에 대한 우려를 불러일으켰다.
기법
초기 딥페이크는 주로 오토인코더 기반 얼굴 교체를 사용했으며, 두 사람의 영상에서 공유 인코더와 별도의 디코더를 훈련시켜 한 사람의 표정을 다른 사람의 얼굴에 매핑할 수 있게 했다. GAN 기반 방법은 가짜를 감지하도록 훈련된 판별기와 생성기를 대립시켜 사실성을 더욱 향상시켰다. 2020년대 중반까지 확산 모델은 고품질 합성 비디오 및 이미지 생성의 지배적인 기법이 되었으며, 전용 얼굴 교체 및 립싱크 도구와 범용 텍스트-투-비디오 시스템은 기술 초기보다 설득력 있는 가짜 비디오 제작을 훨씬 저렴하고 빠르게 만들었다.
악의적 및 합법적 용도
문서화된 악의적 응용 사례로는 가장 초기이자 여전히 가장 흔한 보고된 사용 사례인 비동의 친밀한 이미지, 선거 전후 공인에 의한 조작된 발언과 같은 정치적 허위 정보, 그리고 다국적 기업의 재무 직원이 딥페이크된 임원이 등장하는 화상 통화에 속아 수백만 달러를 송금한 2020년대 2024년 널리 보도된 사례를 포함한 금융 사기가 있다. 딥페이크 기술은 또한 영화 더빙 및 디에이징 효과, 목소리를 잃은 사람들을 위한 합성 음성 생성 접근성 도구, 일부 관할권에서 자유 표현으로 보호되는 풍자 등 인정된 합법적 응용 분야도 있다.
탐지 및 대응책
딥페이크 탐지는 일관되지 않은 깜빡임, 부자연스러운 얼굴 기하학, 미묘한 시청각 불일치와 같은 인공물을 사용하여 활발한 연구 분야가 되었지만, 탐지 정확도는 특히 최고급 모델의 경우 생성 품질을 따라잡는 데 어려움을 겪고 있다. 워터마킹 및 콘텐츠 출처 표준은 생성 인공물을 발견하는 데 의존하지 않는 보완적 방어책으로 제안되었다. 여러 관할권은 2020년대 중반에 딥페이크를 구체적으로 규제하기 위해 움직였으며, 여기에는 선거 관련 및 비동의 친밀한 딥페이크를 대상으로 한 미국 주 차원의 법률과 AI 생성 미디어의 공개를 요구하는 EU AI 법 내 조항이 포함되지만, 그러한 콘텐츠가 쉽게 생성되고 배포될 수 있다는 점을 고려할 때 국경 간 집행은 여전히 어려웠다.
영향
특정 유해 사건 외에도, 연구자와 언론인은 더 넓은 거짓말쟁이 배당 효과를 설명했다. 대중이 설득력 있는 가짜 비디오와 오디오가 가능하다는 것을 알게 되면서, 진짜 영상이 조작된 것으로 무시될 수 있으며, 이는 일반적으로 진정한 증거에 대한 신뢰를 훼손한다. 이러한 역학은 죽은 인터넷 이론의 성장과 생성형 AI 시대의 온라인 미디어 신뢰성에 관한 관련 담론의 요인으로 인용되었다.