음성 복제는 Text-to-speech의 특수한 응용 분야로, 모델이 특정 개인의 녹음된 음성 샘플에서 음색, 음높이, 말투와 같은 음성적 특성을 학습하여, 그 목소리로 임의의 텍스트를 말하는 새로운 음성을 생성하는 기술이다. 초기 시스템은 화자당 수 분 또는 수 시간 분량의 깨끗한 녹음이 필요했지만, 2020년대 초반에는 몇 샷(few-shot) 또는 심지어 몇 초 분량의 샘플만으로도 복제가 상용화되었다.
기술적 발전
전통적인 TTS 시스템은 단일 화자의 목소리를 처음부터 학습했는데, 이는 짧은 샘플로 복제하기에는 데이터 요구량이 너무 큰 방식이었다. 음성 복제는 신경망 TTS 모델이 "무엇을 말하는지"와 "누가 말하는지"를 분리하도록 설계되면서 실용화되었으며, 일반적으로 짧은 참조 클립에서 추출한 컴팩트한 화자 Embedding으로 공유 생성 모델을 조건화하는 방식으로 이루어졌다. 이를 통해 단일 학습 시스템이 짧은 샘플만 제공되면 모든 화자의 스타일로 음성을 생성할 수 있게 되어, 목소리마다 전용 모델이 필요하지 않게 되었다. 2020년대 초반 Diffusion model 및 Transformer (architecture) 기반 오디오 생성의 개선으로 필요한 참조 오디오가 수 분에서 수 초로 줄어들었고, 자연스러움과 표현력(감정 및 억양 보존 포함)도 향상되었다.
응용 분야
음성 복제는 영화 및 게임 더빙에서 배우의 목소리를 유지한 채 다른 언어로 번역하거나, 질병으로 말하기 능력을 잃은 사람의 목소리를 복원하거나, 개인화된 접근성 도구, 작가의 목소리로 낭독되는 오디오북 제작과 같은 콘텐츠 제작 등에서 합법적으로 사용된다. ElevenLabs를 포함한 기업들은 이러한 사용 사례를 중심으로 상용 제품을 구축했으며, 미디어 및 현지화 기업이 사용하는 음성 마켓플레이스와 더빙 파이프라인을 제공하고 있다.
동의, 사기 및 오용
합법적인 더빙을 가능하게 하는 동일한 기술은 사칭도 가능하게 한다. 복제된 목소리는 친척이나 임원을 사칭하여 돈을 요구하는 사기 전화, 정치적 맥락에서 대중을 오도하기 위한 조작된 오디오 클립, 그리고 허가나 보상 없이 성우나 공인된 인물의 목소리를 상업적으로 사용하는 경우에 사용되어 왔으며, 이는 더 넓은 AI and copyright 및 초상권 논쟁과 연결된다. 2024년 미국 선거 기간 중 정치 후보의 목소리를 사칭한 AI 생성 로보콜을 포함한 고위험 사건들은 규제 관심을 가속화했다. 여러 관할권과 주에서는 퍼블리시티 권리 및 사기 방지 법률을 명시적으로 합성 음성에 적용하도록 확대했으며, 일부 AI 기업은 응답으로 복제 제품에 동의 확인 절차, 사용 제한, AI watermarking을 추가했다.
탐지 및 완화
복제된 목소리는 이제 인간이 진짜 녹음과 구별하기 어려울 수 있기 때문에, 금융 기관과 민감한 음성 인증을 처리하는 기업은 음성을 보안 요소로 재고해야 했으며, 법의학적 오디오 탐지는 비디오 및 이미지 Deepfake 탐지와 함께 합성 미디어를 식별하려는 더 넓은 노력 내에서 활발한 분야가 되었다. 이는 더 넓은 AI safety 분야의 주제이기도 하다. 2020년대 중반 현재, 탐지 도구는 생성 품질을 따라가지 못하고 있으며, 음성 복제는 저비용과 사기 시나리오에서의 높은 설득력 때문에 생성 AI의 가장 즉각적으로 유해한 응용 분야 중 하나로 널리 언급된다.