딥러닝 음성 합성은 Generative AI 분야의 한 영역으로, Deep learning 기술, 특히 Neural network 구조를 적용하여 텍스트에서 음성 오디오를 생성한다. 초기의 연결형 또는 포먼트 기반 합성 방법과 달리, 딥러닝 접근 방식은 녹음된 음성의 대규모 데이터셋에서 직접 학습하여 매우 자연스럽고 표현력이 풍부하며 종종 화자 적응형 음성을 생성할 수 있게 한다. 이 기술은 가상 비서, 오디오북, 접근성 도구, 엔터테인먼트에 사용되는 현대 텍스트 음성 변환 시스템의 기반이 되며, 2010년대 중반 이후 모델 구조와 계산 자원의 개선으로 빠르게 발전해 왔다.
핵심 작업은 일반적으로 텍스트에서 파생된 언어적 특징의 시퀀스를 파형으로 변환할 수 있는 음향 표현에 매핑하는 것이다. 초기 딥러닝 시스템은 Sequence-to-Sequence (Seq2Seq) 모델과 Encoder-Decoder Architecture 구조를 사용했으며, 여기서 인코더는 입력 텍스트를 처리하고 디코더는 스펙트로그램 또는 기타 음향 특징을 생성한다. 이후의 혁신은 언어의 장거리 의존성을 포착하는 데 뛰어난 Transformer (architecture) 기반 구조와 텍스트 및 음성 패턴에 대한 광범위한 지식을 활용할 수 있는 Large language model 스타일의 사전 학습을 도입했다.
역사적 발전
딥러닝 음성 합성의 뿌리는 2000년대 후반과 2010년대 초반으로 거슬러 올라가며, University of Toronto 및 Google DeepMind와 같은 기관의 연구자들이 음향 모델링을 위한 신경망 실험을 시작했다. 2016년 Google DeepMind가 개발한 WaveNet의 도입으로 중요한 돌파구가 마련되었다. WaveNet은 팽창 합성곱 신경망을 사용하여 원시 오디오 파형을 샘플 단위로 생성했으며, 이전 방법에 비해 자연스러움에서 큰 도약으로 널리 평가받는 음성을 생성했다. 계산 집약적이었지만 WaveNet은 종단 간 신경 음성 생성의 가능성을 입증했다.
2017년 Google 연구자들은 텍스트에서 멜 스펙트로그램을 생성하는 시퀀스-투-시퀀스 모델인 Tacotron을 도입했으며, 이는 WaveNet과 같은 보코더를 사용하여 오디오로 변환할 수 있었다. 이 2단계 접근 방식은 수년간 지배적인 패러다임이 되었다. Tacotron 2를 포함한 후속 버전은 주의 메커니즘을 통합하고 훈련 안정성을 개선했다. 같은 시기에 baidu 계열 연구자들은 텍스트 음성 변환 파이프라인의 모든 구성 요소(그래핀-음소 변환 및 지속 시간 예측 포함)에 신경망을 사용하는 시스템인 Deep Voice를 개발했다.
2010년대 후반에는 순차적이 아닌 병렬로 음성을 생성할 수 있는 비자기회귀 모델이 등장하여 추론 시간을 크게 줄였다. Microsoft (AI) 및 기타 연구소에서 개발된 FastSpeech 및 ParaNet과 같은 모델은 지속 시간 예측기를 갖춘 피드포워드 트랜스포머를 사용하여 텍스트와 음성을 정렬했다. 이러한 모델은 소비자 하드웨어에서 실시간 합성을 가능하게 하여 실용적 응용 분야를 확장했다.
주요 구조 및 기술
현대 딥러닝 음성 합성 시스템은 다양한 구조를 사용한다. VITS(Variational Inference with adversarial Training for Text-to-Speech) 프레임워크에 사용된 것과 같은 Transformer (architecture) 기반 모델은 변분 오토인코더와 적대적 훈련을 결합하여 별도의 보코더 없이 텍스트에서 직접 고품질 오디오를 생성한다. 2021년에 도입된 VITS는 빠른 추론 속도를 유지하면서 최첨단 자연스러움을 달성했다.
또 다른 중요한 발전은 텍스트에 조건화된 파형으로 노이즈를 반복적으로 정제하는 확산 모델을 음성 합성에 사용하는 것이다. 이미지 생성 기술에서 영감을 받은 이러한 모델은 높은 충실도와 제어 가능성을 제공한다. 또한 Multi-Head Attention 메커니즘을 통해 모델이 입력 시퀀스의 관련 부분에 집중할 수 있어 텍스트와 오디오 간의 정렬이 개선된다.
이러한 시스템을 훈련하려면 멜 스펙트로그램 재구성 손실, 지속 시간 손실, 적대적 손실과 같은 음성에 맞춘 Loss Functions에 의존한다. Batch Normalization 및 Layer Normalization과 같은 기술은 훈련을 안정화하고, Dropout 및 Gradient Clipping은 과적합과 기울기 폭발을 방지한다. 속도 섭동 및 노이즈 주입을 포함한 Data Augmentation 방법은 견고성을 향상시킨다.
응용 분야 및 제품
딥러닝 음성 합성은 주요 기술 기업에 의해 상용화되었다. Amazon Web Services는 오디오북 내레이션 및 대화형 음성 응답과 같은 응용 분야를 위해 신경 TTS를 사용하여 생생한 음성을 생성하는 Amazon Polly를 제공한다. Google Cloud는 Google DeepMind가 개발한 모델을 활용하는 Cloud Text-to-Speech를 제공한다. Microsoft의 Microsoft Azure는 사용자 제공 녹음으로 사용자 지정할 수 있는 신경 음성을 포함한다. OpenAI는 고급 음성 모델을 개발했지만 주로 언어 모델에 초점을 맞추고 있으며, API에는 텍스트 음성 변환 기능이 포함되어 있다.
Apple, Samsung Electronics 및 Qualcomm의 소비자 기기는 Siri 및 Bixby와 같은 가상 비서를 위한 온디바이스 신경 TTS를 통합하여 오프라인 작동과 개인 정보 보호를 가능하게 한다. AMD 및 Intel은 이러한 모델의 추론을 가속화하는 하드웨어 가속기를 생산한다. 자동차 부문에서 TomTom 및 기타 내비게이션 제공업체는 자연스러운 음성 안내를 위해 신경 TTS를 사용한다.
상업용 제품 외에도 딥러닝 음성 합성은 몇 초의 오디오로 특정 화자의 목소리를 모방할 수 있는 음성 복제를 가능하게 했다. 이는 역사적 인물의 목소리를 재현하는 엔터테인먼트와 언어 장애가 있는 개인에게 맞춤형 합성 음성을 제공하는 접근성 분야에 응용된다. 그러나 오용에 대한 윤리적 우려도 제기하여 딥페이크 탐지 및 규제 노력으로 이어지고 있다.
평가 및 과제
합성 음성의 품질 평가는 객관적 지표와 주관적 청취 테스트를 모두 포함한다. 일반적인 객관적 측정에는 1-5 척도의 주관적 평가인 평균 의견 점수(MOS)와 멜 켑스트럼 왜곡 및 음성 인식을 사용한 명료도 평가를 위한 단어 오류율이 포함된다. 자연스러움은 본질적으로 지각적이므로 주관적 테스트가 여전히 최우선 기준이다.
이 분야의 과제에는 일관된 운율과 감정 달성, 희귀 단어 및 고유 명사 처리, 노이즈 환경에서의 아티팩트 감소가 포함된다. 다국어 및 코드 스위칭 합성은 모델이 다양한 음운 목록을 처리해야 한다. 또한 저전력 기기에서의 실시간 성능은 여전히 활발한 연구 영역이며, Model Pruning 및 양자화와 같은 기술이 모델 크기를 줄이는 데 사용된다.
또 다른 과제는 많은 언어와 방언에 대한 대규모 고품질 데이터셋의 부족이다. 영어와 몇몇 주요 언어는 풍부한 데이터를 보유하고 있지만, 저자원 언어는 전이 학습이나 데이터 증강 전략이 필요하다. MIT CSAIL 및 Stanford AI Lab과 같은 기관의 연구자들은 이를 해결하기 위해 퓨샷 학습 및 비지도 방법을 탐구하고 있다.
미래 방향
딥러닝 음성 합성의 미래는 Large language model과의 더 긴밀한 통합을 통해 더욱 상황 인식적이고 상호작용적인 음성 생성을 가능하게 할 가능성이 높다. 예를 들어, 모델은 텍스트의 의미적 내용에 따라 적절한 감정으로 음성을 생성하거나 사용자의 말하기 스타일에 실시간으로 적응할 수 있다. Reinforcement Learning from AI Feedback (RLAIF)(AI 피드백 기반 강화 학습)는 인간 선호도에 맞춰 합성을 최적화하는 데 사용될 수 있다.
또 다른 방향은 중간 표현 없이 텍스트에서 직접 음성을 생성하는 완전한 종단 간 모델을 개발하여 파이프라인을 단순화하고 충실도를 개선하는 것이다. AWS Trainium 및 Groq 프로세서와 같은 하드웨어의 발전은 고품질 합성을 더욱 접근 가능하게 만들 것이다. 또한 Melanie Mitchell과 같은 학자들이 주장하는 해석 가능성에 대한 연구는 더욱 제어 가능하고 신뢰할 수 있는 시스템으로 이어질 수 있다.
윤리적 프레임워크와 규제는 음성 사칭 및 잘못된 정보의 위험을 해결하기 위해 진화할 가능성이 높다. 이 분야는 혁신과 책임의 균형을 계속 유지하여 합성 음성이 유익한 목적으로 사용되고 피해를 완화하도록 보장할 것이다.