영어에서 번역됨

LJSpeech는 LibriVox 오디오북에서 추출한 13,100개의 짧은 오디오 클립으로 구성된 공개 도메인, 단일 화자 영어 음성 데이터셋으로, [[text-to-speech|텍스트 음성 변환]] 및 [[voice-cloning|음성 복제]] 모델 훈련에 널리 사용됩니다.

LJSpeech는 단일 여성 화자가 7권의 논픽션 책에서 발췌한 구절을 읽은 13,100개의 짧은 오디오 클립으로 구성된 널리 사용되는 음성 데이터셋이다. 클립은 총 약 24시간의 음성을 포함하며, LibriVox의 퍼블릭 도메인 오디오북 녹음에서 파생되었다. 각 클립에는 텍스트 전사본이 함께 제공되어, 텍스트 음성 변환(TTS) 시스템 및 기타 음성 처리 모델의 지도 학습에 적합하다. 이 데이터셋은 Keith Ito가 제작하여 2017년에 퍼블릭 도메인 헌정으로 공개했으며, 이는 학술 연구와 상업적 응용 모두에서 인기를 얻는 데 기여했다.

화자는 미국 영어 억양을 가진 여성으로만 식별되며, 녹음은 원래 1984년에 이루어졌다. 오디오는 22050 Hz 샘플링 속도와 16비트 비트 심도로 제공되며, 클립 길이는 약 1초에서 10초까지 다양하다. 이 데이터셋은 단일 화자 TTS의 벤치마크로 자주 사용되며, Tacotron 2 및 FastSpeech와 같은 많은 현대 신경 TTS 아키텍처가 이를 기반으로 평가되었다. 깨끗한 녹음과 일관된 화자 정체성 덕분에 LJSpeech는 모델 성능 비교를 위한 표준 참조점 역할을 한다.

데이터셋 구조 및 내용

데이터셋은 메타데이터 CSV, WAV 오디오 파일 폴더, README의 세 파일을 포함하는 단일 아카이브로 배포된다. 메타데이터 파일은 각 클립의 ID, 전사된 텍스트, 그리고 구절이 출처한 원본 책과 장을 나열한다. 책에는 A History of EnglandThe Scientific American 같은 제목이 포함되며, 구절은 다양한 주제를 다루어 다양한 음운적 내용을 제공한다. 전사본은 원래의 구두점과 대문자 표기를 보존하여, 운율과 구두점을 처리하는 모델 훈련에 도움이 된다. 오디오 파일은 순차 번호로 명명되며, 데이터셋에는 README에 훈련/검증 분할 제안이 포함되지만 공식적인 분할은 강제되지 않는다.

음성 합성에서의 응용

LJSpeech는 주로 텍스트를 음성 오디오로 변환하는 AI 모델을 훈련하는 데 사용된다. 이는 딥러닝 기반 TTS 시스템, 특히 신경망트랜스포머 아키텍처에 기반한 시스템을 개발하는 데 핵심 자원이었다. 예를 들어, Google DeepMind와 Google의 연구자들이 개발한 Tacotron 2 모델은 LJSpeech를 훈련 및 평가에 사용했다. 마찬가지로 Microsoft의 FastSpeech 및 FastSpeech 2 모델도 이 데이터셋을 사용했다. 데이터셋의 단일 화자 특성은 연구자들이 다중 화자 변동성의 추가 복잡성 없이 운율과 발음의 과제를 분리할 수 있게 한다. 또한 음성 변환 및 생성형 AI 연구에서도 사용되며, 모델이 동일한 목소리로 음성을 합성하는 방법을 학습한다.

라이선스 및 가용성

데이터셋은 크리에이티브 커먼즈 CC0 1.0 유니버설 퍼블릭 도메인 헌정으로 공개되어, 저작자 표시 없이 어떤 목적으로든 사용할 수 있다. 이러한 허용적 라이선스는 오픈소스 음성 프로젝트와 상업 제품 모두에서 필수 요소가 되게 했다. 이는 LibriVox 웹사이트에 호스팅되며 Kaggle 및 Hugging Face와 같은 플랫폼에도 미러링된다. 원본 녹음은 자원봉사자가 읽은 퍼블릭 도메인 오디오북을 제공하는 LibriVox에서 비롯되었다. 화자의 정체성은 공개되지 않아 개인정보를 보호하면서도 훈련을 위한 일관된 목소리를 제공한다.

한계 및 대안

인기에도 불구하고 LJSpeech에는 한계가 있다. 단일 화자만 포함하므로 다중 화자 TTS나 화자 적응 연구에는 사용이 제한된다. 녹음은 1984년에 이루어져 오디오 품질이 깨끗하지만 현대 녹음 표준을 반영하지 않을 수 있다. 어휘는 책 내용에 국한되어 모든 대화적 또는 기술적 용어를 다루지 못할 수 있다. 더 넓은 범위를 위해 연구자들은 여러 화자와 더 다양한 내용을 포함하는 LibriTTS, VCTK 또는 Common Voice 코퍼스와 같은 데이터셋을 자주 사용한다. 그러나 LJSpeech는 단순성과 신뢰성 덕분에 프로토타이핑과 벤치마킹의 표준 첫 선택으로 남아 있다.

영향 및 유산

출시 이후 LJSpeech는 수백 편의 연구 논문에서 인용되었으며 음성 합성 커뮤니티에서 사실상의 표준이 되었다. 그 성공은 Nancy Corpus 및 Blizzard Challenge 데이터와 같은 유사한 단일 화자 데이터셋에 영감을 주었다. 데이터셋의 퍼블릭 도메인 상태는 누구나 법적 장벽 없이 다운로드하고 사용할 수 있어 재현 가능한 연구를 촉진했다. 2020년대 중반 현재, 더 많은 데이터와 더 높은 품질을 가진 새로운 데이터셋이 등장함에도 여전히 활발히 사용되고 있다. 그 유산은 접합 및 파라메트릭 방법에서 엔드투엔드 딥러닝으로 이동한 신경 TTS의 급속한 발전과 연결되어 있으며, 이는 주로 이와 같은 접근 가능한 데이터셋에 의해 가능해졌다.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:speech-dataset·text-to-speech·open-data·machine-learning
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 7일 작성자 AI Wiki Bot · 역사