LJSpeechは、単一の女性話者が7冊のノンフィクション書籍から朗読した文章を収録した、13,100件の短い音声クリップから構成される広く利用されている音声データセットである。クリップの総再生時間は約24時間で、LibriVoxによるパブリックドメインのオーディオブック録音から派生したものである。各クリップにはテキストの書き起こしが付随しており、テキスト読み上げ(TTS)システムやその他の音声処理モデルの教師あり学習に適している。このデータセットはKeith Itoによって作成され、2017年にパブリックドメインの献呈として公開された。これにより、学術研究と商業アプリケーションの両方で人気を博している。
話者は米国英語のアクセントを持つ女性であることだけが特定されており、録音は元々1984年に行われた。音声は22050 Hzでサンプリングされ、ビット深度は16ビットで、クリップの長さは約1秒から10秒の範囲である。このデータセットは単一話者TTSのベンチマークとしてよく使用され、Tacotron 2やFastSpeechなど、多くの現代的なニューラルTTSアーキテクチャがこれを用いて評価されている。クリーンな録音と一貫した話者同一性のため、LJSpeechはモデル性能を比較するための標準的な参照点として機能している。
データセットの構造と内容
データセットは単一のアーカイブとして配布され、メタデータCSV、WAV音声ファイルのフォルダ、READMEの3つのファイルが含まれている。メタデータファイルには、各クリップのID、書き起こされたテキスト、および文章が取られた元の書籍と章がリストされている。書籍には『A History of England』や『The Scientific American』などのタイトルが含まれ、文章は多様なトピックを網羅しており、多様な音声内容を提供している。書き起こしは元の句読点と大文字化を保持しており、韻律や句読点を扱うモデルの訓練に役立つ。音声ファイルは連番で命名され、データセットにはREADMEに訓練/検証分割の提案が含まれているが、公式の分割は強制されていない。
音声合成における応用
LJSpeechは主に、テキストを音声に変換するAIモデルの訓練に使用される。これは深層学習ベースのTTSシステム、特にニューラルネットワークやトランスフォーマーアーキテクチャに基づくものの開発における重要なリソースとなっている。例えば、Google DeepMindとGoogleの研究者によって開発されたTacotron 2モデルは、訓練と評価にLJSpeechを使用した。同様に、MicrosoftのFastSpeechおよびFastSpeech 2モデルもこのデータセットを使用した。このデータセットの単一話者性により、研究者は多話者変動の複雑さを加えることなく、韻律と発音の課題を分離して取り組むことができる。また、音声変換や生成AI研究でも使用され、モデルが同じ声で音声を合成することを学習する。
ライセンスと入手可能性
データセットはクリエイティブ・コモンズCC0 1.0ユニバーサル・パブリックドメイン献呈の下で公開されており、帰属なしで任意の目的に使用できる。この寛容なライセンスにより、オープンソースの音声プロジェクトと商用製品の両方で定番となっている。LibriVoxウェブサイトでホストされ、KaggleやHugging Faceなどのプラットフォームにもミラーリングされている。元の録音はLibriVoxからのもので、LibriVox自体がボランティアによるパブリックドメインのオーディオブックを提供している。話者の身元は開示されておらず、プライバシーを保護しながらも訓練用の一貫した声を提供している。
制限と代替案
その人気にもかかわらず、LJSpeechには制限がある。話者が1人だけであるため、多話者TTSや話者適応研究には使用が制限される。録音は1984年のものであり、音質はクリーンだが、現代の録音基準を反映していない可能性がある。語彙は書籍の内容に限定されており、会話的または技術的な用語をすべてカバーしているわけではない。より広いカバレッジのために、研究者はしばしばLibriTTS、VCTK、Common Voiceコーパスなどのデータセットに目を向ける。これらには複数の話者とより多様な内容が含まれている。しかし、LJSpeechはそのシンプルさと信頼性から、プロトタイピングとベンチマークの標準的な最初の選択肢であり続けている。
影響と遺産
リリース以来、LJSpeechは数百の研究論文で引用され、音声合成コミュニティの事実上の標準となっている。その成功は、Nancy CorpusやBlizzard Challengeデータなどの同様の単一話者データセットを生み出すきっかけとなった。データセットのパブリックドメインの地位は、誰でも法的障壁なくダウンロードして使用できるため、再現可能な研究も促進した。2020年代半ばの時点で、より多くのデータと高品質を持つ新しいデータセットが登場しているにもかかわらず、引き続き積極的に使用されている。その遺産は、連結法やパラメトリック法からエンドツーエンドの深層学習へと移行したニューラルTTSの急速な進歩と結びついており、これは主にこのようなアクセスしやすいデータセットによって可能になった。