Tacotron 2は、Google AIによって開発され2018年に公開された、深層学習に基づくテキスト読み上げシステムである。これは、エンドツーエンドのニューラルネットワークアーキテクチャが、書き言葉から非常に自然な音声を生成できることを実証し、ニューラル音声合成における重要な進歩を示した。このシステムは、入力テキストからメルスペクトログラムを生成するリカレントなシーケンス・ツー・シーケンス特徴予測ネットワークと、そのスペクトログラムを生の音声波形に変換する改良版WaveNetボコーダーの、2つの主要コンポーネントで構成される。この2段階アプローチにより、Tacotron 2は出力において人間に近い自然さを達成できたが、許容できる品質に達するには、通常数十時間の録音音声という相当なトレーニングデータが必要だった。
Tacotron 2の開発は、深層学習による音声合成の初期の研究に基づいていた。2016年9月、DeepMindはWaveNetを公開し、深層学習モデルが生の波形をモデル化し、スペクトログラムやメルスペクトログラムなどの音響特徴から音声を生成できることを初めて実証した。WaveNetは当初、計算コストが高く低速だったが、1年後、DeepMindは元の約1,000倍高速な本番モデルであるParallel WaveNetを発表した。Tacotron 2は、これらの進歩をアテンションに基づくシーケンス・ツー・シーケンスモデルと統合し、明示的なアライメント情報を必要とせずに、入力テキストを出力音声特徴と整列させることを可能にした。
アーキテクチャ
Tacotron 2のアーキテクチャは、入力テキストを文字単位で処理するアテンションメカニズムを備えたオートエンコーダーである。エンコーダーは文字シーケンスを隠れ表現に変換し、アテンションモジュールがそれを出力メルスペクトログラムのフレームと整列させる。デコーダーは、以前に生成されたフレームとアテンションされたエンコーダー状態に基づいて各フレームを予測し、メルスペクトログラムフレームを自己回帰的に生成する。トレーニングの損失関数は通常、L1(平均絶対誤差)またはL2(平均二乗誤差)損失を使用し、出力音響特徴分布がガウス分布またはラプラス分布でなければならないという制約を課す。実際には、損失関数は、人間の音声帯域(約300〜4000 Hz)に大きなペナルティを課すように設計され、人間の帯域と他の周波数に対する損失の重み付き組み合わせを使用する。
Tacotron 2が使用する音響特徴はメルスペクトログラムであり、音声信号の時間周波数関係を捉える。これらの特徴は、音声認識で使用されるメル周波数ケプストラム係数とは異なり、合成目的には情報が減りすぎるため、了解可能な出力を生成するのに十分である。最終的な波形はWaveNetボコーダーによって生成され、これは波形の同時確率を条件付き確率の積に因数分解し、高品質なオーディオ生成を可能にする。
トレーニングデータ要件
Tacotron 2の開発から得られた重要な発見の1つは、トレーニングデータ量に対する感度である。数十時間のオーディオでトレーニングした場合、システムは非常に自然な音声合成を達成した。しかし、データセットが小さいと、出力品質は著しく低下した。約2時間の音声では、Tacotron 2は了解可能な音声を維持したが、自然さは低下した。わずか24分のトレーニングデータでは、システムは了解可能な音声をまったく生成できなかった。このデータ要件は、後のシステムとは対照的だった。2020年3月、無料のテキスト読み上げウェブサイト15.aiが立ち上がり、その作成者は15秒のトレーニングデータで人の声を複製するのに十分だと主張した。この主張は後に2024年にOpenAIによって裏付けられ、Tacotron 2の要件からの大幅な削減を表している。
影響と後継
Tacotron 2の速度とデータ効率の限界は、その後の研究を促進した。2019年、Microsoft ResearchはFastSpeechを導入し、Tacotron 2のような自己回帰モデルの速度制限に対処した。FastSpeechは、フィードフォワードトランスフォーマーネットワークと長さ調整を備えた非自己回帰アーキテクチャを使用し、並列シーケンス生成とメルスペクトログラムシーケンス全体のワンショット予測を可能にした。これにより、オーディオ品質を維持しながら推論時間を大幅に短縮した。同年、HiFi-GANがリリースされ、生成的敵対ネットワークベースのボコーダーが波形生成効率を改善し、高忠実度の音声を生成した。2020年、Glow-TTSはフローベースのアプローチを導入し、高速推論と音声スタイル転送を可能にした。
Tacotron 2は、ゼロショット話者適応の研究にも影響を与えた。2018年6月、Googleは、事前トレーニングされた話者検証モデルを話者エンコーダーとして使用して話者埋め込みを抽出することを提案した。これらのエンコーダーはニューラルテキスト読み上げモデルの一部となり、各話者に対して再トレーニングすることなく、単一のモデルがさまざまな話者スタイルと特性を持つ音声を生成できるようにした。
遺産
Tacotron 2は、ニューラルテキスト読み上げの歴史における画期的なモデルとして広く認識されている。これは、エンドツーエンドの深層学習アプローチが、自然さにおいて従来の連結合成法やパラメトリック合成法に匹敵できることを実証した。その2段階設計(音響特徴生成とそれに続くニューラルボコーディング)は、その後のシステムで一般的なパラダイムとなった。後のモデルが速度とデータ効率を改善した一方で、音声のためのアテンションに基づくシーケンス・ツー・シーケンスモデリングへのTacotron 2の貢献と、ニューラルボコーダーとの統合は、機械学習と生成AIの分野で影響力を持ち続けている。