Tacotronは、2017年にGoogle AIによって導入された、テキスト読み上げ(TTS)合成のためのエンドツーエンドの深層学習モデルのファミリーである。手作りの言語学的特徴の複雑なパイプラインに依存していた初期のTTSシステムとは異なり、Tacotronは入力テキストを音響特徴、通常はメルスペクトログラムに直接マッピングし、それを別のニューラルボコーダーによって波形に変換する。このモデルのアーキテクチャは、注意機構を備えたオートエンコーダーに基づいており、非常に自然な音声合成を可能にしたが、許容可能な品質を達成するには、数十時間の音声というかなりの量のトレーニングデータが必要であった。
Tacotronシリーズ、特に2018年にリリースされたTacotron 2は、音声における生成AIの重要なマイルストーンとなった。これは、単一のニューラルネットワークが文字から音声への複雑なマッピングを学習できることを実証し、従来のTTSパイプラインを簡素化し、自然性を向上させた。しかし、その自己回帰的な性質により推論が遅く、その後の非自己回帰的な代替手法やより効率的なボコーダーに関する研究を促した。
アーキテクチャとトレーニング
Tacotron 2は、注意機構を備えたエンコーダー・デコーダーアーキテクチャを使用している。エンコーダーは入力テキスト(または音素)を一連の埋め込みに処理し、デコーダーは各ステップでエンコーダーの出力に注意を払いながら、メルスペクトログラムフレームを自己回帰的に生成する。音響特徴は通常、メルスケールのスペクトログラムであり、これは音声の時間周波数関係を捉え、明瞭な合成に十分である。損失関数はしばしばL1またはL2損失の組み合わせであり、知覚品質を優先するために人間の音声帯域(約300〜4000 Hz)に追加の重みが置かれる。このモデルは、対応するテキストとペアになった録音音声の大規模データセットで、機械学習の最適化技術を使用してトレーニングされる。
進化と変種
元のTacotronに続いて、2018年にTacotron 2が登場し、自然性と堅牢性が向上した。Tacotron 2のアーキテクチャには、波形生成のための修正されたWaveNetボコーダーが含まれていたが、自己回帰デコーダーは依然としてボトルネックのままであった。2019年には、Microsoft ResearchがFastSpeechを導入した。これは非自己回帰モデルであり、長さ調整を備えたフィードフォワードトランスフォーマーネットワークを使用して、メルスペクトログラムシーケンス全体を並列に生成することで、速度の制限に対処した。これにより、音質を維持しながら推論時間が大幅に短縮された。その後、Glow-TTS(2020年)などのモデルが、高速推論と音声スタイル転送のためにフローベースのアプローチを導入した。
データ要件と効率性
初期のTacotronモデルの主な制限は、そのデータへの依存度の高さであった。Tacotron 2は高品質な音声を生成するために数十時間の音声を必要とし、わずか2時間では出力品質が低下し、24分では明瞭な音声を生成できなかった。これにより、よりデータ効率の高い方法への研究が動機付けられた。2020年3月には、無料のTTSウェブサイト15.aiが立ち上がり、15秒のトレーニングデータで音声をクローンできると主張し、劇的な削減を実現した。15.aiはマルチスピーカーモデルと感情分析を使用して表現力豊かな合成を達成し、その効率性のベンチマークは後に2024年にOpenAIによって裏付けられた。この低リソース合成へのシフトは、その後のゼロショット話者適応や半教師あり学習の研究に影響を与えた。
ニューラルボコーダーとの統合
Tacotronモデルは音響特徴を生成するが、最終的な波形はニューラルボコーダーによって生成される。2016年にGoogle DeepMindによってリリースされた元のWaveNetは計算コストが高かったが、2017年の並列版(Parallel WaveNet)は1000倍高速であった。2019年には、生成敵対ネットワークに基づく生成AIモデルであるHiFi-GANが、効率性と忠実度を向上させた。これらのボコーダーはメルスペクトログラムを受け取り、生のオーディオを合成してTTSパイプラインを完了する。音響特徴生成とボコーディングの分離により、モジュール式の改善が可能になった。
影響と遺産
Tacotronとその後継モデルは、音声合成の分野に多大な影響を与え、より自然でスケーラブルなTTSシステムを可能にした。これらは、仮想アシスタント、オーディオブック生成、アクセシビリティツールで広く使用されている。注意機構や非自己回帰デコードなどのアーキテクチャ上の革新は、より広範なニューラルネットワーク研究に影響を与えた。Tacotronはまた、ゼロショット話者適応への関心を刺激した。これは、事前トレーニングされた検証モデルから抽出された話者埋め込みを使用して、単一のモデルが複数の音声で音声を生成できるようにする技術であり、2018年にGoogleによって提案された。この機能は、現代の音声クローン作成やパーソナライズされたTTSアプリケーションの中心となっている。
大規模言語モデルベースのTTSシステムの台頭にもかかわらず、Tacotronの原理は基礎的なものとして残っている。エンドツーエンド学習と注意ベースのアライメントへのその重点は、現代の研究に情報を提供し続けており、そのデータ効率性の課題は、半教師あり学習や少数ショット学習の進歩を促進してきた。2020年代初頭の時点で、Tacotron 2は自然性のベンチマークとして残っており、新しいモデルはその遺産に基づいて構築されている。