英語からの翻訳

WaveNetは、DeepMindによって開発された深層ニューラルネットワークであり、2016年9月に発表され、生のオーディオ波形を生成するために使用されます。。。。。。。。。。。。。。。。。。。。。

WaveNetは、生のオーディオを生成するための深層ニューラルネットワークである。これは、ロンドンを拠点とするAI企業DeepMindの研究者らによって開発された。2016年9月に発表された論文で概説されたこの技術は、ニューラルネットワークを用いて波形を直接モデル化し、実際の音声の録音で訓練することで、比較的リアルな人間らしい声を生成することができる。米国英語と中国語の標準語を用いたテストでは、このシステムがGoogleの既存の最良のテキスト読み上げ(TTS)システムを上回る性能を示したが、2016年時点では、そのテキスト読み上げ合成音声は、実際の人間の音声ほど説得力のあるものではなかった。WaveNetが生の波形を生成できるということは、音楽を含むあらゆる種類のオーディオをモデル化できることを意味する。

歴史

テキストから音声を生成することは、AppleのSiri、MicrosoftのCortana、Amazon Alexa、Googleアシスタントなどのソフトウェアの人気により、ますます一般的なタスクとなっている。そのようなシステムのほとんどは、連結音声合成と呼ばれる技術の一種を使用している。これは、単一の話者から録音された音声断片の大規模なライブラリを連結して、認識可能な音と単語を形成するものである。その結果は不自然に聞こえ、不自然なリズムと抑揚になることが多い。録音されたライブラリに依存しているため、声を変更したり修正したりすることも難しい。

パラメトリック音声合成として知られる別の技術は、数学的モデルを使用して音を再現し、それを単語や文に組み立てる。出力音声の特性はモデルの入力によって制御され、音声は通常、ボコーダーとして知られる音声合成器を使用して生成される。これもまた、不自然に聞こえる音声になる可能性がある。

設計と継続的な研究

背景

WaveNetは、フィードフォワードニューラルネットワークの一種である深層畳み込みニューラルネットワーク(CNN)である。WaveNetでは、CNNが生の信号を入力として受け取り、一度に1サンプルずつ出力を合成する。これは、μ則圧伸変換と量子化によって256個の可能な値にエンコードされた信号値のソフトマックス(すなわちカテゴリカル)分布からサンプリングすることによって行われる。このアプローチは深層学習の原理に基づいており、ネットワークは入力データの階層的表現を学習する。

初期のコンセプトと結果

2016年9月のDeepMindの原著論文「WaveNet: A Generative Model for Raw Audio」によると、ネットワークには英語と中国語の標準語による実際の音声波形が入力された。これらの波形がネットワークを通過する際、ネットワークはオーディオ波形が時間とともにどのように変化するかを記述する一連のルールを学習する。訓練されたネットワークは、毎秒16,000サンプルの新しい音声のような波形を生成するために使用できる。これらの波形には、現実的な呼吸音や唇の音が含まれるが、どの言語にも準拠していない。

WaveNetは、異なる声を正確にモデル化することができる。入力のアクセントと抑揚は出力と相関する。例えば、ドイツ語で訓練すると、ドイツ語の音声を生成する。この能力は、WaveNetに音楽などの他の入力を与えた場合、その出力は音楽的なものになることも意味する。発表当時、DeepMindはWaveNetがクラシック音楽のように聞こえる波形を生成できることを示した。この多様性は、従来の機械学習による音声応用を超えた可能性を強調している。

コンテンツ(音声)交換

2018年6月の論文「Disentangled Sequential Autoencoder」によると、DeepMindはオーディオと音声の「コンテンツ交換」にWaveNetをうまく使用している。ネットワークは、オーディオ録音内の声を、元の録音のテキストやその他の特徴を維持しながら、別の既存の声に交換できる。「我々はまた、オーディオシーケンスデータでも実験を行った。我々の分離された表現により、音声のコンテンツに条件付けながら、話者のアイデンティティを互いに変換することができる。」(5ページ)「オーディオの場合、これにより男性話者を女性話者に、またはその逆に変換することができる。」(1ページ)この論文によると、ソースとターゲットの両方の音声の事前録音された音声が最低でも2桁の時間数(約50時間)必要であり、プログラムが個々の特徴を学習してから、ある声から別の声への変換を満足のいく品質で実行できるようになる。著者らは、「このモデルの利点は、動的特徴と静的特徴を分離できることである。」(8ページ)と強調している。つまり、WaveNetは、話されているテキストと、変調、速度、ピッチ、ムードなどの伝達様式を区別でき、一方で、交換に必要なソースとターゲットの両方の声の基本的な特徴を維持できる。

2019年1月のフォローアップ論文

2019年1月のフォローアップ論文「Unsupervised speech representation learning using WaveNet autoencoders」では、音声の「コンテンツ交換」のための方法が詳述されている。これは、オーディオ録音内の声を、元の録音のテキストやその他の特徴を維持しながら、別の既存の声に交換するものである。この論文では、話者のアイデンティティを音声コンテンツから分離するための教師なし表現学習の使用について詳しく説明している。これにより、ネットワークは、話されている内容に条件付けながら、ある話者の声を別の話者の声に変換できる。このアプローチは、ソースとターゲットの両方の音声の事前録音された音声が最低でも2桁の時間数(約50時間)必要であり、プログラムが個々の特徴を学習してから、ある声から別の声への変換を満足のいく品質で実行できるようになる。著者らは、このモデルの利点は、動的特徴と静的特徴を分離できることであると強調している。つまり、WaveNetは、話されているテキストと、変調、速度、ピッチ、ムードなどの伝達様式を区別でき、一方で、交換に必要なソースとターゲットの両方の声の基本的な特徴を維持できる。

別のフォローアップ論文

2018年9月の別のフォローアップ論文「Sample Efficient Adaptive Text-to-Speech」では、適応的テキスト読み上げのためのサンプル効率的な方法が詳述されている。この論文では、わずか数分の音声データで新しい話者の声を学習できる、サンプル効率的な適応的テキスト読み上げの方法を提案している。これは、新しい話者の音声データをほとんど必要とせずに、高品質の音声合成を実現する。このアプローチは、事前に訓練されたWaveNetモデルを、新しい話者の限られたデータで微調整することに依存している。著者らは、この方法が、わずか数分の音声データで、新しい話者の声を高品質で合成できることを示した。

応用

発表当時、DeepMindはWaveNetは現実世界の応用には計算処理能力が大きすぎると述べていた。2017年10月の時点で、Googleは音声品質を向上させながら、処理速度を1,000倍高速化したと発表した。WaveNetはその後、Googleアシスタントの米国英語と日本語の音声を生成するために使用された。2017年11月、DeepMindの研究者らは、「Probability Density Distillation」と呼ばれる、リアルタイムの20倍以上の速度で高忠実度の音声サンプルを生成する方法を詳述した研究論文を発表した。2018年5月の年次I/O開発者会議で、Googleアシスタントの新しい音声がWaveNetによって実現されたことが発表された。WaveNetは、音声モデルを作成するために必要な音声録音の数を大幅に削減した。これは、音声合成のための生成的AIにおける重要な革新としてのWaveNetの地位を確立し、その後のニューラルネットワークベースの音声合成の研究に影響を与えた。

関連項目

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:deep-learning·speech-synthesis·audio-generation·google-deepmind
このページの最終編集日 2026年9月7日 編集者 AI Wiki Bot · 履歴