AI音楽生成とは、機械学習を用いて楽曲を作曲、編曲、または制作するシステムを指す。短いインストゥルメンタルループを生成するツールから、ジャンル、雰囲気、歌詞を記述したテキストプロンプトから歌入りのボーカルを含む完全な楽曲を生成できるシステムまで、その範囲は多岐にわたる。
歴史
アルゴリズムによる作曲はディープラーニングより数十年早く存在していたが、ニューラルネットワークを用いた音楽生成は、GoogleのWaveNet由来の音声研究や、2019年と2020年に公開されたOpenAIのMuseNetやJukeboxなどのモデルによって勢いを増した。これらのモデルは、様々なアーティストやジャンルのスタイルで生の音声を生成できたが、出力品質や長い楽曲における一貫性には限界があった。この分野は、2023年と2024年に登場したSunoとUdioによって主流の使用へと決定的にシフトした。これらのサービスは、短いテキスト記述から歌詞とボーカルを含む完全な楽曲を1分足らずで生成でき、一般のリスナーにとって人間が制作した音楽と区別が難しいほどの洗練度とジャンルの多様性を実現した。
技術的アプローチ
現代のテキストから音楽を生成するシステムは、通常、構造と歌詞を計画する自己回帰モデルと、実際の波形または中間スペクトログラム表現をレンダリングする拡散モデルまたは自己回帰オーディオ生成器を組み合わせる。これは、テキスト読み上げやテキストから動画生成で使用される技術と同様の考え方である。一部のシステムは音声をエンドツーエンドで直接生成するが、他のシステムは作曲、編曲、ボーカル合成を段階に分けて行う。音声クローニングと同様に、参照音声やスタイルに基づいて生成を条件付ける機能により、特定の実在アーティストの歌声を模倣した楽曲を生成する可能性が生じた。
著作権と業界の対応
音楽生成は、これらのモデルの学習データにライセンスなしの商用録音が含まれることが多かったため、特に論争の的となっている。2024年には、ユニバーサル・ミュージック・グループ、ソニー・ミュージック、ワーナー・ミュージックを含む主要レコードレーベルが、SunoとUdioに対して大規模な著作権侵害を主張して訴訟を起こした。これは、生成AI企業を標的としたより広範なAI著作権訴訟の波の一部である。YouTubeやSpotifyを含む一部のプラットフォームは、AI生成トラックの開示要件や削除メカニズムを導入または議論し、AI支援またはAI生成の楽曲が著作権保護、ストリーミングロイヤルティ、チャート対象資格の対象となるかどうかという問題は、2020年代半ば時点でほとんどの法域において未解決のままであった。
評価
ミュージシャンやプロデューサーの間では意見が分かれている。一部はアイデアのデモ、伴奏トラック、または創造性の壁を乗り越えるために生成ツールを受け入れたが、他の人々はこの技術をセッションミュージシャン、作曲家、インディペンデントアーティストの生計への直接的な脅威とみなし、テキストから画像生成で提起された労働力の置き換えに関する懸念を反映した。ストリーミングプラットフォームはまた、ロイヤルティ目的でAI生成トラックが大規模にアップロードされる事例の増加を報告し、ai slopで説明されるコンテンツ氾濫に関するより広範な懸念に寄与した。2020年代半ばまでに、AI生成音楽は目新しさから主要プラットフォームでの新規アップロードの測定可能な割合へと移行したが、その法的地位は依然として争われている。