AI音乐生成指的是利用机器学习来作曲、编曲或制作音乐的系统,其范围从生成短小器乐循环的工具,到能够根据描述流派、情绪和歌词的文本提示生成完整歌曲(包括演唱人声)的系统不等。
历史
算法作曲比深度学习早了数十年,但神经网络的音乐生成方法随着谷歌基于WaveNet的音频工作以及OpenAI在2019年和2020年发布的MuseNet和Jukebox等模型而获得发展动力,这些模型能够生成各种艺术家和流派风格的原始音频,尽管在较长作品上的输出质量和连贯性仍然有限。随着Suno和Udio在2023年和2024年的出现,该领域决定性地转向主流应用,这些工具让用户能在不到一分钟内从简短的文本描述中生成完整歌曲,包括歌词和人声,其完成度和流派多样性达到了普通听众难以与人类制作的音乐区分开来的水平。
技术方法
现代文本到音乐系统通常结合一个自回归模型组件来规划结构和歌词,以及一个扩散模型或自回归音频生成器来渲染实际波形或中间频谱图表示,这与文本转语音和文本转视频中使用的技术思路类似。有些系统直接端到端生成音频,而另一些则将作曲、编曲和人声合成分为不同阶段。与声音克隆一样,基于参考声音或风格进行条件生成的能力,引发了制作模仿特定真实艺术家演唱风格的歌曲的可能性。
版权与行业回应
音乐生成尤其具有争议性,因为这些模型的训练数据通常包含未经许可的受版权保护的商业录音。2024年,包括环球音乐集团、索尼音乐和华纳音乐在内的主要唱片公司对Suno和Udio提起诉讼,指控其大规模侵犯版权,这是针对生成式AI公司的更广泛的AI版权诉讼浪潮的一部分。包括YouTube和Spotify在内的一些平台引入或讨论了针对AI生成曲目的披露要求和下架机制,而关于AI辅助或AI生成的歌曲是否符合版权保护资格、能否获得流媒体版税或进入排行榜的问题,在2020年代中期在大多数司法管辖区仍未得到解决。
反响
音乐家和制作人对此意见不一:一些人拥抱生成工具用于构思演示、伴奏音轨或克服创作瓶颈,而另一些人则认为该技术直接威胁到录音室乐手、作曲家和独立艺术家的生计,这与文本转图像生成中提出的关于劳动力替代的担忧相呼应。流媒体平台也报告称,为获取版税而大规模上传的AI生成曲目有所增加,这加剧了关于内容泛滥的更广泛担忧,即所谓的“AI垃圾内容”。到2020年代中期,AI生成的音乐已从新奇事物转变为主要平台上新上传内容中可观的份额,尽管其法律地位仍然存在争议。