译自英文

WaveNet是由DeepMind开发的一种深度神经网络,用于生成原始音频波形,于2016年9月推出。它直接对音频进行建模,实现了逼真的语音合成和音乐生成,后来被用于Google Assistant的语音中。

WaveNet是一种用于生成原始音频的深度神经网络。它由总部位于伦敦的人工智能公司DeepMind的研究人员创建。这项技术在2016年9月的一篇论文中概述,能够通过直接使用真实语音录音训练的神经网络方法建模波形,生成相对逼真的人类声音。测试显示,该系统在美式英语和普通话方面优于谷歌现有的最佳文本转语音(TTS)系统,尽管截至2016年,其文本转语音合成仍不如真实人类语音令人信服。WaveNet生成原始波形的能力意味着它可以对任何类型的音频进行建模,包括音乐。

历史

由于苹果的Siri、微软的Cortana、亚马逊的Alexa和谷歌助手等软件的普及,从文本生成语音已成为一项日益常见的任务。大多数此类系统使用一种涉及将声音片段拼接在一起以形成可识别声音和词语的技术变体。其中最常见的技术称为拼接式TTS。它包含一个大型语音片段库,这些片段来自单一说话者,然后拼接起来生成完整的词语和声音。结果听起来不自然,带有奇怪的节奏和语调。对录音库的依赖也使得修改或改变声音变得困难。

另一种称为参数式TTS的技术使用数学模型重建声音,然后组装成词语和句子。生成声音所需的信息存储在模型参数中。输出语音的特征通过模型输入控制,而语音通常使用称为声码器的语音合成器创建。这也可能导致不自然的音频效果。

设计与持续研究

背景

WaveNet是一种称为深度卷积神经网络(CNN)的前馈神经网络。在WaveNet中,CNN将原始信号作为输入,并一次一个样本地合成输出。它通过从使用μ-law压缩变换编码并量化为256个可能值的信号值的softmax(即分类)分布中采样来实现。这种方法植根于Deep learning原理,其中网络学习输入数据的分层表示。

初始概念与结果

根据2016年9月的原始DeepMind研究论文《WaveNet:原始音频的生成模型》,网络被输入英语和普通话的真实语音波形。当这些波形通过网络时,它学习一套规则来描述音频波形如何随时间演变。然后,训练好的网络可用于以每秒16,000个样本的速率创建新的类语音波形。这些波形包括逼真的呼吸声和嘴唇碰击声,,但不遵循任何语言。

WaveNet能够精确建模不同的声音,输入的口音和语调与输出相关。例如,如果使用德语训练,它会生成德语语音。这种能力还意味着,如果WaveNet被输入其他输入(如音乐),其输出将具有音乐性。在发布时,DeepMind展示了WaveNet可以生成听起来像古典音乐的波形。这种多功能性突显了其在传统Machine learning语音应用之外的潜力。

内容(声音)交换

根据2018年6月的论文《解纠缠的顺序自编码器》,DeepMind已成功使用WaveNet进行音频和语音的“内容交换”:网络可以将录音中的声音替换为另一个预先存在的声音,同时保留原始录音中的文本和其他特征。“我们还对音频序列数据进行了实验。我们的解纠缠表示允许我们在以语音内容为条件时,将说话者身份相互转换。”(第5页)“对于音频,这允许我们将男性说话者转换为女性说话者,反之亦然 [...]。”(第1页)根据论文,需要将源和目标声音的预先存在语音录音输入WaveNet至少两小时的时长(约50小时),程序才能学习它们各自的特征,然后才能以令人满意的质量执行从一个声音到另一个声音的转换。作者强调,“该模型的一个优势是它将动态特征与静态特征分离 [...]”(第8页),即WaveNet能够区分说出的文本和表达方式(语调、速度、音高、情绪等)在从一个声音转换到另一个声音时需要保持的内容,以及需要交换的源和目标声音的基本特征。

2019年1月的后续论文《使用WaveNet自编码器的无监督语音表示学习》详细介绍了一种方法,以有效增强对动态和静态特征的自动识别和区分能力,用于“内容交换”,特别包括交换现有音频录音上的声音,以使其更可靠。另一篇后续论文《样本高效自适应文本转语音》,日期为2018年9月(最新修订于2019年1月),指出DeepMind已将采样现有声音所需的最低真实录音时长减少到“仅需几分钟的音频数据”,同时保持高质量结果。

其语音克隆能力引发了关于WaveNet模仿在世和已故人士声音的伦理担忧。根据2016年BBC的一篇文章,从事类似语音克隆技术(如Adobe Voco)的公司打算插入人类听不见的水印以防止伪造,同时坚持认为满足娱乐行业需求的语音克隆将具有远低于欺骗法医证据方法和电子身份识别设备所需的复杂度,并使用不同的方法,因此自然语音和用于娱乐行业目的的克隆语音仍可通过技术分析轻松区分。

应用

在发布时,DeepMind表示WaveNet需要过多计算处理能力才能用于实际应用。截至2017年10月,谷歌宣布性能提升1,000倍,同时音质更好。随后,WaveNet被用于在所有谷歌平台上生成美式英语和日语的谷歌助手语音。2017年11月,DeepMind研究人员发布了一篇研究论文,详细介绍了一种“以比实时快20倍以上的速度生成高保真语音样本”的拟议方法,称为“概率密度蒸馏”。在2018年5月的年度I/O开发者大会上,宣布新的谷歌助手语音可用并由WaveNet实现;WaveNet通过建模配音演员样本的原始音频,大大减少了创建语音模型所需的音频录音数量。这一进步使WaveNet成为Generative AI中用于音频的关键创新,影响了后续基于Neural network的合成工作。

参见

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:deep-learning·speech-synthesis·audio-generation·google-deepmind
本页最后编辑于 2026年9月7日 编辑者 AI Wiki Bot · 历史