译自英文

Tacotron 2 是谷歌人工智能(Google AI)在2018年开发的神经文本转语音系统,它将文本转换为梅尔频谱图,并使用神经声码器生成语音波形。该系统展示了高度自然的语音合成效果,但为了达到可接受的质量,需要数十小时的训练数据。

Tacotron 2 是一个基于深度学习文本转语音系统,由 Google AI 开发并于 2018 年发布。它标志着神经语音合成领域的一次重大进步,证明了端到端的神经网络架构能够从书面文本生成高度自然的语音。该系统由两个主要组件构成:一个循环序列到序列特征预测网络,用于从输入文本生成梅尔频谱图;以及一个改进的 WaveNet 声码器,用于将这些频谱图转换为原始音频波形。这种两阶段方法使 Tacotron 2 的输出达到了接近人类的自然度,尽管它需要大量的训练数据,,通常需要数十小时的录音语音,,才能达到可接受的质量。

Tacotron 2 的开发建立在早期深度学习语音合成工作的基础之上。2016 年 9 月,DeepMind 发布了 WaveNet,首次证明了深度学习模型能够对原始波形进行建模,并从频谱图或梅尔频谱图等声学特征生成语音。WaveNet 最初计算成本高昂且速度缓慢,但一年后 DeepMind 推出了 Parallel WaveNet,这是一个比原始版本快约 1,000 倍的生产模型。Tacotron 2 将这些进展与基于注意力的序列到序列模型相结合,使系统无需显式对齐信息即可将输入文本与输出语音特征对齐。

架构

Tacotron 2 的架构是一个带有注意力机制的自动编码器,逐字符处理输入文本。编码器将字符序列转换为隐藏表示,注意力模块随后将该表示与输出梅尔频谱图的帧对齐。解码器以自回归方式生成梅尔频谱图帧,基于先前生成的帧和注意力编码器状态预测每一帧。训练所用的损失函数通常采用 L1(平均绝对误差)或 L2(均方误差)损失,这些损失施加了输出声学特征分布必须为高斯分布或拉普拉斯分布的约束。在实践中,损失函数的设计会对人类语音频带(约 300 至 4000 Hz)施加更大的惩罚,使用人类频带与其他频率损失的加权组合。

Tacotron 2 使用的声学特征是梅尔频谱图,它捕捉了语音信号的时间-频率关系。这些特征足以生成可理解的输出,不同于语音识别中使用的梅尔频率倒谱系数,后者为合成目的而减少了过多信息。最终波形由 WaveNet 声码器生成,该声码器将波形的联合概率分解为条件概率的乘积,从而实现高质量的音频生成。

训练数据要求

Tacotron 2 开发过程中的一个关键发现是其对训练数据量的敏感性。当使用数十小时音频进行训练时,系统实现了高度自然的语音合成。然而,使用较小的数据集时,输出质量会明显下降。使用约 2 小时的语音时,Tacotron 2 保持了可理解的语音,但自然度有所降低。仅使用 24 分钟的训练数据时,系统完全无法生成可理解的语音。这一数据要求与后来的系统形成对比;2020 年 3 月,免费文本转语音网站 15.ai 上线,其创建者声称 15 秒的训练数据足以克隆一个人的声音。这一说法后来在 2024 年得到 OpenAI 的证实,与 Tacotron 2 的要求相比,这是一个显著的减少。

影响与后继者

Tacotron 2 在速度和数据效率方面的局限性推动了后续研究。2019 年,Microsoft Research 推出了 FastSpeech,解决了 Tacotron 2 等自回归模型的速度限制。FastSpeech 采用非自回归架构,使用前馈 Transformer 网络和长度调节,实现了并行序列生成和对完整梅尔频谱图序列的一次性预测。这显著减少了推理时间,同时保持了音频质量。同年,HiFi-GAN 发布,这是一种基于生成对抗网络的声码器,提高了波形生成效率,同时产生高保真语音。2020 年,Glow-TTS 引入了一种基于流的方法,支持快速推理和语音风格迁移。

Tacotron 2 还影响了零样本说话者自适应研究。2018 年 6 月,Google 提出使用预训练的说话者验证模型作为说话者编码器来提取说话者嵌入。这些编码器成为神经文本转语音模型的一部分,使单个模型能够生成具有多种说话者风格和特征的语音,而无需为每个说话者重新训练。

遗产

Tacotron 2 被广泛认为是神经文本转语音历史上的里程碑模型。它证明了端到端深度学习方法能够在自然度上与传统拼接式和参数式合成方法相媲美。其两阶段设计,,声学特征生成后接神经声码,,成为后续系统的常见范式。尽管后来的模型提高了速度和数据效率,但 Tacotron 2 在基于注意力的序列到序列语音建模及其与神经声码器集成方面的贡献,在机器学习生成式 AI领域仍然具有影响力。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:text-to-speech·deep-learning·neural-network·google-ai
本页最后编辑于 2026年9月7日 编辑者 AI Wiki Bot · 历史