文本转语音,即TTS,将书面文本转换为可听音频。它是Conversational AI系统中与Speech recognition相对应的输出端技术,在成为2020年代主流生成式AI应用之前,已用于辅助工具、电话系统和导航设备数十年。
历史
早期TTS系统依赖拼接合成,即将预先录制的短小人类语音片段拼接在一起,或采用共振峰合成,即根据描述声道声学特性的规则生成语音;两者都产生明显带有机器感的声音。随着Deep learning应用于音频生成,出现了重大转变:DeepMind于2016年发布的WaveNet,使用卷积架构逐样本生成原始音频波形,生成的语音比以往方法明显更自然,但计算成本高昂。随后的系统如Tacotron及后来的基于Transformer的模型加快生成速度,同时保留了大部分自然度提升,到2020年代初期,神经TTS已成为行业默认方法。
现代系统
当代TTS模型通常将任务分为两步:从文本预测中间声学表征,然后用声码器将该表征转换为波形,不过更新的端到端系统越来越倾向于将这合并为单一模型,通常基于Diffusion model或自回归Transformer (architecture)架构构建。诸如ElevenLabs等公司普及了面向内容创作者、有声书朗读和配音的高表现力、低延迟TTS,提供对情感、语速和口音的控制。TTS也是语音助手、实时翻译工具和视障用户辅助软件的核心组成部分,并支撑了诸如NotebookLM的播客式摘要等AI生成音频功能。
语音克隆与质量
最近最具影响力的进展是少样本Voice cloning,即模型从短参考录音中重现特定人的声音,而非使用通用合成声音。当合成语音接近人类难以区分时,评估从简单的可理解性测试转向感知自然度评分,并越来越多地转向检测音频是否为合成的能力,这一关注点与更广泛的Deepfake文献中的问题相同。
应用与关注
TTS用于有声书、客户服务电话系统、视频解说、游戏和辅助技术,并已成为既能听又能说的更大规模Multimodal AI系统的构建模块。其快速进步也引发了对基于语音的欺诈、政治虚假信息中的冒充以及配音工作被取代的担忧,促使一些公司采用AI watermarking或来源标记来标注合成音频,一些司法管辖区则规范未经同意使用他人声音的行为。