语音克隆是文本转语音的一项专门应用,其中模型学习从某个人录音样本中重现其特定的声音特征,如音色、音高和说话风格,然后以该声音生成任意文本的新语音。早期系统需要每位说话者数分钟或数小时的清晰录音;到2020年代初,少样本甚至几秒的克隆已实现商业化
技术发展
传统TTS系统从头开始针对单一说话者的声音进行训练,这种方法对数据的需求过高,难以从短样本进行克隆。语音克隆之所以变得实用,是因为神经TTS模型被构建为将“说了什么”与“谁在说话”分离开来,通常是通过在从短参考片段提取的紧凑说话者嵌入上调节共享生成模型来实现的.这使得一个训练好的系统能够以任何有短样本可用的说话者的风格生成语音,而无需为每种声音配备专用模型.2020年代初,扩散模型和基于变换器的音频生成的改进将所需参考音频从几分钟缩短到几秒,同时提高了自然度和表现力,包括保留情感和口音
应用
语音克隆在配音电影和游戏到其他语言时保留演员声音、恢复因疾病失去说话能力者的声音、个性化无障碍工具以及内容创作(如以作者本人声音叙述的有声书)方面具有合法用途.包括ElevenLabs在内的公司围绕这些用例构建了商业产品,提供声音市场及配音管道,被媒体和本地化公司使用
同意、欺诈和滥用
使合法配音成为可能的同一技术也使得冒充成为可能.克隆声音已被用于冒充亲属或高管的诈骗电话以索取钱财、在政治背景下旨在误导公众的伪造音频片段中,以及未经许可或补偿地商业使用配音演员或公众人物的声音,这一问题与更广泛的人工智能版权和肖像权辩论相关.包括2024年美国选举周期中人工智能生成的冒充政治候选人声音的机器人电话在内的高调事件,加速了监管关注.多个司法管辖区和州已采取措施,将公开权及反欺诈法律明确扩展到合成声音,一些AI公司也增加了同意验证步骤、使用限制以及人工智能水印到其克隆产品中作为回应
检测与缓解
由于克隆声音现在可能难以让人类与真实录音区分开来,金融机构和处理敏感声音认证的公司不得不重新考虑声音作为安全因素,法证音频检测已成为更广泛识别合成媒体努力中的活跃领域,与视频和图像深度伪造检测并列,属于人工智能安全更广泛领域的一个话题.截至2020年代中期,检测工具落后于生成质量,语音克隆被广泛引述为生成式AI中更直接有害的应用之一,因为其在欺诈场景中成本低且说服力强.