ElevenLabs是一家语音AI初创公司,由前Palantir和Google工程师Piotr Dabkowski和Mati Staniszewski于2022年创立,致力于开发神经文本转语音和语音克隆技术。该公司的模型能以数十种语言生成高度自然的合成语音,并能从短音频样本中克隆特定人物的声音,使其成为面向消费者和企业级语音生成工具的主要供应商之一,同时提供实时配音和多语言本地化功能,这些功能部分依赖于语音识别。
历史
ElevenLabs于2023年初推出首个公开测试版,并迅速因其语音质量而受到关注,许多听众发现其难以与人类录音区分,这相比早期TTS系统有了显著飞跃。该公司在2023年和2024年完成了多轮融资,到2024年估值超过10亿美元,并在2025年继续增长,通过额外融资支持进一步的模型开发和更广泛的产品套件,包括配音工作室、将文本和文章转换为语音的阅读器应用,以及供开发人员将语音集成到其他应用中的API访问。
技术与产品
ElevenLabs的核心产品结合了文本转语音引擎和语音克隆工具,使用户能够从几分钟(在某些模式下甚至几秒钟)的参考音频中创建语音的合成副本。该公司建立了一个语音库市场,创作者可以在其中授权其克隆语音,并扩展到语音到语音转换、音效生成和多语言配音,这些功能在跨语言时保留说话者的原始声音和情感语调。这些产品用于有声书制作、视频游戏本地化、播客和无障碍工具,并与大型实验室将语音集成到更广泛的多模态助手产品形成竞争。
担忧与保障措施
ElevenLabs语音克隆的真实感早期引发了对其被滥用于欺诈、政治虚假信息和非自愿冒充的担忧,这与对深度伪造的更广泛忧虑相呼应。2023年初,克隆的名人声音被用于生成冒犯性音频片段并在网上传播,促使该公司限制免费层级的克隆功能并增加审核。ElevenLabs此后实施了保障措施,包括对生成音频进行AI 水印处理、建立自愿加入的禁止语音列表以阻止未经同意冒充公众人物,以及对专业语音克隆的验证要求。该公司的成长在关于更广泛生成音频浪潮的讨论中经常被提及,与音乐生成工具(如Suno)并列,其克隆技术也经常在关于AI语音欺诈骗局以及合成媒体溯源这一更广泛挑战的报道中被引用。