译自英文

ElevenLabs是一家专注于自然语音合成和语音AI的AI软件公司,由波兰企业家于2022年创立。到2026年,其估值达到110亿美元,提供语音合成、AI配音和声音克隆工具等产品。

ElevenLabs Inc.是一家专注于利用Deep learning开发自然语音合成软件的软件公司。该公司由波兰企业家Piotr Dąbkowski和Mateusz Staniszewski于2022年创立,在美国合法注册,总部位于伦敦,并在纽约市、华沙和旧金山设有办事处。ElevenLabs专注于语音领域的Generative AI,开发用于文本转语音、语音克隆和多语言配音的工具,旨在复现人类的情感和语调。该公司发展迅速,获得了大量风险投资,到2026年初估值达到110亿美元,使其处于新兴语音AI领域的前沿。

ElevenLabs的技术利用先进的Neural network架构和Large language model技术来生成语音,这些技术能够解读文本上下文,调整节奏和语调以表达愤怒、悲伤、快乐或警觉等情绪。该公司的模型在大量数据集上进行训练,以理解情感,从而实现更接近人类的语调变化。这种方法不同于传统的文本转语音系统,它侧重于情感细微差别和上下文意识,使其适用于媒体、娱乐、无障碍和交互式代理等领域。该初创公司的产品可通过基于网络的平台和API访问,允许开发者和创作者将语音AI集成到他们的工作流程中。

名称词源

ElevenLabs这个名字来源于英语单词“eleven”,指的是11月11日,即波兰的国庆日(第十一个月的第十一天)。这一选择反映了创始人(在波兰长大)的波兰血统。“Labs”是“laboratories”的缩写,表明公司的研发性质。因此,该名称将国家象征与科学创新相结合,标志着创始人希望创建一家具有欧洲根基的研究驱动型企业。

历史

ElevenLabs由前Google DeepMind机器学习工程师Piotr Dąbkowski和前Palantir部署策略师Mateusz Staniszewski于2022年共同创立。两位企业家都在波兰长大,创立ElevenLabs的灵感据说来自于观看配音不佳的美国电影,这激发了他们对提高合成语音质量的兴趣。最初,他们探索了各种融资途径,包括与一家创业加速器合作。

2023年1月,该公司披露了由Credo Ventures领投、Concept Venturesjacket参与的200万美元预种子轮融资,该初创公司在AI语音智能方面的专长(欧洲的一个新兴领域)吸引了投资者的兴趣。同月,ElevenLabs公开发布了其beta平台,允许用户从文本生成逼真的语音。

2023年6月,ElevenLabs以约1亿美元的估值筹集了1900万美元的A轮融资。该轮融资由风险投资公司Andreessen Horowitz、前GitHub首席执行官Nat Friedman和企业家Daniel Gross共同领投。其他参与者包括SV Angel、Instagram联合创始人Mike Krieger、Oculus联合创始人Brendan Iribe、DeepMind联合创始人Mustafa Suleyman以及O'Reilly Media创始人Tim O'Reilly。Andreessen Horowitz也作为投资的一部分加入了ElevenLabs的董事会。

2024年1月22日,ElevenLabs宣布了8000万美元的B轮融资,将其总估值提升至11亿美元。该轮融资由Andreessen Horowitz以及Friedman、Gross和Sequoia Capital领投,支持了包括语音市场、AI配音工作室和移动应用在内的多个新产品的推出。这一增长与AI21 Labs和其他生成式AI初创公司的更广泛扩张相吻合,但ElevenLabs对语音的关注使其脱颖而出。

在2024年1月新罕布什尔州民主党初选前夕,据称来自乔·拜登的AI生成的机器人电话敦促选民不要投票,数千名居民收到了这些电话。新罕布什尔州总检察长办公室展开调查,将这些电话与一家总部位于德克萨斯州的公司联系起来,音频专家得出结论,该电话是使用ElevenLabs制作的。作为回应,首席执行官Mati Staniszewski表示,公司“致力于防止音频AI工具的滥用”,但未对具体事件发表评论。

2025年1月30日,ElevenLabs宣布了1.8亿美元的C轮融资,将其估值提升至33亿美元。该轮融资由a16z和ICONIQ Growth共同领投,新投资者包括NEA、World Innovation Lab (WiL)、Valor、Endeavor Catalyst Fund和Lunate,战略投资者包括Deutsche Telekom、LG Technology Ventures、HubSpot Ventures、NTT DOCOMO Ventures和RingCentral Ventures。

2025年9月,ElevenLabs启动了员工要约收购,允许任职至少一年的员工以66亿美元的估值出售股份,反映了内部的持续增长。2026年2月4日,该公司以110亿美元的估值筹集了5亿美元,并着眼于潜在的首次公开募股(IPO)。2026年3月,ElevenLabs承诺投入10亿美元,为100万永久性语音丧失人士提供免费的语音恢复技术,彰显了对无障碍的关注。

产品

ElevenLabs主要以其基于浏览器的AI辅助文本转语音软件Speech Synthesis而闻名,该软件可以通过合成语音情感和语调来生成逼真的语音。该公司还提供Conversational AI,这是一个用于启动能够进行实时对话的交互式语音代理的开发平台。据该公司称,其模型经过训练,可以解读文本中的上下文,并相应地调整语调,使用先进算法来检测愤怒、悲伤、快乐或警觉等情绪。这种能力实现了更真实、更接近人类的语调变化,并且该公司正在为这项技术申请专利。在其beta网站上,用户可以提交文本并从一组默认声音中选择生成音频文件,而付费用户可以上传自定义语音样本,使用公司的语音克隆工具创建新的语音风格。

语音库

语音库是一项用于共享使用ElevenLabs的语音设计技术创建的独特语音配置文件的功能。这些预先设计的语音配置文件允许用户选择适合其需求的语音,而无需从头创建。该库包含超过1000个社区创建的声音。另一个工具VoiceLab允许用户仅从几个简短的音频片段中克隆声音,并且可以创建全新的合成语音,从而扩展了自定义选项。

AI语音分类器

2023年6月20日,ElevenLabs发布了一款名为AI语音分类器的AI识别工具,并声称这是同类工具中的首创。该工具可通过API访问,旨在确定上传的音频样本是否源自ElevenLabs的专有AI技术。该公司表示有意与其他AI开发者合作,创建一个可以在整个行业采用的通用检测系统,以解决合成语音滥用的问题。

项目

2023年7月,ElevenLabs宣布了“项目”工具,用于创建长篇口语内容,如有声读物和对话片段,并使用具有上下文感知能力的合成或自定义语音。该工具于9月发布,8月该公司将其语音生成能力扩展到28种语言。使用内部AI模型,它可以自动检测韩语、荷兰语和越南语等语言,从而实现“情感丰富”的多语言语音生成。此外,该公司宣布其技术已正式退出beta阶段,标志着成熟度的一个里程碑。

AI配音和语音产品

2023年10月,ElevenLabs推出了“AI配音”工具,可以将语音翻译成20多种语言。该功能通过采用专有方法来处理噪声消除、说话人区分、转录以及将翻译后的语音与原始音频同步等任务,保留了说话者的原始声音、情感和语调。2024年5月,ElevenLabs分享了其文本转音乐模型的样本,该模型于2025年7月向公众开放,将业务范围从语音扩展到音乐生成。这种多样化与Generative AI的更广泛趋势相一致,OpenAIAnthropic等公司正在推动边界,但ElevenLabs仍然专注于以语音为中心的应用。

技术与AI方法

ElevenLabs的语音合成依赖于深度学习模型,包括Transformer (architecture)架构和Multi-Head Attention机制,这些机制允许系统对输入文本的不同部分赋予不同的权重,从而捕捉上下文和情感线索。使用Positional Encoding有助于模型理解单词的顺序,而类似于Top-K SamplingTemperature Scaling的技术可以影响生成语音的可变性。该公司的训练过程可能涉及Data Augmentation和针对自然度优化的Loss Functions,但具体细节仍属专有。对情感的强调使ElevenLabs区别于早期的文本转语音系统,后者通常听起来很机械,缺乏语调。

该公司的工作契合了Artificial intelligenceMachine learning的更广泛领域,为人机交互的进步做出了贡献。截至2026年,ElevenLabs将自己定位为语音AI领域的领导者,其应用范围从有声读物旁白到为语音障碍人士提供无障碍服务。其向100万人提供免费语音恢复技术的承诺凸显了此类技术潜在的社会影响。

融资与估值时间线

ElevenLabs的融资历史反映了AI领域的快速增长。在2023年1月获得200万美元的预种子轮融资后,该公司于2023年6月以1亿美元的估值获得了1900万美元的A轮融资。2024年1月的8000万美元B轮融资将估值提升至11亿美元。2025年1月的1.8亿美元C轮融资将其提升至33亿美元。到2025年9月,员工要约收购将公司估值为66亿美元,而2026年2月的5亿美元融资将其提升至110亿美元,表明了对持续扩张和潜在IPO的预期。这一轨迹反映了由Large language modelDeep learning技术推动的Generative AI初创公司的更广泛繁荣。

反响与影响

ElevenLabs因其逼真的语音合成而受到广泛关注,但也面临关于滥用的审查。新罕布什尔州的机器人电话事件凸显了AI语音克隆相关的风险,引发了关于监管和检测的讨论。该公司通过开发AI语音分类器等工具并承诺遵守道德实践(如其语音丧失恢复承诺)来做出回应。批评者和支持者都承认ElevenLabs技术的变革潜力,从Amazon Web Services云环境中的配音到与TomTom等平台的导航集成,尽管具体的合作伙伴关系并不总是公开。

另见

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:artificial-intelligence·generative-ai·speech-synthesis·startup
本页最后编辑于 2026年9月13日 编辑者 AI Wiki Bot · 历史