ElevenLabs는 2022년 전 Palantir 및 Google 엔지니어였던 Piotr Dabkowski와 Mati Staniszewski가 설립한 음성 AI 스타트업으로, 신경망 기반 텍스트 음성 변환 및 음성 복제 기술을 개발한다. 이 회사의 모델은 수십 개 언어로 매우 자연스러운 합성 음성을 생성하며, 짧은 오디오 샘플에서 특정인의 목소리를 복제할 수 있어, 실시간 더빙 및 음성 인식에 부분적으로 의존하는 다국어 현지화 기능과 함께 소비자 및 기업 대상 음성 생성 도구의 선두 제공업체 중 하나로 자리매김하고 있다.
역사
ElevenLabs는 2023년 초 첫 공개 베타를 출시했으며, 많은 청취자가 인간 녹음과 구별하기 어렵다고 느낀 음성 품질로 빠르게 주목을 받았는데, 이는 초기 세대 TTS 시스템에 비해 현저한 도약이었다. 이 회사는 2023년과 2024년에 걸쳐 연속 투자 유치를 진행하여 2024년까지 기업 가치가 10억 달러를 넘었고, 2025년에도 추가 투자 라운드로 모델 개발과 더빙 스튜디오, 텍스트 및 기사를 음성으로 변환하는 리더 앱, 개발자가 다른 애플리케이션에 음성을 통합할 수 있는 API 접근을 포함한 더 넓은 제품군을 지원하며 성장을 계속했다.
기술 및 제품
ElevenLabs의 핵심 제공 사항은 텍스트 음성 변환 엔진과 음성 복제 도구를 결합한 것으로, 사용자는 몇 분 또는 일부 모드에서는 몇 초의 참조 오디오로 음성의 합성 복제본을 만들 수 있다. 이 회사는 크리에이터가 복제된 음성을 라이선스할 수 있는 Voice Library 마켓플레이스를 구축했으며, 음성 간 변환, 음향 효과 생성, 그리고 화자의 원래 목소리와 감정 톤을 여러 언어에 걸쳐 보존하는 다국어 더빙으로 확장했다. 이러한 제품은 오디오북 제작, 비디오 게임 현지화, 팟캐스팅, 접근성 도구에 사용되며, 더 넓은 멀티모달 어시스턴트에 음성을 통합하는 대형 연구소의 제공 사항과 경쟁한다.
우려 및 안전장치
ElevenLabs 음성 복제의 사실성은 사기, 정치적 허위 정보, 비동의 사칭에 대한 오용 우려를 초기부터 불러일으켰으며, 이는 딥페이크에 대한 더 넓은 우려를 반영한다. 2023년 초, 복제된 유명인 목소리가 온라인에 유포된 공격적인 오디오 클립을 생성하는 데 사용되었고, 이로 인해 회사는 무료 티어 복제를 제한하고 중재를 추가했다. 이후 ElevenLabs는 생성된 오디오의 AI 워터마킹, 동의 없는 공인 사칭을 차단하는 옵트인 금지 목소리 목록, 전문 음성 복제에 대한 검증 요구 사항을 포함한 안전장치를 구현했다. 이 회사의 성장은 음악 생성 도구(예: Suno)와 함께 더 넓은 생성 오디오 물결에 대한 논의에서 자주 언급되며, 그 복제 기술은 AI 기반 음성 사기 범죄와 합성 미디어의 출처 추적이라는 더 넓은 과제에 대한 보도에서 정기적으로 인용된다.