WellSaid Labs는 기업 고객을 위한 인공지능 기반 음성 합성(TTS) 솔루션을 전문으로 하는 기술 회사이다. 2018년에 설립되어 워싱턴주 시애틀에 본사를 두고 있으며, 기업 교육, 마케팅, 제품 데모 및 기타 전문 미디어에서 사용할 수 있는 사실적이고 인간과 유사한 합성 음성을 만드는 데 중점을 둔다. 이 회사의 플랫폼은 딥러닝 모델을 활용하여 작성된 텍스트를 자연스러운 오디오로 변환하며, 기업에 기존 음성 녹음의 확장 가능한 대안을 제공한다.
이 회사는 OpenAI 및 Google DeepMind와 같은 주요 업체를 포함하는 생성형 AI 혁신의 광범위한 흐름에서 등장했다. WellSaid Labs는 일반 목적의 언어 모델이 아닌 음성 합성에만 집중함으로써 차별화된다. 이 회사의 기술은 신경망 아키텍처, 특히 트랜스포머 기반 모델 위에 구축되어 미묘한 억양, 속도 및 감정 표현을 갖춘 음성을 생성할 수 있다. 이러한 집중 덕분에 이 회사는 교육, 기술 및 미디어와 같은 산업에 서비스를 제공하면서 다른 전문 제공업체와 경쟁하며 기업 TTS 시장에서 틈새를 개척할 수 있었다.
역사 및 설립
WellSaid Labs는 비즈니스 환경에서 고품질 합성 음성에 대한 증가하는 수요를 인식한 Michael H.와 다른 공동 창업자들에 의해 설립되었다. 이 회사는 2019년에 첫 제품을 출시했으며, 처음에는 스튜디오 녹음의 물류적 부담 없이 빠른 음성 해설 제작이 필요한 콘텐츠 제작자와 기업 팀을 대상으로 했다. 초기 사용자에는 교육 자료를 현지화하려는 e-러닝 플랫폼과 소프트웨어 회사가 포함되었다.
2021년까지 WellSaid Labs는 머신 러닝 알고리즘의 지속적인 개선에 힘입어 음성 라이브러리를 여러 언어와 억양으로 확장했다. 이 회사는 2022년에 AI 인프라에 중점을 둔 벤처 캐피털 회사들이 주도하는 시리즈 A 자금 조달을 완료하여 추가 연구 개발을 가능하게 했다. 2024년 기준으로 WellSaid Labs는 약 1,000개 이상의 기업 고객에게 서비스를 제공하고 있으며, 약 50명의 직원으로 구성된 팀을 보유하고 있다.
기술 및 플랫폼
WellSaid Labs의 핵심 기술은 딥러닝 및 시퀀스-투-시퀀스 모델을 사용하는 독점 TTS 엔진이다. 사전 녹음된 음소를 이어 붙인 초기 연결형 TTS 시스템과 달리 WellSaid의 접근 방식은 종단 간 신경 합성을 사용한다. 이를 통해 문장 길이나 강세 변화와 같은 맥락에 적응하는 더 유창한 음성이 가능하다. 모델은 전문 성우의 대규모 데이터 세트로 훈련되며, 라이선스 및 윤리적 사용에 세심한 주의를 기울인다.
플랫폼은 사용자가 텍스트를 입력하고 음성을 선택하며 실시간으로 오디오를 생성할 수 있는 웹 기반 인터페이스를 제공한다. 속도, 음높이 및 일시 정지와 같은 미세 조정 매개변수를 지원하여 제작자에게 전달 방식에 대한 제어권을 제공한다. 개발자를 위해 WellSaid는 기존 워크플로우와 통합되는 API를 제공하여 고객 지원 봇이나 대화형 음성 응답 시스템과 같은 애플리케이션에서 자동 음성 생성을 가능하게 한다. 이 회사는 또한 일관된 브랜드 음성을 원하는 기업을 위한 "음성 복제" 기능을 제공하지만, 오용을 방지하기 위해 엄격한 검증을 거친다.
기업 애플리케이션
WellSaid Labs는 주로 확장 가능한 오디오 콘텐츠가 필요한 대규모 조직에 서비스를 제공한다. 일반적인 사용 사례로는 자주 업데이트해야 하는 내레이션 모듈이 있는 기업 교육 비디오, 마케팅 팀을 위한 제품 설명 비디오, 시각 장애인을 위한 화면 판독기와 같은 접근성 기능이 있다. 이 기술은 게임 산업의 캐릭터 대화와 뉴스룸의 자동 뉴스 속보에도 사용된다.
Amazon Web Services Polly 또는 Azure Cognitive Services와 같은 경쟁업체와 비교하여 WellSaid Labs는 고객 대면 콘텐츠에 중요한 더 높은 자연스러움과 감정 범위를 강조한다. 가격 모델은 구독 기반이며 사용 시간에 따른 등급이 있으며, 보안에 민감한 고객을 위한 전용 지원 및 온프레미스 배포 옵션이 포함된 기업 요금제를 제공한다.
윤리적 고려 사항 및 향후 방향
다른 생성형 AI 시스템과 마찬가지로 WellSaid Labs는 음성 진위성과 동의에 관한 윤리적 과제에 직면해 있다. 이 회사는 훈련에 사용되는 녹음에 대해 성우의 명시적 허가를 요구하고 승인 없이 실제 개인을 사칭하는 음성 생성을 금지하는 등 안전 장치를 구현했다. 또한 Xerox PARC 연구 커뮤니티와 같은 조직이 제안한 표준에 맞춰 딥페이크 규제에 관한 업계 논의에 참여하지만, 학술 연구소와 공식 파트너십은 없다.
향후 WellSaid Labs는 실시간 대화 시스템과 같은 더 대화형이고 맥락에 민감한 음성 생성을 가능하게 하기 위해 대규모 언어 모델과의 통합을 모색하고 있다. 또한 유럽과 아시아 시장을 대상으로 다국어 확장에 투자하고 있다. 이 회사는 비공개 회사로 남아 있으며 2025년 기준 IPO에 대한 공개 계획이 없고, 지연 시간을 줄이고 음성 다양성을 개선하기 위해 모델을 계속 반복하고 있다.
같이 보기
참고 문헌
- 회사 웹사이트 및 보도 자료 (2025년 접속).
- AI 음성 기술에 관한 업계 보고서 (2023-2024).