Synthesia는 생성형 인공지능을 영상 제작에 특화한 기술 기업이다. 이 플랫폼은 사용자가 카메라, 배우, 또는 전통적인 영상 편집 도구 없이도 사실적인 AI 아바타가 텍스트 대본을 말하는 전문적인 영상을 제작할 수 있게 한다. 이 회사는 주로 기업 고객을 대상으로 직원 교육, 내부 커뮤니케이션, 고객 메시징 등의 용도에 초점을 맞춘다.
이 회사는 2017년에 AI와 컴퓨터 비전 분야의 학문적 배경을 가진 팀에 의해 설립되었다. 초기 개념은 머신러닝과 영상 합성에 관한 연구에서 비롯되었으며, 이후 영상 제작의 복잡성을 단순화하는 상용 제품으로 발전했다. 본사는 런던에 있으며, 뉴욕과 로스앤젤레스에 사무소를 두고 있다.
핵심 기술
Synthesia의 핵심 기술은 신경망, 특히 음성 애니메이션과 이미지 합성을 위해 훈련된 딥러닝 모델에 중심을 둔다. 이 시스템은 텍스트 대본을 처리하여 고급 텍스트-음성 변환 모델을 통해 음성으로 변환한 다음, 해당 대본을 말하는 아바타의 영상을 생성한다. 아바타의 입술 움직임, 표정, 미세한 머리 움직임은 오디오와 동기화되어 설득력 있고 자연스러운 프레젠테이션을 만든다.
이 플랫폼은 컴퓨터 비전과 대규모 언어 모델에 관한 공개 및 비공개 연구를 활용하는 독자적인 기술 스택 위에 구축되었다. 주요 기능에는 단일 텍스트 프롬프트에서 자막을 번역하고 오디오와 말하는 패턴을 재합성하여 140개 이상의 언어로 영상을 생성하는 능력이 포함된다. 기본 모델은 독자적인 데이터로 지속적으로 개선되며, 사실성, 감정 표현 범위, 다국어 유창성 향상에 중점을 둔다.
제품 발전
Synthesia의 주요 제품은 구독 서비스로 판매되는 SaaS 플랫폼이다. 이 회사는 2019년 후반에 일부 선정된 디자인 파트너를 대상으로 한 초기 베타 접근 이후, 전체 영상 생성 제품을 대중에게 공개했다.
2023년에는 아바타 기반 템플릿에서 더 넓은 화면 녹화 및 화면 동반 기능 세트로 전환하여 영상과 화면 콘텐츠 제작을 통합하는 중요한 이정표가 있었다. 이 회사는 또한 다양한 배경을 가진 큐레이션된 디지털 배우 포트폴리오를 개발했으며, 2024년에 출시된 기능인 짧은 웹캠 녹화에서 맞춤형 아바타를 만들 수 있게 허용한다.
주요 제품 출시는 다음과 같다:
- 2019: 제한된 아바타 세트를 갖춘 텍스트-비디오 플랫폼의 공개 베타.
- 2020: 다국어 지원 및 엔터프라이즈급 기능 출시.
- 2023: AI 아바타 맞춤화 및 향상된 편집기를 갖춘 Synthesia 2.0 플랫폼 도입.
- 2024: Synthesia 모바일 제공 및 고급 프레젠테이션 기능 출시.
비즈니스 및 자금 조달
이 회사는 AI 영상 도구에 대한 높은 시장 관심을 반영하여 상당한 벤처 캐피털 자금을 유치했다. Synthesia는 2020년 12월에 벤처 캐피털 회사가 주도하는 시리즈 A 자금으로 1,250만 달러를 모금했으며, 2022년 3월에는 5,000만 달러 규모의 시리즈 B 라운드를 확보했다. 이 회사는 2023년 6월에 9,000만 달러 규모의 시리즈 C 자금 조달 이후 10억 달러의 기업 가치를 달성했다. 투자자에는 OpenAI의 스타트업 펀드와 엔터프라이즈 소프트웨어에 초점을 맞춘 벤처 캐피털 회사들이 포함된다.
비즈니스 모델은 구독 기반이며, 가격 등급은 사용량, 아바타 수, 지원 언어에 따라 결정된다. 2024년 초 기준으로 Synthesia는 포춘 100대 기업의 절반 이상을 포함하여 50,000개 이상의 비즈니스 고객을 보유했다고 보고했다. 수익은 연간 계약과 사용량 기반 할당량에서 발생하며, 이 회사는 지속 가능한 단위 경제성에 초점을 맞춘 수익성 있는 성장 기업으로 자리매김했다.
연구 및 개발
이 회사는 활발한 연구 부서를 유지하며, 말하는 머리 생성 및 오디오 기반 립싱크 분야에서 논문을 발표한다. Synthesia는 학계에서 사용되는 VoxCeleb 기반 말하는 머리 벤치마크와 같은 데이터 세트를 공개하는 등 오픈소스 연구에 기여했다. 또한 학술 기관과 협력하며 주요 대학의 교수들로 구성된 연구 자문 위원회를 두고 있다.
2024년에 Synthesia는 초기 2D 아바타 접근 방식에서 벗어나 더 역동적이고 제어 가능한 아바타 움직임을 가능하게 하는 자체 기반 비디오 모델을 발표했다. 이 모델은 장면 내에서 즉흥적으로 상호작용할 수 있는 완전한 대화형 AI 배우를 만드는 장기 목표를 향한 한 단계이다.
책임 있는 AI 및 윤리
딥페이크 기술의 오용 가능성을 고려하여 Synthesia는 거버넌스 조치를 구현했다. 이 회사는 기술과 정책을 검토하기 위해 외부 윤리학자들로 구성된 독립 기관인 AI 위원회를 두고 있다. 또한 맞춤형 아바타 생성에 대한 명시적 동의를 요구하며, AI 생성 콘텐츠를 식별하기 위한 워터마킹 기술을 사용하고, "책임 있는 AI" 프레임워크를 발표했다.
이 회사는 합성 콘텐츠 연합의 회원이며 진정성과 투명성에 대한 업계 표준을 옹호한다. 이러한 조치는 혁신과 허위 정보 캠페인 또는 무단 사칭과 같은 기만적 사용 방지 사이의 균형을 맞추기 위해 설계되었다.
영향 및 시장 위치
AI 영상 생성 시장은 텍스트-비디오 및 아바타 생성 분야의 플레이어들이 존재하는 경쟁적인 시장이다. Synthesia는 엔터프라이즈 신뢰성, 다국어 능력, 그리고 API를 통한 Microsoft Azure 및 Amazon Web Services와 같은 인기 있는 기업 도구와의 통합에 초점을 맞춤으로써 차별화된다. 주요 경쟁사에는 다른 AI 아바타 기업과 최근 이 분야에 진입한 대형 기술 기업들이 포함되지만, Synthesia는 기업 교육 부문에서 선점자 이점을 유지하고 있다.
이 회사의 기술은 금융, 제조, 소매와 같은 분야에서 채택되어 교육 콘텐츠를 표준화하고 고객 커뮤니케이션을 개인화하는 데 사용된다. 내부 보고서에 따르면 고객들은 영상 제작 시간이 며칠에서 몇 분으로 단축되는 등 상당한 시간 및 비용 절감을 보고했다.
향후 방향
Synthesia는 2D 영상을 넘어 몰입형 경험으로 확장하겠다는 공개적인 야망을 가지고 있다. 이러한 계획에는 가상 현실 및 증강 현실을 위한 더 사실적인 아바타와 실시간 커뮤니케이션 플랫폼과의 통합이 포함된다. 이 회사는 또한 아바타를 더 상호작용적이고 상황 인식적으로 만들기 위해 고급 추론 및 캐릭터 대화에 트랜스포머 기반 모델을 사용하는 것을 탐구하고 있다.
2025년 기준으로 Synthesia는 엔터프라이즈 제공을 계속 확장하고 있으며, 판매 인력 확대와 AI 연구 팀 강화에 계획을 두고 있다. 또한 추론 비용을 줄이고 실시간 성능을 개선하기 위해 주요 하드웨어 및 클라우드 제공업체와의 파트너십에 집중하고 있다.