Descript는 AI 기반 비디오 및 팟캐스트 편집 플랫폼으로 알려진 소프트웨어 회사입니다. 2017년에 설립된 이 회사는 전통적인 타임라인 기반 편집을 재구성하여 사용자가 전사된 텍스트 문서를 통해 오디오와 비디오를 편집할 수 있도록 하는 도구를 개발했습니다. 이 플랫폼은 접근성과 자동화 기능 덕분에 팟캐스터, 비디오 크리에이터, 마케팅 팀에 널리 사용됩니다.
Descript의 핵심 기술은 Artificial intelligence 및 Machine learning 모델을 통합하여 자동 음성 인식, 화자 식별, 콘텐츠 조작을 수행합니다. 음성을 편집 가능한 텍스트로 변환함으로써 Descript는 사용자가 기록을 잘라내거나 재배열하거나 삭제할 수 있게 하며, 단순히 대본을 편집하는 것만으로도 가능합니다. 이 접근 방식은 기존 편집 소프트웨어와 관련된 학습 곡선을 줄이며 Descript를 창의적인 도구 시장에서 주목할 만한 플레이어로 자리매김했습니다.
역사와 설립
Descript는 2017년에 Groupon을 공동 설립한 Andrew Mason과 엔지니어 및 디자이너 팀에 의해 설립되었습니다. 회사는 캘리포니아 샌프란시스코에 본사를 두고 있습니다. Descript는 2018년에 첫 공개 베타 버전을 출시했으며, 초기에는 팟캐스트 편집에 중점을 두었습니다. 이 제품은 Adobe Audition이나 Avid Pro Tools와 같은 기존 도구의 타임라인 기반 작업 흐름과는 다른 혁신적인 텍스트 기반 편집 인터페이스 덕분에 빠르게 인기를 얻었습니다.
2020년에 Descript는 Overdub을 도입했는데, 이는 사용자가 자신의 녹음에서 합성 음성 클론을 만들 수 있는 기능입니다. Deep learning 모델에 기반한 이 기능은 사용자가 잘못된 발음을 수정하거나 다시 녹음하지 않고 새로운 내레이션을 추가할 수 있게 합니다. Overdub는 나중에 Voice Cloning으로 이름이 변경되었으며, 더 넓은 AI 도구 모음의 일부가 되었습니다. 2021년까지 Descript는 Andreessen Horowitz를 주축으로 한 5천만 달러 규모의 Series C 펀딩을 포함한 상당한 벤처 자금을 모집하여 총 펀딩 금액을 1억 달러 이상으로 늘렸습니다.
주요 기능 및 제품
Descript의 주요 제품은 전사, 오디오 편집, 비디오 편집, 화면 녹화, 그리고 게시를 결합한 원-스톱 편집기입니다. 이 플랫폼은 여러 오디오 및 비디오 소스를 동시에 처리할 수 있는 멀티 트랙 편집을 지원합니다. 한 가지 눈에 띄는 기능은 "um"과 "uh"와 같은 필러 단어를 한 번의 클릭으로 제거할 수 있는 기능으로, 이 작업은 기존에는 타임라인을 수동으로 탐색해야 했던 과제였습니다.
디또 다른 주요 기능은 Studio Sound로, Neural network 알고리즘을 사용하여 배경 소음, 에코, 반사를 제거하여 사운드 품질을 향상시킵니다. 이 도구는 비전문 환경에서 녹음하는 팟캐스터에게 특히 유용합니다. Descript는 또한 여러 팀원이 미디어 파일에 대해 Google Docs와 유사하게 실시간으로 댓글 달고, 편집하며 공유할 수 있는 협업 작업 공간을 제공합니다.
2023년에 Descript는 자동 콘텐츠 굽기, 소셜 미디어용 클립 생성, 텍스트 블록을 드래그하여 비디오의 전체 섹션을 이동할 수 있는 텍스트 기반 비디오 편집기와 같은 AI 기반 기능을 도입하며 AI 성능을 확장했습니다. 그리고 해제 YouTube, Zoom, QuickTime과 같은 인기 플랫폼과의 통합을 통해 직접 녹화 및 게시 기능을 제공했습니다.
기술 및 AI 통합
Descript의 기본 기술은 Large language model 및 Transformer (architecture) 아키텍처에 의존하여 전사 및 언어 이해를 수행합니다. 음성 인식 시스템은 다양한 악센트와 언어를 처리하기 위해 다양한 데이터로 훈련되었지만, 플랫폼은 기본적으로 영어를 지원합니다. 회사는 또한 Generative AI를 콘텐츠 제작에 활용하는 것을 탐구했습니다, 예를 들어 전사본에서 쇼 노트나 소셜 미디어 캡션을 생성하는 것입니다.
Voice Cloning 기능은 Neural network를 사용하여 사용자의 음성 샘플을 학습시켜 원래 화자의 톤과 리듬에 맞는 음성을 합성합니다. 이 기술은 음성 진본성에 관한 윤리적 고려 사항을 제기했으며, Descript는 명시적 동의 요구 및 합성 오디오에 대한 워터마킹과 같은 보호 장치를 구현했습니다. 회사는 자사, AI 도구가 인간 창의성인을 향상시키기 위해 설계된 것이지 그 자체를 대체하기 위한 것은 아니라고 강조합니다.
시장 위치 및 경쟁
Descript는 Adobe Premiere Pro 및 Final Cut Pro와 같은 전통적인 편집 소프트웨어뿐만 아니라 Autter.ai 및 Rev와 같은 새로운 AI 기반 도구와도 경쟁합니다. 차별화 포인은 전사와 편집의 매끄러운 통합에 있으며, 이는 비전문 사용자와 소규모 팀에게 매력을 제공합니다. 2024년 기준 Descript는 매체 다뉴얼, 교육 기관, 독립 크리에이터를 포함한 10만 명 이상의 유료 고객을 보고했습니다.
회사는 일반적인 목적의 오디오 처리를 제공하는 AI 연구조직인 .Descript의 오픈AI와 같은 경쟁도 직면했지만, 사용자 친화 편집 워크플로우에 대한 집중은 틈새에서 유지되고 있습니다. 2024년, Descript는 기업 계층에 대한 가격 체계를 도입했으며, 이는 고급 버전을 보안 기능 및 전용 지원을 제공하며, 대규모 조직으로의 확장을 시사합니다.
미래 방향
Descript는 전사 정확성을 향상시키고 언어 지원을 확장하기 위해 계속해서 머신러닝 연구에 투자하고 있습니다. 회사는 장시간 녹음에서 하이라이트 릴 생성과 같은 자동 비디오 편집 기능을 활용하는 생성형-AI 기능 개발을 암시했습니다. 구체적인 제품 로드맵은 공개되지 않았지만, Descript의 현재 방식은 실시간 협업 및 AI 기반 후반 작업 생산에 대한 중점이 커지고 있음을 시사합니다.
2025년 현재, Descript remains는 비상장 회사이며, 공개 상장 계획은 없습니다. CEO 이상 등의 경수도를 포함한 기업가 등 리더십 팀은 지속 가능한 성장과 제품 혁신에 초 가장 햇습니다. 창의 도구 분야에서 AI의 전반적인 추진은 Descript의 향후 개발에 큰 영향을 미칠 것입니다. 특히, artificial-audio-medium 모델이 매체 콘텐츠의 맥락과 의지를 더 잘 이해할 수 있게 되기에 진 것으로 보입니다.