Deepgram은 자동 음성 인식(ASR) 및 오디오 인텔리전스 솔루션을 개발하는 음성 기술 회사이다. 이 회사는 개발자와 기업을 대상으로 음성-텍스트 변환, 음성 AI, 오디오 분석을 위한 클라우드 기반 API를 제공한다. Deepgram은 전직 Bridgewater Associates 엔지니어였던 Scott Stephenson이 2015년에 설립했으며, 본사는 캘리포니아주 샌프란시스코에 있다.
역사
Deepgram은 음성 인식에 딥러닝을 적용할 목적으로 2015년에 설립되었다. 이 회사는 처음에 오디오 처리를 위한 대규모 신경망 구축에 주력했다. 2018년, Deepgram은 Nvidia가 주도하고 다른 투자자들이 참여한 시리즈 A 투자에서 1,200만 달러를 유치했다. 이 자금은 연구 개발 역량을 확장하는 데 사용되었다. 2020년, 이 회사는 클라우드 기반 음성 인식 API를 출시하여 더 넓은 사용자층이 기술에 접근할 수 있게 했다. 2021년까지 Deepgram은 Tiger Global Management가 주도한 시리즈 B 투자에서 추가로 4,700만 달러를 유치하여 총 투자 금액이 6,000만 달러를 넘어섰다.
기술
Deepgram의 핵심 기술은 딥러닝 및 신경망 아키텍처를 기반으로 한다. 이 회사는 트랜스포머 모델과 시퀀스-투-시퀀스 프레임워크를 사용하여 오디오 신호를 처리한다. 음소 기반 모델에 의존하는 기존 ASR 시스템과 달리, Deepgram의 접근 방식은 엔드-투-엔드 학습을 사용하여 시스템이 오디오를 텍스트로 직접 매핑할 수 있게 한다. 이 방법은 다양한 억양, 배경 소음, 도메인별 어휘를 처리하도록 설계되었다. Deepgram은 또한 화자 분리, 감정 분석, 키워드 감지와 같은 기능도 제공한다. 이 플랫폼은 여러 언어를 지원하며 클라우드 또는 온프레미스 환경에 배포할 수 있다.
제품 및 서비스
Deepgram은 다음과 같은 여러 제품을 제공한다:
- 음성-텍스트 변환 API: 실시간 또는 배치 모드로 오디오를 텍스트로 변환한다.
- 음성 AI: 음성 비서 및 대화형 음성 응답 시스템을 구현한다.
- 오디오 인텔리전스: 감정, 주제, 개체에 대한 오디오 분석을 제공한다.
- Nova: 실시간 애플리케이션에 최적화된 빠르고 정확한 음성 인식 모델이다.
- Aurora: 소음이 많은 환경에서 높은 정확도의 전사를 위해 설계된 모델이다.
이러한 서비스는 REST API 및 다양한 프로그래밍 언어용 SDK를 통해 제공된다. Deepgram의 가격은 사용량 기반이며, 무료 티어와 기업용 요금제 옵션이 있다.
사용 사례
Deepgram의 기술은 콜센터, 의료, 미디어, 금융 등 다양한 산업에서 사용된다. 예를 들어, 콜센터는 품질 관리 목적으로 고객 상호 작용을 전사하고 분석하는 데 Deepgram을 사용한다. 미디어 기업은 자막 생성 및 콘텐츠 색인화에 이를 활용한다. 의료 분야에서는 임상 문서화를 지원한다. 이 회사는 또한 음성 기반 애플리케이션을 구축하는 개발자에게도 서비스를 제공한다.
자금 및 성장
Deepgram은 주목할 만한 투자자들로부터 상당한 자금을 유치했다. 2023년 기준으로 이 회사는 총 1억 달러 이상의 투자금을 모금했다. 투자자에는 Nvidia, Tiger Global Management 및 기타 벤처 캐피털 회사가 포함된다. 이 회사는 팀과 고객 기반을 확장했으며, Intuitive Surgical 및 TomTom과 같은 고객들이 해당 서비스를 사용하는 것으로 알려져 있다.
같이 보기
참고 문헌
- Deepgram 공식 웹사이트 (deepgram.com)
- Deepgram 투자 유치에 관한 TechCrunch 기사
- 회사 보도 자료
참고: 2023년 현재, Deepgram은 제품 제공을 지속적으로 발전시키고 시장에서의 입지를 확장하고 있다.