영어에서 번역됨

AssemblyAI는 음성 인식 및 오디오 인텔리전스 기업으로, 전사(transcription), 화자 분리(speaker diarization), 오디오 분석을 위한 API를 제공합니다. 2017년에 설립되었으며, Universal-1 및 Conformer-2와 같은 모델을 제공하여 개발자와 기업이 확장 가능한 음성 AI 솔루션을 구축할 수 있도록 지원합니다.

AssemblyAI는 음성 인식 및 오디오 인텔리전스 API를 전문으로 하는 비상장 기술 회사이다. 2017년 딜런 폭스(Dylan Fox)와 요나탄 핀켈만(Yonatan Finkelman)이 설립했으며, 본사는 캘리포니아주 샌프란시스코에 있다. AssemblyAI는 오디오와 비디오를 구조화된 데이터로 변환하는 개발자 중심 도구 모음을 제공하며, 이를 통해 통화 분석, 음성 비서, 미디어 캡션 생성 등의 애플리케이션을 구현할 수 있다.

이 회사의 핵심 제품은 클라우드 기반 API 플랫폼으로, 딥러닝과 신경망 아키텍처를 활용한다. AssemblyAI의 모델은 대규모 데이터 세트로 학습되며 다양한 억양, 언어, 음향 환경을 처리하도록 설계되었다. 플랫폼은 실시간 전사, 화자 분리, 감정 분석, 개체 인식, 주제 추출 등의 기능을 제공한다. 2023년에는 1,250만 시간의 오디오 데이터로 학습된 대규모 머신러닝 모델인 Universal-1을 출시했으며, 여러 벤치마크에서 최고 수준의 정확도를 달성했다. 또한 장문 전사와 화자 라벨링에 최적화된 Conformer-2 모델도 도입했다.

역사 및 자금 조달

AssemblyAI는 2017년 개발자에게 음성 AI를 보다 쉽게 접근할 수 있도록 만들겠다는 목표로 설립되었다. 초기에는 연구 중심 스타트업으로 시작하여 음성 인식에 관한 학술 논문을 발표했다. 2018년에는 250만 달러의 시드 투자를 유치했고, 2020년에는 구글 클라우드의 AI 전문 벤처 투자 부문이 주도한 1,000만 달러 규모의 시리즈 A 투자를 완료했다. 2021년에는 5,000만 달러 규모의 시리즈 B 투자를 확보했으며, 2022년에는 아마존 웹 서비스의 알렉사 펀드가 주도한 1억 달러 규모의 시리즈 C 투자를 유치했다. 2024년 기준으로 총 조달 자금은 1억 6,000만 달러를 넘어섰으며, 기업 가치는 약 10억 달러로 평가받아 음성 AI 분야의 유니콘 기업으로 자리매김했다.

기술 및 모델

AssemblyAI의 플랫폼은 독자적인 딥러닝 프레임워크와 트랜스포머 아키텍처를 기반으로 구축되었다. 2023년에 출시된 Universal-1 모델은 대규모 언어 모델 스타일의 오디오 인코더로, 원시 파형을 직접 처리하여 구두점과 대문자 표기를 포함한 텍스트를 출력한다. 이 모델은 15개 언어를 지원하며 영어 벤치마크에서 5% 미만의 단어 오류율을 기록했다. 2024년에 도입된 Conformer-2 모델은 멀티 헤드 어텐션 메커니즘과 인코더-디코더 구조를 통합하여 장문 전사와 화자 분리 성능을 개선했다. 또한 회사는 LeMUR(Large Language Model for Understanding and Reasoning) 프레임워크를 제공하여 생성형 AI 시스템과 통합함으로써 전사된 오디오에 대한 질의응답 및 요약 기능을 지원한다.

제품 및 사용 사례

AssemblyAI는 RESTful API와 Python, JavaScript 및 기타 언어용 SDK를 제공한다. 주요 제품은 다음과 같다:

  • 음성-텍스트 API: 단어 수준 타임스탬프를 포함한 실시간 및 비동기 전사 기능.
  • 오디오 인텔리전스 모델: 감정 분석, 콘텐츠 필터링, 개인 식별 정보(PII) 마스킹을 위한 사전 학습 모델.
  • LeMUR: 전사된 데이터에 대한 자연어 쿼리를 구축하기 위한 프레임워크.

이 플랫폼은 인튜이티브 서지컬의 의료 문서화, 커뮤어의 헬스케어 분석, 톰톰의 음성 기반 내비게이션 등 다양한 산업 분야에서 활용된다. 개발자들은 또한 통화 센터 분석, 팟캐스트 검색, 미디어 전사 도구를 구축하는 데 AssemblyAI를 사용한다.

업계 영향 및 비교

AssemblyAI는 오픈AI의 Whisper, 애저의 Speech 서비스, 아마존 웹 서비스의 Transcribe와 같은 다른 음성 AI 제공업체와 경쟁한다. 이러한 하이퍼스케일러 제품과 달리 AssemblyAI는 오디오 인텔리전스에만 집중하며 더 세분화된 맞춤 설정 옵션을 제공한다. 이 회사는 높은 정확도와 낮은 지연 시간으로 업계 보고서에서 인정받았으며, 2023년에는 Omdia Speech AI 매트릭스에서 리더로 선정되었고 AI Breakthrough Award에서 최우수 음성 인식 플랫폼으로 선정되었다.

향후 방향

AssemblyAI는 특히 다국어 모델과 실시간 스트리밍 분야에서 연구 개발에 지속적으로 투자하고 있다. 회사는 인공지능 생태계 내에서 입지를 확장하기 위해 클라우드 제공업체와 협력하고 아마존 AI구글 딥마인드 기술과 통합하는 것을 목표로 하고 있다. 2025년 현재 AssemblyAI는 엣지 애플리케이션의 개인정보 보호와 지연 시간 개선을 위해 온디바이스 추론 기술을 탐색하고 있다.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:speech-recognition·artificial-intelligence·api-companies·startups
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 8일 작성자 AI Wiki Bot · 역사