AssemblyAIは、音声からテキストへの変換と音声インテリジェンスAPIを専門とする非公開のテクノロジー企業です。2017年にDylan FoxとYonatan Biskによって設立され、カリフォルニア州サンフランシスコに本社を置いています。AssemblyAIは、オーディオとビデオを構造化データに変換する開発者向けツール群を提供し、コール分析、音声アシスタント、メディアのキャプション生成などのアプリケーションを可能にします。
同社の主力製品は、深層学習とNeural networkアーキテクチャを活用したクラウドベースのAPIプラットフォームです。AssemblyAIのモデルは大規模データセットでトレーニングされ、多様なアクセント、言語、音響条件に対応するよう設計されています。このプラットフォームは、リアルタイム文字起こし、話者分離、感情分析、エンティティ検出、トピック抽出などの機能を提供します。2023年には、AssemblyAIは、1250万時間のオーディオデータでトレーニングされた大規模Machine learningモデルであるUniversal-1をリリースし、複数のベンチマークで最先端の精度を達成しました。また、同社は、長文の文字起こしと話者ラベリングに最適化されたモデルであるConformer-2も導入しました。
歴史と資金調達
AssemblyAIは、音声AIを開発者にアクセスしやすくすることを目的として2017年に設立されました。同社は当初、音声認識に関する学術論文を発表する研究重視のスタートアップとして運営されていました。2018年には、250万ドルのシードラウンドを調達し、続いて2020年には、Google Cloud(GoogleのAI重視のベンチャー部門の一部として)が主導する1000万ドルのシリーズAを完了しました。2021年には、AssemblyAIは5000万ドルのシリーズBラウンドを確保し、2022年には、Amazon Web ServicesのAlexa Fundが主導する1億ドルのシリーズCをクローズしました。2024年時点で、同社は総額1億6000万ドル以上を調達し、評価額は約10億ドルに達しており、音声AI分野のユニコーンとなっています。
技術とモデル
AssemblyAIのプラットフォームは、独自のDeep learningフレームワークとTransformer (architecture)アーキテクチャに基づいて構築されています。2023年にリリースされたUniversal-1モデルは、Large language modelスタイルのオーディオエンコーダーで、生の波形を処理し、句読点と大文字化を含むテキストを出力します。15言語をサポートし、英語ベンチマークで5%未満の単語誤り率を達成しています。2024年に導入されたConformer-2モデルは、Multi-Head AttentionメカニズムとEncoder-Decoder Architecture構造を組み込み、話者分離と長文の文字起こしを改善しています。同社はまた、外部のGenerative AIシステムと統合して、文字起こしされたオーディオに対する質問応答と要約を可能にするLeMUR(Large Language Model for Understanding and Reasoning)フレームワークも提供しています。
製品とユースケース
AssemblyAIは、Python、JavaScript、その他の言語用のSDKを備えたRESTful APIを提供しています。主要製品は以下の通りです:
- 音声からテキストへのAPI:単語レベルのタイムスタンプ付きのリアルタイムおよび非同期の文字起こし。
- 音声インテリジェンスモデル:感情分析、コンテンツモデレーション、PII編集用の事前構築モデル。
- LeMUR:文字起こしデータに対する自然言語クエリを構築するためのフレームワーク。
このプラットフォームは、医療文書化のためのIntuitive Surgical、医療分析のためのCommure、音声対応ナビゲーションのためのTomTomなどの企業によって使用されています。開発者はまた、AssemblyAIを使用して、コールセンター分析、ポッドキャスト検索、会議の文字起こしツールを構築しています。
業界への影響と比較
AssemblyAIは、OpenAIのWhisper、Microsoft AzureのSpeechサービス、Amazon Web Services Transcribeなどの他の音声AIプロバイダーと競合しています。これらのハイパースケーラー提供とは異なり、AssemblyAIは音声インテリジェンスにのみ焦点を当てており、より詳細なカスタマイズオプションを提供しています。同社は、その高い精度と低遅延について業界レポートで認識されています。2023年には、AssemblyAIはOmdia Speech AI Matrixでリーダーに選ばれ、Best Speech Recognition PlatformとしてAI Breakthrough Awardを受賞しました。
今後の方向性
AssemblyAIは、特に多言語モデルとリアルタイムストリーミングにおいて、研究開発への投資を継続しています。同社は、クラウドプロバイダーとの提携や、Amazon AIおよびGoogle DeepMind技術との統合を通じて、Artificial intelligenceエコシステムでの存在感を拡大することを目指しています。2025年時点で、AssemblyAIは、エッジアプリケーション向けの遅延を削減しプライバシーを向上させるためのオンデバイス推論を探索しています。