AssemblyAI est une entreprise technologique privée spécialisée dans les API de reconnaissance vocale et de transcription audio. Fondée en 2017 par Dylan Fox et Yonatan Bisk, la société est basée à San Francisco, en Californie. AssemblyAI fournit une suite d'outils destinés aux développeurs, permettant de convertir l'audio et la vidéo en données structurées, ce qui facilite des applications telles que l'analyse d'appels, les assistants vocaux et le sous-titrage de médias.
Le produit principal de l'entreprise est une plateforme API basée sur le cloud, qui s'appuie sur l'apprentissage profond et des architectures de réseau de neurones. Les modèles d'AssemblyAI sont entraînés sur de vastes ensembles de données et sont conçus pour gérer une grande variété d'accents, de langues et de conditions acoustiques. La plateforme propose des fonctionnalités telles que la transcription en temps réel, la diarisation des locuteurs, l'analyse des sentiments, la détection d'entités et l'extraction de sujets. En 2023, AssemblyAI a lancé Universal-1, un modèle de grand modèle de langage entraîné sur 12,5 millions d'heures de données audio, qui a atteint des performances de pointe sur plusieurs références. L'entreprise a également introduit Conformer-2, un modèle optimisé pour la transcription de longs enregistrements et l'étiquetage des locuteurs.
Historique et financement
AssemblyAI a été fondée en 2017 avec pour objectif de rendre la reconnaissance vocale accessible aux développeurs. L'entreprise a d'abord fonctionné comme une start-up axée sur la recherche, publiant des articles académiques sur la reconnaissance vocale. En 2018, elle a levé un tour de table de 2,5 millions de dollars, suivi d'une série A de 10 millions de dollars en 2020, menée par Google Cloud (dans le cadre de la branche d'investissement en IA de Google). En 2021, AssemblyAI a obtenu 50 millions de dollars lors d'une série B, puis a clôturé une série C de 100 millions de dollars en 2022, dirigée par l'Alexa Fund d'Amazon Web Services. En 2024, l'entreprise a levé plus de 160 millions de dollars au total et est valorisée à environ 1 milliard de dollars, ce qui en fait une licorne dans le secteur de l'IA vocale.
Technologie et modèles
La plateforme d'AssemblyAI repose sur des frameworks propriétaires d'apprentissage profond et des architectures de transformeur. Le modèle Universal-1, lancé en 2023, est un grand modèle de langage audio qui traite les formes d'onde brutes et produit du texte avec ponctuation et capitalisation. Il prend en charge 15 langues et affiche un taux d'erreur de mots inférieur à 5 % sur les références en anglais. Le modèle Conformer-2, introduit en 2024, intègre des mécanismes d'attention multi-têtes et des structures encodeur-décodeur pour améliorer la diarisation des locuteurs et la transcription de longs contenus. L'entreprise propose également LeMUR (Large Language Model for Understanding and Reasoning), un cadre qui s'intègre à des systèmes d'IA générative externes pour permettre des questions-réponses et des résumés sur des transcriptions.
Produits et cas d'utilisation
AssemblyAI propose une API RESTful avec des SDK pour Python, JavaScript et d'autres langages. Les principaux produits incluent :
- API de transcription vocale : transcription en temps réel et asynchrone avec horodatage au niveau du mot.
- Modèles d'intelligence audio : modèles pré-entraînés pour l'analyse des sentiments, la modération de contenu et la rédaction d'informations personnelles identifiables (PII).
- LeMUR : un cadre pour créer des requêtes en langage naturel sur des données transcrites.
La plateforme est utilisée par des entreprises telles que Intuitive Surgical pour la documentation médicale, Commure pour l'analyse des soins de santé, et TomTom pour la navigation vocale. Les développeurs l'utilisent également pour créer des outils d'analyse d'appels, de recherche dans les podcasts et de transcription de réunions.
Impact sur l'industrie et comparaisons
AssemblyAI est en concurrence avec d'autres fournisseurs de technologies vocales comme Whisper d'OpenAI, le service vocal d'Microsoft Azure et Transcribe d'Amazon Web Services. Contrairement à ces offres des grands fournisseurs de cloud, AssemblyAI se concentre exclusivement sur l'intelligence audio et offre des options de personnalisation plus fines. L'entreprise a été reconnue dans des rapports sectoriels pour sa haute précision et sa faible latence. En 2023, AssemblyAI a été nommée leader dans le cadre de l'Omdia Speech AI Matrix et a reçu le prix AI Breakthrough Award pour la meilleure plateforme de reconnaissance vocale.
Orientations futures
AssemblyAI continue d'investir dans la recherche et le développement, en particulier dans les modèles multilingues et la transcription en temps réel. L'entreprise vise à étendre sa présence dans l'écosystème de l'intelligence artificielle en s'associant avec des fournisseurs de cloud et en intégrant des technologies d'Amazon AI et de Google DeepMind. En 2025, AssemblyAI explore l'inférence sur appareil pour réduire la latence et améliorer la confidentialité dans les applications en périphérie.