AssemblyAI es una empresa privada de tecnología especializada en APIs de voz a texto e inteligencia de audio. Fundada en 2017 por Dylan Fox y Yonatan Bisk, la empresa tiene su sede en San Francisco, California. AssemblyAI ofrece un conjunto de herramientas para desarrolladores que convierten audio y video en datos estructurados, lo que permite aplicaciones como análisis de llamadas, asistentes de voz y subtitulado de medios.
El producto principal de la empresa es una plataforma API basada en la nube que aprovecha el aprendizaje profundo y arquitecturas de redes neuronales. Los modelos de AssemblyAI se entrenan con conjuntos de datos a gran escala y están diseñados para manejar diversos acentos, idiomas y condiciones acústicas. La plataforma ofrece funciones como transcripción en tiempo real, diarización de hablantes, análisis de sentimiento, detección de entidades y extracción de temas. En 2023, AssemblyAI lanzó Universal-1, un modelo de aprendizaje automático entrenado con 12,5 millones de horas de audio, que logró resultados de vanguardia en varios puntos de referencia. La empresa también presentó Conformer-2, un modelo optimizado para transcripción de textos largos y etiquetado de hablantes.
Historia y financiación
AssemblyAI fue fundada en 2017 con el objetivo de hacer accesible la inteligencia de voz para los desarrolladores. La empresa comenzó como una startup centrada en la investigación, publicando artículos académicos sobre reconocimiento de voz. En 2018, obtuvo una ronda de financiación inicial de 2,5 millones de dólares, seguida de una ronda Serie A de 10 millones en 2020 liderada por Google Cloud (como parte de la rama de inversión en IA de Google). En 2021, AssemblyAI consiguió una ronda Serie B de 50 millones de dólares y, en 2022, cerró una ronda Serie C de 100 millones liderada por el Fondo Alexa de Amazon Web Services. A partir de 2024, la empresa ha recaudado más de 160 millones de dólares en financiación total y está valorada en aproximadamente 1.000 millones de dólares, lo que la convierte en un unicornio en el sector de la inteligencia de voz.
Tecnología y modelos
La plataforma de AssemblyAI se basa en marcos propios de aprendizaje profundo y arquitecturas de transformadores. El modelo Universal-1, lanzado en 2023, es un codificador de audio de tipo modelo de lenguaje grande que procesa formas de onda crudas y genera texto con puntuación y capitalización. Admite 15 idiomas y logra tasas de error de palabra inferiores al 5% en puntos de referencia en inglés. El modelo Conformer-2, introducido en 2024, incorpora mecanismos de atención multi-cabeza y estructuras de codificador-decodificador para mejorar la diarización de hablantes y la transcripción de textos largos. La empresa también ofrece LeMUR (Modelo de Lenguaje Grande para Comprensión y Razonamiento), un marco que se integra con sistemas de IA generativa para permitir preguntas y respuestas, así como resúmenes sobre audio transcrito.
Productos y casos de uso
AssemblyAI proporciona una API REST con SDKs para Python, JavaScript y otros lenguajes. Los productos clave incluyen:
- API de voz a texto: Transcripción en tiempo real y asíncrona con marcas de tiempo a nivel de palabra.
- Modelos de inteligencia de audio: Modelos preentrenados para análisis de sentimiento, moderación de contenido y redacción de información personal identificable (PII).
- LeMUR: Un marco para crear consultas en lenguaje natural sobre datos transcritos.
La plataforma es utilizada por empresas como Intuitive Surgical para documentación médica, Commure para análisis de salud y TomTom para navegación por voz. Los desarrolladores también usan AssemblyAI para crear análisis de centros de llamadas, búsqueda en podcasts y herramientas de transcripción de reuniones.
Impacto en la industria y comparaciones
AssemblyAI compite con otros proveedores de inteligencia de voz como Whisper de OpenAI, el servicio de voz de Microsoft Azure y Transcribe de Amazon Web Services. A diferencia de estos servicios de hiperescala, AssemblyAI se centra exclusivamente en la inteligencia de audio y ofrece opciones de personalización más detalladas. La empresa ha sido reconocida en informes del sector por su alta precisión y baja latencia. En 2023, AssemblyAI fue nombrada líder en la Matriz de Inteligencia de Voz de Omdia y recibió el premio AI Breakthrough a la Mejor Plataforma de Reconocimiento de Voz.
Direcciones futuras
AssemblyAI continúa invirtiendo en investigación y desarrollo, especialmente en modelos multilingües y transmisión en tiempo real. La empresa busca expandir su presencia en el ecosistema de la inteligencia artificial mediante alianzas con proveedores de nube e integraciones con tecnologías de Amazon IA y Google DeepMind. A partir de 2025, AssemblyAI está explorando la inferencia en el dispositivo para reducir la latencia y mejorar la privacidad en aplicaciones de borde.