AssemblyAI 是一家私人控股的科技公司,专门从事语音转文字及音频智能 API 的开发。公司成立于 2017 年,由 Dylan Fox 和 Yonatan Bisk 创立,总部位于加利福尼亚州旧金山。AssemblyAI 提供一套面向开发者的工具,可将音频和视频转换为结构化数据,从而支持通话分析、语音助手和媒体字幕等应用场景。
该公司的核心产品是一个基于云计算的 API 平台,利用深度学习和神经网络架构。AssemblyAI 的模型在大规模数据集上进行训练,能够处理多种口音、语言和声学条件。该平台提供实时转录、说话人分离、情感分析、实体检测和主题提取等功能。2023 年,AssemblyAI 发布了 Universal-1,这是一个大型机器学习模型,基于 1250 万小时的音频数据训练而成,在多项基准测试中达到了最先进的准确率。公司还推出了 Conformer-2,该模型针对长篇幅转录和说话人标注进行了优化。
历史与融资
AssemblyAI 成立于 2017 年,其目标是让语音 AI 对开发者更加易用。公司最初是一家以研究为导向的初创企业,并发表了多篇关于语音识别的学术论文。2018 年,AssemblyAI 完成了 250 万美元的种子轮融资;2020 年,又完成了由 Google Cloud 旗下 AI 风投部门领投的 1000 万美元 A 轮融资。2021 年,公司获得 5000 万美元的 B 轮融资;2022 年,则由 Amazon Alexa Fund 领投完成了 1 亿美元的 C 轮融资。截至 2024 年,AssemblyAI 累计融资总额已超过 1.6 亿美元,公司估值约为 10 亿美元,成为语音 AI 领域的独角兽企业。
技术与模型
AssemblyAI 的平台基于专有的深度学习框架和 Transformer 架构构建。Universal-1 模型于 2023 年发布,是一种大型语言模型风格的音频编码器,能够处理原始波形并输出带标点和大小写的文本。该模型支持 15 种语言,在英语基准测试中的词错误率低于 5%。Conformer-2 模型于 2024 年推出,采用了多头注意力机制和编码器-解码器结构,以提升说话人分离和长篇幅转录的性能。此外,公司还提供 LeMUR 框架,用于构建基于转录文本的问答和摘要应用,并可集成外部生成式 AI 系统。
产品与应用
AssemblyAI 提供 RESTful API,并支持 Python、JavaScript 等多种编程语言的 SDK。其主要产品包括:
- 语音转文字 API:提供实时和异步转录功能,并支持词级时间戳。
- 音频智能模型:内置情感分析、内容审核和 PII 脱敏等预训练模型。
- LeMUR:用于在转录文本上构建自然语言查询的框架。
该平台被多家企业采用,例如 Intuitive Surgical 用于医疗文档记录,Commure 用于医疗分析,TomTom 用于语音导航。开发者还利用 AssemblyAI 构建通话分析、播客搜索和会议转录工具。
行业影响与竞争
AssemblyAI 与 OpenAI 的 Whisper、Azure 语音服务以及 Amazon Transcribe 等语音 AI 提供商展开竞争。与这些超大规模云服务商的产品不同,AssemblyAI 专注于音频智能领域,并提供更细粒度的定制选项。公司在行业报告中获得了认可,2023 年被 Omdia 评为语音 AI 矩阵的领导者,并荣获 AI Breakthrough 奖的最佳语音识别平台奖。
未来方向
AssemblyAI 持续投入研发,特别是在多语言模型和实时流式处理方面。公司计划通过加强与云服务商及 AI 生态系统的合作,进一步扩大其影响力,并探索与 Amazon AI 和 Google DeepMind 等技术的集成。截至 2025 年,AssemblyAI 正在研究端侧推理技术,以降低延迟并提升边缘应用中的隐私保护能力。