语音识别,又称自动语音识别(ASR),将口语音频转换为书面文本。它是Text-to-speech的输入侧对应技术,也是Conversational AI、语音助手、听写软件和自动字幕系统的基础组成部分。
历史
20世纪70年代和80年代的早期语音识别系统依赖于手工设计的声学特征,结合隐马尔可夫模型,这些统计模型非常适合表示语音的序列性和时变结构,通常与n-gram语言模型配对以约束合理的词序列。这些系统需要大量领域特定的调整,并且在口音、背景噪声和训练数据之外的词汇方面表现不佳。2010年代带来了向Deep learning的转变,首先是用神经网络替换单个流水线组件,后来转向完全端到端的神经架构,特别是基于Recurrent neural network的序列模型,以及2017年之后的Transformer (architecture)系统,这些系统将原始或轻度处理的音频直接映射到文本,无需单独的声学和语言模型流水线。
现代系统
OpenAI的Whisper于2022年以开源形式发布,成为广泛采用的通用ASR系统,它在一个大型且多样化的多语言音频-文本配对数据集上训练,以跨口音、背景噪声和多种语言的强大性能著称,无需针对每种语言进行微调。Whisper和其他实验室的类似系统通常用作更大Multimodal AI流水线、语音助手和会议转录产品中的组件,其输出经常输入到下游Natural language processing任务中,如摘要或翻译。
技术
现代ASR系统通常使用一个编码器来处理音频,生成一系列学习到的表示,以及一个解码器来自回归地生成文本,这种架构模式与Seq2seq模型和机器翻译系统密切相关。训练在很大程度上依赖于大型配对的音频-文本数据集,而Self-supervised learning在未标记音频上的预训练,在任何转录可用之前学习有用的表示,成为提高有限标记数据语言性能的重要技术,这与自然语言处理和Computer vision中的类似方法并行。
应用与局限
语音识别支撑着实时字幕、智能手机内置的语音助手、听写软件、呼叫中心分析和面向聋哑及听障用户的无障碍工具。尽管准确性取得了重大进展,ASR系统在不同口音、方言和训练数据较少的语言上表现仍不均衡,这是商业系统中已记录的Algorithmic bias来源。背景噪声、重叠说话者以及医疗或法律术语等特定领域词汇也仍然是错误来源,系统通常针对专门部署进行微调或补充自定义词汇。评估通常集中在词错误率上,尽管这一单一指标可能掩盖不同人口群体和说话条件下的不均衡表现。