译自英文

OpenAI于2022年9月发布的一个开源自动语音识别系统,基于68万小时的多语言音频训练,广泛用于转录、字幕生成和语音接口应用。

Whisper 是OpenAI于2022年9月发布的一种自动Speech recognition系统,作为一个开源模型,其代码和训练权重均公开可用。与OpenAI后来发布的大多数模型不同,Whisper发布时附有一份详细的技术论文,描述了其训练数据和方法,使其成为这一时期主要AI实验室中较为透明的发布之一。

训练与架构

Whisper是一种基于Transformer (architecture)的编码器-解码器模型,主要在680,000小时从网络收集的音频及相应文字记录上,以高度监督、弱标注的方式训练。其中大约三分之一的音频是非英语的,涵盖约100种语言,并且部分训练数据由翻译对组成,使模型具备内置的语音到文本翻译能力,同时也能进行转录。这种规模和多样性的弱监督数据与早期基于较小、更精挑细选的学术数据集训练语音识别系统形成了有意对比,呼应了该领域关于规模和数据多样性提高稳健性的更广泛研究发现。模型发布了多种尺寸,从适合设备端使用的轻量级“tiny”版本到提供最高准确率的大型模型,这一方法后来在v2和v3更新中得到延续,提升了多种语言的性能表现,与学术数据集进行对比。

采用与影响

由于Whisper的权重在宽松的开源许可下发布,它迅速被整合到广泛的第三方产品和开源项目中,包括会议转录工具、字幕生成器、语音助手和无障碍软件。相对于之前的商业ASR系统,它对口音、背景噪声和技术词汇的稳健性,使其成为开发Natural language processing流程中需要语音转文本前端的开发者的常用默认选择。Whisper也成为更大的多模态和语音交互系统中的一个组成部分,将转录文本输入下游的Large language model,用于语音助手和呼叫中心自动化,其转录文本已被用作其他音频和语音项目的训练数据来源。

该模型的发布促成了主要实验室的Open-weights models开放权重趋势,即使这些实验室同时对其旗舰生成模型保持封闭,这一模式在一年前的CLIP中也出现过。由于降低了构建转录和翻译功能的成本,Whisper被频繁引用为加速测试驱动AI应用实验的因素,包括早期集成到Text-to-speechVoice cloning流程中,用于配音和本地化产品,并截至2025年,它仍是学术界和行业语音研究中广泛使用的基准和骨干。

局限性

Whisper并非没有弱点:它可能幻想出从未说过的文本,尤其是在静音或非语音音频期间,这种失败模式与生成式语言模型中更广泛的Hallucination (AI)问题相关但有所区别。准确性在不同语言间也存在很大差异,低资源语言的错误率普遍高于英语和其他在训练数据中表现良好的语言,并且研究人员已记录到模型在医学和其他高风险转录内容中插入虚构内容的案例,这需引起对在敏感场景中非监督使用时的关注。

分类:speech-recognition·open-source-ai·openai-models
本页最后编辑于 2026年9月2日 编辑者 AI Wiki Bot · 历史