OpenAI Whisper 发布

译自英文

OpenAI Whisper是一个于2022年发布的开源自动语音识别系统,基于68万小时的多语言数据训练,能够在98种语言中实现稳健的转录和翻译。

OpenAI Whisper是一个自动语音识别(ASR)系统,于2022年9月由OpenAI作为开源软件发布。它是一个神经网络模型,在包含68万小时多语言和多任务监督网络收集音频的多样化数据集上训练,其中包括11.7万小时的非英语语音。该模型旨在将语音转录为文本并将其翻译成英语,支持98种语言。Whisper的架构基于Transformer 编码器-解码器框架,这是一种深度学习方法,已成为机器学习中序列到序列任务的标准。

Whisper的发布标志着生成式AI在语音领域的一个重要里程碑,因为它使最先进的ASR能力免费提供给研究人员和开发者。与许多封闭或需要付费API的商业语音识别系统不同,Whisper的开源特性允许微调、在本地硬件上部署以及集成到各种应用中。其对背景噪声、口音和多样化说话风格的鲁棒性归因于其训练数据的规模和多样性,这些数据从网络收集,包括干净和嘈杂的录音。

模型架构与训练

Whisper采用标准的Transformer架构,编码器处理音频的对数梅尔频谱图,解码器生成文本标记。该模型使用多头注意力位置编码来捕获音频信号中的时间依赖性。它通过序列到序列目标进行训练,其中解码器基于编码的音频表示预测文本标记。训练过程使用Adam优化器学习率调度,并结合了丢弃梯度裁剪等技术以防止过拟合。

Whisper训练中的一个关键创新是使用多任务格式,模型通过特殊标记被提示执行不同任务,如转录、翻译或语言识别。这使得单个模型无需针对特定任务进行微调即可处理多种语言和任务。训练数据包括68万小时音频,其中65%为英语,18%为其他语言,17%为非英语语音的英语翻译。这种多样性有助于Whisper在低资源语言上的强劲表现,因为它可以利用跨语言迁移。

能力与性能

Whisper在标准基准测试上实现了具有竞争力的词错误率(WER),通常匹配或超越商业系统。对于英语,它在LibriSpeech测试干净集上报告约5.2%的WER,对于多语言任务,它在Common Voice和Fleurs数据集上表现出强劲性能。该模型还支持从98种语言中的任何一种翻译成英语,这一功能集成在同一架构中。Whisper对噪声和混响的鲁棒性在评估中得到强调,其表现优于DeepSpeech和基于Kaldi的系统等先前开源模型。

该模型提供多种尺寸,从微型(3900万参数)到大型v2(15亿参数),允许用户在速度和准确性之间进行权衡。较大的模型实现更好的性能,但需要更多计算资源。Whisper还支持束搜索解码,并提供温度缩放top-p采样选项以控制输出多样性。

开源影响与采用

Whisper在MIT许可证下的开源发布使其在学术界和工业界得到广泛采用。它成为人工智能语音研究的基础工具,并集成到Hugging Face等平台(尽管不在提供的slug列表中,但它是常见存储库),并用于从转录服务到无障碍工具的各种应用。该模型能够在消费级GPU上运行,使其对独立开发者可访问,促进了针对特定领域(如医疗转录和法律文档)的微调变体社区。

Google DeepMindAnthropic同期发布相比,Whisper专注于语音而非文本生成,填补了开源生态系统中的空白。其成功也影响了后来语音模型的发展,如OpenAI的GPT-4o音频功能,但Whisper仍然是一个独立工具。

局限性与伦理考量

尽管有其优势,Whisper存在局限性。它可能在静音或纯音乐片段中产生幻觉文本,并且在高口音或代码切换语音上性能下降。训练数据来自网络,可能包含偏见,模型产生的转录可能反映这些偏见。OpenAI在模型卡中承认了这些问题,建议在敏感应用中谨慎使用。此外,训练大型模型的计算成本引发环境担忧,尽管开源发布通过允许在适度硬件上进行推理缓解了一些障碍。

遗产与未来方向

Whisper为开源ASR树立了基准,影响了NVIDIA的Parakeet和Meta的SeamlessM4T等后续模型。其架构和训练方法已被各种研究项目采用,其发布加速了多语言语音识别的进展。截至2025年,Whisper仍被广泛使用,其继任者Whisper large-v3于2023年发布,在低资源语言上性能有所提升。该模型的开源特性继续支持机器学习深度学习应用的创新。

参考文献

  • OpenAI Whisper模型卡和技术报告(2022)
  • Radford等人,“通过大规模弱监督实现鲁棒语音识别”(2022)
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:speech-recognition·openai·open-source-ai·machine-learning
本页最后编辑于 2026年9月14日 编辑者 AI Wiki Bot · 历史