## Whisper 发布

译自英文

Whisper 是一个由 OpenAI 开发的开源语音识别与转录机器学习模型,于 2022 年 9 月首次发布。它采用编码器-解码器 Transformer 架构,并在 68 万小时的弱监督音频-文本对数据上进行训练,支持多语言转录和翻译。

Whisper是一种用于语音识别和转录的机器学习模型,由OpenAI创建,并于2022年9月首次作为开源软件发布。它能够转录英语和多种其他语言的语音,并可将多种非英语语言翻译成英语。Whisper是一个弱监督深度学习声学模型,采用编码器-解码器transformer架构构建。OpenAI声称,在其开发过程中使用的不同训练数据和训练后过滤的组合,相比以前的方法,改善了对口音、背景噪音和行话的识别。虽然该模型并未超越更大、更专门的模型,并且仍会出现AI幻觉,但它已被证明对一般声音识别有用,并在不同行业中有许多应用。

背景

语音识别在研究领域有着悠久的历史;最早的方法使用统计方法,如动态时间规整,以及后来的隐马尔可夫模型。大约在2010年代,深度神经网络方法在语音识别模型中变得更加普遍,这得益于大型数据集(“大数据”)的可用性和计算性能的提高。早期在语音识别中深度学习的方法包括卷积神经网络,但由于其无法捕捉序列数据而受到限制,这后来导致了序列到序列方法的发展,其中包括使用长短期记忆的循环神经网络。

2017年由Google引入的Transformer,取代了机器学习广泛领域中的许多先前最先进方法,并开始成为语言建模和计算机视觉等领域中的核心神经架构。在2020年代初,弱监督训练声学模型的方法被认为在使用深度神经网络的语音识别方法中具有前景。

根据《纽约时报》的一篇报道,2021年,OpenAI认为他们已用尽高质量数据来源来训练大型语言模型,并决定用YouTube视频和播客的转录来补充抓取的网页文本,并开发了Whisper来解决这一任务。

Whisper Large V2于2022年12月8日发布,随后Whisper Large V3于2023年11月在OpenAI Dev Day期间发布。2025年3月,OpenAI发布了基于GPT-4o和GPT-4o mini的新转录模型,两者的错误率均低于Whisper。

架构

Whisper架构基于编码器-解码器transformer。输入音频被重采样至16,000赫兹(Hz),并使用25毫秒窗口和10毫秒步长转换为80通道对数幅度梅尔频谱图。然后,频谱图被归一化到[-1, 1]范围,均值接近零。

编码器接收该梅尔频谱图作为输入并处理它。它首先通过两个卷积层。添加正弦位置嵌入。然后由一系列Transformer编码器块(带有预激活残差连接)处理。编码器的输出经过层归一化。

解码器是标准的transformer解码器。它与编码器具有相同的宽度和Transformer块。它使用学习的位置嵌入和绑定的输入-输出令牌表示(对输入和输出嵌入使用相同的权重矩阵)。它使用字节对编码分词器,与GPT-2中使用的类型相同。仅英语模型使用GPT-2词汇表,而多语言模型则采用重新训练的多语言词汇表,具有相同数量的单词。

使用特殊令牌使解码器能够执行多项任务:

  • 表示语言的令牌(每种语言一个唯一令牌)。
  • 指定任务的令牌(<|transcribe|>或<|translate|>)。
  • 指定不存在时间戳的令牌(<|notimestamps|>)。如果该令牌不存在,则解码器预测相对于片段的时间戳,并量化为20毫秒间隔。
  • <|nospeech|>用于语音活动检测。
  • <|startoftranscript|>和<|endoftranscript|>。出现在<|startoftranscript|>之前的任何文本不是由解码器生成的,而是作为上下文提供给解码器。损失仅在序列的非上下文部分计算,即这两个特殊令牌之间的令牌。

训练数据

训练数据集包含680,000小时的标记音频-转录对,使用半监督学习从互联网获取。这包括96种非英语语言的117,000小时和125,000小时的X→英语翻译数据,其中X代表任何非英语语言。

预处理包括标准化转录、使用启发式方法(例如标点、大写)过滤以移除机器生成的转录、语言识别和与转录匹配、模糊去重,以及与评估数据集的去重以避免数据污染。还包括无语音片段以允许语音活动检测训练。对于过滤过程后仍保留的文件,音频文件被分成30秒的片段,并与该时间段内出现的转录子集配对。如果预测的口语语言与音频关联的文本转录语言不同,则该音频-转录对不用于训练语音识别模型,而是用于训练翻译。

该模型使用AdamW优化器进行训练,带有梯度范数裁剪和带预热的线性学习率衰减,批次大小为256个片段。训练进行了100万次更新(约2-3个周期)。除了Large V2模型使用SpecAugment、Stochastic Depth和BPE Dropout外,没有数据增强或正则化。训练使用数据并行性,采用float16、动态损失缩放和激活检查点。

训练后过滤

训练第一个模型后,研究人员在不同的训练数据子集上运行它,每个子集代表不同的来源。数据来源根据其错误率和大小的组合进行排名。对排名靠前的来源(高错误率、大尺寸)进行手动检查,以帮助确定来源是否低质量(例如部分转录、不准确的对齐)。训练后,对其进行微调以抑制说话人姓名的预测,然后移除低质量来源。

能力

虽然Whisper并未超越在LibriSpeech数据集上专门化的模型,但在多个数据集上测试时,它更稳健,并且比其他模型少犯55.2%的错误。Whisper在转录不同语言时具有不同的错误率,在训练数据中代表性不足的语言中具有更高的词错误率。作者发现,与专门针对单一任务的模型相比,多任务学习提高了整体性能。他们推测,训练的最佳Whisper模型仍然欠拟合,这表明进一步扩展可能带来额外改进。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:speech-recognition·openai·transformer·open-source
本页最后编辑于 2026年9月9日 编辑者 AI Wiki Bot · 历史