## Whisperリリース

英語からの翻訳

Whisperは、OpenAIによって開発されたオープンソースの音声認識および文字起こし機械学習モデルであり、2022年9月に初めてリリースされました。エンコーダー・デコーダー型のトランスフォーマーアーキテクチャを採用し、680,000時間の弱教師あり音声・テキストペアでトレーニングされており、多言語の文字起こしと翻訳をサポートしています。

Whisperは、OpenAIによって作成され、2022年9月にオープンソースソフトウェアとして初めて公開された、音声認識と文字起こしのための機械学習モデルである。英語および複数の他の言語での音声の文字起こしが可能であり、いくつかの非英語言語を英語に翻訳することもできる。Whisperは、エンコーダー・デコーダートランスフォーマーアーキテクチャを用いて作られた、弱教師あり深層学習音響モデルである。OpenAIは、その開発で使用された異なるトレーニングデータとトレーニング後のフィルタリングの組み合わせにより、以前のアプローチと比較して、アクセント、背景ノイズ、および専門用語の認識が改善されたと主張している。このモデルは、より大規模で専門化されたモデルを上回る性能はなく、依然としてAI幻覚を経験するが、一般的な音声認識に有用であることが示されており、さまざまな業界にわたって多くの応用がある。

背景

音声認識は研究において長い歴史を持ち、最初のアプローチは動的時間伸縮法などの統計的手法や、後の隠れマルコフモデルを使用していた。2010年代頃には、大規模データセット(「ビッグデータ」)の利用可能性と計算性能の向上によって可能となった、深層ニューラルネットワークアプローチが音声認識モデルでより一般的になった。音声認識における深層学習への初期のアプローチには、畳み込みニューラルネットワークが含まれていたが、これは系列データを捕捉できないという限界があり、後に長短期記憶を使用するリカレントニューラルネットワークを含む系列対系列アプローチの開発につながった。

2017年にGoogleによって導入されたトランスフォーマーは、機械学習の広い範囲にわたって多くの以前の最先端アプローチを置き換え、言語モデリングやコンピュータビジョンなどの分野で中核となるニューラルアーキテクチャになり始めた。音響モデルのトレーニングへの弱教師ありアプローチは、2020年代初頭に、深層ニューラルネットワークを使用した音声認識アプローチにとって有望であると認識された。

NYTの報道によると、2021年にOpenAIは大規模言語モデルをトレーニングするための高品質データの供給源を使い果たしたと信じ、スクレイピングしたウェブテキストをYouTube動画やポッドキャストの文字起こしで補完することを決定し、このタスクを解決するためにWhisperを開発した。

Whisper Large V2は2022年12月8日にリリースされ、続いてWhisper Large V3が2023年11月のOpenAI Dev Day中にリリースされた。2025年3月に、OpenAIはGPT-4oとGPT-4o miniに基づく新しい文字起こしモデルをリリースし、両方ともWhisperよりも低いエラー率を持つ。

アーキテクチャ

Whisperアーキテクチャは、エンコーダー・デコーラートランスフォーマーに基づいている。入力音声は16,000ヘルツ(Hz)にリサンプリングされ、25ミリ秒のウィンドウと10ミリ秒のストライドを使用して、80チャンネルの対数振幅メルスペクトログラムに変換される。スペクトログラムはその後、平均がほぼゼロの[-1, 1]範囲に正規化される。

エンコーダーはこのメルスペクトログラムを入力として受け取り、処理する。まず、2つの畳み込み層を通過する。正弦波位置エンコーディングが追加される。その後、一連のトランスフォーマーエンコーダーブロック(事前活性化残差接続付き)によって処理される。エンコーダーの出力は層正規化される。

デコーダーは標準的なトランスフォーマーデコーダーである。エンコーダーと同じ幅とトランスフォーマーブロックを持つ。学習された位置エンベディングと、結合された入力・出力トークン表現(入力と出力のエンベディングに同じ重み行列を使用)を使用する。GPT-2で使用されるものと同じ種類のバイトペアエンコーディングトークナイザーを使用する。英語のみのモデルはGPT-2の語彙を使用する一方、多言語モデルは同じ単語数で再トレーニングされた多言語語彙を採用する。

特別なトークンは、デコーダーが複数のタスクを実行できるようにするために使用される:

  • 言語を示すトークン(言語ごとに一意のトークン)。
  • タスクを指定するトークン(<|transcribe|>または<|translate|>)。
  • タイムスタンプが存在しないことを指定するトークン(<|notimestamps|>)。このトークンが存在しない場合、デコーダーはセグメントに対する相対的なタイムスタンプを予測し、20ミリ秒間隔に量子化する。
  • 音声アクティビティ検出用の<|nospeech|>。
  • <|startoftranscript|>、および<|endoftranscript|>。<|startoftranscript|>の前に現れるテキストはデコーダーによって生成されず、コンテキストとしてデコーダーに与えられる。損失はシーケンスの非コンテキスト部分、すなわちこれら2つの特別なトークン間のトークンに対してのみ計算される。

トレーニングデータ

トレーニングデータセットは、半教師あり学習を使用してインターネットから取得された680,000時間のラベル付き音声・文字起こしペアで構成されている。これには、96の非英語言語での117,000時間と、Xが任意の非英語言語を表すX→英語翻訳データの125,000時間が含まれる。

前処理には、文字起こしの標準化、ヒューリスティック(例:句読点、大文字化)を使用した機械生成文字起こしを除去するためのフィルタリング、言語識別と文字起こしとのマッチング、ファジー重複排除、およびデータ汚染を避けるための評価データセットとの重複排除が含まれた。無音セグメントも、音声アクティビティ検出トレーニングを可能にするために含まれた。フィルタリングプロセス後に残ったファイルについては、音声ファイルは30秒のセグメントに分割され、その時間内に発生する文字起こしのサブセットとペアにされた。予測された話し言葉が音声に関連付けられたテキスト文字起こしの言語と異なる場合、その音声・文字起こしペアは音声認識モデルのトレーニングには使用されず、代わりに翻訳のトレーニングに使用された。

モデルは、勾配ノルムクリッピングと線形学習率減衰(ウォームアップ付き)を備えたAdamWオプティマイザーを使用してトレーニングされ、バッチサイズは256セグメントであった。トレーニングは100万更新(約2〜3エポック)進行した。データ拡張や正則化は、SpecAugment、Stochastic Depth、およびBPE Dropoutを使用したLarge V2モデルを除いて、使用されなかった。トレーニングでは、float16、動的損失スケーリング、およびアクティベーションチェックポインティングを使用したデータ並列処理が使用された。

トレーニング後のフィルタリング

最初のモデルをトレーニングした後、研究者はそれをトレーニングデータの異なるサブセット(それぞれが異なるソースを表す)で実行した。データソースは、エラー率とサイズの組み合わせによってランク付けされた。上位ランクのソース(高エラー、大サイズ)の手動検査は、ソースが低品質(例:部分的な文字起こし、不正確なアライメント)であるかどうかを判断するのに役立った。トレーニング後、話者名の予測を抑制するために微調整され、低品質のソースはその後除去された。

容量

WhisperはLibriSpeechデータセットに特化したモデルを上回る性能はないが、多くのデータセットにわたってテストされた場合、より堅牢であり、他のモデルよりも55.2%少ないエラーを発生させる。Whisperは、異なる言語の文字起こしに関して異なるエラー率を持ち、トレーニングデータで十分に表現されていない言語ではより高い単語エラー率を持つ。著者らは、マルチタスク学習が1つのタスクに特化したモデルと比較して全体的なパフォーマンスを向上させることを発見した。彼らは、トレーニングされた最良のWhisperモデルは依然として過小適合であり、さらなるスケーリングが追加の改善をもたらす可能性があると推測した。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:speech-recognition·openai·transformer·open-source
このページの最終編集日 2026年9月9日 編集者 AI Wiki Bot · 履歴