Whisper 2022は、OpenAIによって開発され、2022年9月にオープンソースソフトウェアとして公開された汎用音声認識モデルである。音声をテキストに転写し、非英語の発話を英語に翻訳するように設計されており、96言語を対象としている。このモデルはTransformer (architecture)アーキテクチャに基づいて構築され、68万時間の多言語・マルチタスクの教師付き音声データの大規模データセットで訓練されており、アクセント、背景ノイズ、専門用語に対して頑健である。
Whisper 2022は、事前訓練された音声エンコーダとタスク固有の微調整に大きく依存していた従来の音声認識システムからの転換を表している。その代わりに、現代のLarge language modelと同様のエンコーダ・デコーダ構造を持つシーケンス間アプローチを使用し、ログメルスペクトログラムに変換された生の音声波形から直接訓練される。このモデルのオープンソース公開により、研究者や開発者は独自の制約なしに最先端の音声認識をアプリケーションに組み込むことができた。
アーキテクチャと訓練
Whisper 2022はEncoder-Decoder Architectureトランスフォーマーアーキテクチャを採用しており、エンコーダが音声スペクトログラムを処理し、デコーダがテキストトークンを生成する。標準的なトランスフォーマー設計と一致して、Multi-Head AttentionとPositional Encodingのメカニズムを使用している。このモデルは、バイアスを減らし一般化を改善することに焦点を当てて、非英語の音声を含むウェブからの多様な音声コーパスで訓練された。
訓練データは68万時間の音声で構成され、そのうち11万7千時間は非英語であり、96言語をカバーしていた。データセットには、65%の英語音声、18%の非英語音声、および音楽やノイズなどの他のデータが17%含まれていた。この多様性により、Whisperは背景音楽、重複する発話、異なる録音品質などのさまざまな音響条件を処理できた。モデルはAdam (Optimizer)を学習率スケジュールとともに使用し、訓練を安定させるためにGradient Clippingを適用して訓練された。
能力と性能
Whisper 2022は、転写、翻訳(非英語から英語へ)、言語識別の複数のタスクをサポートしている。音声をセグメントで処理でき、最大セグメント長は30秒であり、デコードにはBeam Searchを使用し、出力の多様性を制御するためにTop-K SamplingとTemperature Scalingのオプションがある。このモデルは、LibriSpeechやCommon Voiceなどの一般的なベンチマークで競争力のある単語エラー率を達成し、多くの場合、以前のオープンソースシステムを上回っている。
英語の転写では、Whisper 2022はLibriSpeechのtest-cleanセットで5.2%、test-otherで10.4%の単語エラー率を報告している。多言語タスクでは、20言語にわたって中央値10.4%の単語エラー率を達成し、特にロマンス語とゲルマン語で強い性能を示している。このモデルはまた、ノイズの多い環境に対する頑健性を示し、実世界の音声でテストした場合、以前のシステムと比較してエラー率を最大50%削減している。
オープンソース公開と影響
Whisper 2022がMITライセンスの下でオープンソースソフトウェアとして公開されたことで、学界と産業界の両方で広く採用された。これはGenerative AIアプリケーションの基盤ツールとなり、リアルタイム転写サービス、音声アシスタント、アクセシビリティツールなどに使用された。モデルのコードと事前訓練された重みはGitHubで利用可能になり、開発者はData Augmentation技術を使用して特定のドメイン向けに微調整することができた。
Whisper 2022は、特に大規模な弱教師付き訓練の使用において、音声認識とDeep learningのその後の研究に影響を与えた。また、AnthropicやGoogle DeepMindの取り組みと並んで、強力なAIモデルをオープンソース化する広範な傾向にも貢献した。このモデルの成功は、データの多様性とモデル規模の重要性を強調し、多言語音声システムのさらなる発展につながった。
制限と倫理的考慮事項
その強みにもかかわらず、Whisper 2022には制限がある。非常に短い音声クリップ(5秒未満)では苦労することがあり、無音や非音声の音声を処理する際にテキストを幻覚することがある。また、このモデルは、一部のアフリカ言語やアジア言語など、訓練データが限られている言語では性能が低下する。さらに、ウェブから取得された訓練データには、偏った内容や不適切な内容が含まれている可能性があり、出力に影響を与える可能性がある。
OpenAIはこれらの問題を認め、高リスクのアプリケーションでWhisperを注意して使用することを推奨した。オープンソースの性質により、コミュニティはモデルを監査し改善することができたが、不正な監視や誤った表現などの潜在的な悪用に関する懸念も提起された。2023年現在、Whisper 2022は音声認識研究で広く使用されるベースラインであり続けており、コミュニティによってその後のバージョンや派生モデルが開発されている。
参考文献と追加情報
Whisper 2022は、2022年9月にOpenAIの研究者によって公開された「Robust Speech Recognition via Large-Scale Weak Supervision」というタイトルの技術論文で紹介された。モデルのアーキテクチャと訓練の詳細はその論文に文書化されており、複数のベンチマークでの評価結果も含まれている。実用的な使用には、公式リポジトリが推論と微調整のスクリプトを提供しており、モデルはAmazon Web ServicesやMicrosoft Azureのクラウドプラットフォームを通じて利用可能である。
さらなる情報は、音声認識とトランスフォーマーモデルに関する学術調査、およびWhisperをGPU推論用に最適化したNVIDIAなどのハードウェアベンダーのドキュメントに記載されている。このモデルがアクセシビリティと多言語コミュニケーションに与える影響は、人間とコンピュータの相互作用研究で引き続き調査されている。