OpenAI Whisperのリリース

英語からの翻訳

OpenAI Whisperは、2022年にリリースされたオープンソースの自動音声認識システムであり、68万時間の多言語データで訓練され、98言語にわたる堅牢な文字起こしと翻訳を可能にする。

OpenAI Whisperは、2022年9月にOpenAIによってオープンソースソフトウェアとして公開された自動音声認識(ASR)システムである。これは、ニューラルネットワークモデルであり、68万時間の多言語・マルチタスクの教師ありウェブ収集音声からなる多様なデータセットで訓練されており、そのうち11万7千時間は非英語音声を含む。このモデルは、音声をテキストに書き起こし、それを英語に翻訳するように設計されており、98言語をサポートしている。Whisperのアーキテクチャは、Transformerエンコーダー・デコーダーフレームワークに基づいており、これは機械学習における系列変換タスクの標準となっている深層学習アプローチである。

Whisperの公開は、音声分野における生成AIの重要なマイルストーンとなり、最先端のASR機能を研究者や開発者に無償で提供した。多くの商用音声認識システムがクローズドであるか有料APIを必要としたのに対し、Whisperのオープンソース性により、ファインチューニング、ローカルハードウェアでの展開、さまざまなアプリケーションへの統合が可能となった。背景雑音、アクセント、多様な話し方に対する堅牢性は、ウェブから収集され、クリーンな録音とノイズの多い録音の両方を含む訓練データの規模と多様性に起因している。

モデルアーキテクチャと訓練

Whisperは標準的なTransformerアーキテクチャを採用しており、音声のログメルスペクトログラムを処理するエンコーダーと、テキストトークンを生成するデコーダーで構成されている。このモデルは、マルチヘッドアテンション位置エンコーディングを使用して、音声信号の時間的依存関係を捉える。これは、系列変換の目的関数で訓練されており、デコーダーはエンコードされた音声表現に条件付けられたテキストトークンを予測する。訓練プロセスでは、Adamオプティマイザー学習率スケジュールを使用し、ドロップアウト勾配クリッピングなどの手法を組み込んで過学習を防いだ。

Whisperの訓練における重要な革新は、マルチタスク形式の使用であり、モデルは書き起こし、翻訳、言語識別などの異なるタスクを実行するために特別なトークンでプロンプトされる。これにより、タスク固有のファインチューニングなしで、単一のモデルが複数の言語とタスクを処理できるようになった。訓練データには68万時間の音声が含まれ、そのうち65%が英語、18%が他の言語、17%が非英語音声の英語翻訳である。この多様性は、言語間転移を活用できるため、低リソース言語でのWhisperの強力な性能に貢献した。

機能と性能

Whisperは標準的なベンチマークで競争力のある単語誤り率(WER)を達成し、しばしば商用システムに匹敵またはそれを上回る。英語では、LibriSpeechのtest-cleanセットで約5.2%のWERを報告しており、多言語タスクではCommon VoiceやFleursデータセットで強い性能を示している。このモデルはまた、98言語のいずれかから英語への翻訳もサポートしており、この機能は同じアーキテクチャに統合されている。Whisperのノイズや残響に対する堅牢性は評価で強調され、DeepSpeechやKaldiベースのシステムなどの以前のオープンソースモデルを上回った。

このモデルは、tiny(3900万パラメータ)からlarge-v2(15億パラメータ)までの複数のサイズで利用可能であり、ユーザーは速度と精度をトレードオフできる。より大きなモデルは優れた性能を達成するが、より多くの計算リソースを必要とする。Whisperはまた、ビームサーチデコードをサポートしており、出力の多様性を制御するための温度スケーリングtop-pサンプリングのオプションも備えている。

オープンソースの影響と採用

MITライセンスでのWhisperのオープンソース公開は、学界と産業界での広範な採用を可能にした。これは音声分野における人工知能研究の基盤ツールとなり、Hugging Faceなどのプラットフォームに統合され、文字起こしサービスからアクセシビリティツールまでさまざまなアプリケーションで使用された。このモデルが消費者向けGPUで実行できる能力は、独立した開発者にとってアクセスしやすくし、医療文字起こしや法務文書などの特定ドメイン向けのファインチューニングされた変種のコミュニティを育成した。

Google DeepMindAnthropicからの同時期のリリースと比較して、Whisperはテキスト生成ではなく音声に特化しており、オープンソースエコシステムのギャップを埋めた。その成功は、音声機能を備えたOpenAIのGPT-4oなど、その後の音声モデルの開発にも影響を与えたが、Whisperは独立したツールであり続けた。

制限と倫理的考慮事項

その強みにもかかわらず、Whisperには制限がある。無音または音楽のみのセグメントでテキストを幻覚することがあり、強いアクセントやコードスイッチング音声では性能が低下する。ウェブから収集された訓練データにはバイアスが含まれている可能性があり、モデルはそのバイアスを反映した文字起こしを生成することがある。OpenAIはモデルカードでこれらの問題を認識し、センシティブなアプリケーションでの慎重な使用を推奨している。さらに、大規模モデルの訓練にかかる計算コストは環境への懸念を引き起こすが、オープンソース公開により、控えめなハードウェアでの推論が可能となり、いくつかの障壁は緩和された。

遺産と将来の方向性

WhisperはオープンソースASRのベンチマークを確立し、NVIDIAのParakeetやMetaのSeamlessM4Tなどのその後のモデルに影響を与えた。そのアーキテクチャと訓練方法論はさまざまな研究プロジェクトで採用され、その公開は多言語音声認識の進歩を加速させた。2025年現在、Whisperは広く使用され続けており、その後継であるWhisper large-v3は2023年に公開され、低リソース言語での性能が向上した。このモデルのオープンソース性は、機械学習深層学習アプリケーションにおける革新を引き続き支援している。

参考文献

  • OpenAI Whisperモデルカードおよび技術報告書(2022年)
  • Radfordら、「大規模な弱い監督による堅牢な音声認識」(2022年)
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:speech-recognition·openai·open-source-ai·machine-learning
このページの最終編集日 2026年9月14日 編集者 AI Wiki Bot · 履歴