CMU発音辞書(cmudictとしても知られる)は、北米英語のための機械可読な発音辞書である。これはCarnegie Mellon Universityで作成され、大学の音声グループによって維持されている。この辞書は、39の音素(強勢記号を含む)のセットを使用して、単語から音声転写へのマッピングを提供する。これはパブリックドメインに公開されており、音声技術と計算言語学の基盤となるリソースとなっている。
この辞書の起源は1980年代に遡り、カーネギーメロン大学での音声認識研究用に開発された。最初の公開リリースは1993年に行われ、それ以降継続的に更新されている。現在のバージョン(0.7b)には134,000以上のエントリが含まれており、一般的な単語、固有名詞、頭字語をカバーしている。各エントリは小文字の単語をリストし、その後に母音の後に配置された強勢指標(0、1、または2)を伴う音素シーケンスが続く。
音素セットと転写形式
CMU発音辞書は、元々ARPA音声理解研究プロジェクト用に開発されたARPABETシステムに基づく音素セットを使用している。このセットには39の音素が含まれており、母音(例:AA、IY、UW)や子音(例:K、S、T)などがある。強勢は数字で示され、0は強勢なし、1は第一強勢、2は第二強勢を表す。例えば、単語「hello」は「HH AH0 L OW1」と転写される。この形式はシンプルで、ASCIIベースであり、ソフトウェアで簡単に解析できる。
この辞書には、多くの単語の複数の発音も含まれており、括弧付きの数字で示される(例:「the(1)」と「the(2)」)。これらの変異形は、地域的または文脈的な違いを捉えており、例えば「the」におけるシュワー音と強勢母音の違いなどがある。さらに、屈折形、複合語、および英語で一般的に使用される一部の外国語のエントリも含まれている。
音声技術における応用
この辞書は、音声処理のためのArtificial intelligenceおよびMachine learningパイプラインにおける標準的なリソースである。これは自動音声認識(ASR)システムの発音辞書として使用され、モデルが音響信号を単語シーケンスにマッピングできるようにする。テキスト読み上げ(TTS)合成では、自然な音声を生成するために必要な音声入力を提供する。KaldiやESPnetなどの多くのオープンソースツールキットは、cmudictをデフォルトの辞書として含んでいる。
ASRとTTSに加えて、この辞書はNatural language processingタスク、例えば書記素から音素への変換に使用され、モデルが未知の単語の発音を予測することを学ぶ。また、発音予測アルゴリズムを評価するためのベンチマークとしても機能する。Stanford AI LabやMIT CSAILなどの機関の研究者は、音声アライメントや音声合成に関する研究でcmudictを使用してきた。
形式と配布
この辞書はプレーンテキストファイルとして配布され、1行に1エントリが含まれる。形式は、単語の後に1つ以上のスペース、その後に音素シーケンスが続く。コメントやメタデータは最小限で、ファイルをコンパクトに保っている。これはカーネギーメロン大学音声グループのウェブサイトからダウンロード可能であり、多くのオープンソースリポジトリにミラーリングされている。パブリックドメインのステータスにより、無制限の使用、変更、再配布が可能であり、商業プロジェクトと学術プロジェクトの両方で好まれる選択肢となっている。
長年にわたり、cmudictからいくつかの派生リソースが作成されており、他の言語用の発音辞書(翻訳による)や、音節境界や品詞タグが追加された辞書などがある。これらの派生版は、Deep learningモデルで音声と言語のために頻繁に使用され、エンドツーエンドシステムのための監視信号を提供する。
制限と拡張
包括的ではあるが、この辞書には既知の制限がある。北米英語のみをカバーしており、その音素セットはすべての方言の変異を捉えていない。一部のエントリは古くなっているか、最近の固有名詞や技術用語が欠けている場合がある。これに対処するため、コミュニティの取り組みにより拡張版が作成されており、例えばWiktionaryから追加された単語を含むcmudictや、強勢と音節注釈が付いたCMUdictなどがある。これらの拡張版は、大規模で多様な辞書を必要とする現代のTransformer (architecture)ベースのTTSシステムで頻繁に使用されている。
これらの制限にもかかわらず、CMU発音辞書は音声研究の礎であり続けている。そのシンプルさ、信頼性、オープンライセンスにより、初期のルールベースシステムから現代のNeural networkアプローチまで、30年以上にわたってその関連性が確保されている。
関連項目
- Sequence-to-Sequence (Seq2Seq) 発音辞書を使用するモデルについて
- Data Augmentation 合成音声データを生成する技術について
- Carnegie Mellon University 発祥の機関として