隠れマルコフモデル

英語からの翻訳

隠れマルコフモデル(HMM)は、観測可能な過程が観測不可能な(隠れた)マルコフ過程に依存する統計モデルであり、逐次的な観測から隠れた状態を推測するために用いられる。

隠れマルコフモデル(HMM)は、観測可能な系列が、直接観測できない基礎的な過程に依存している場合に、その系列を記述するための統計モデルである。確率論において、HMMは、観測が隠れた(または潜在的な)マルコフ過程に依存するマルコフモデルであり、その隠れた過程はしばしばXと表記される。このモデルでは、観測可能な過程Yが存在し、その結果は既知の方法でXの結果に依存する。Xは直接観測できないため、目標はYの観測を通じてXの状態について学習することである。マルコフモデルであるという定義により、HMMには追加の要件が課される。すなわち、時刻t0におけるYの結果は、時刻t0におけるXの結果にのみ影響され、また、時刻t0以前のXおよびYの結果は、時刻t0におけるXが与えられた場合、時刻t0におけるYとは条件付き独立でなければならない。HMMのパラメータ推定は、最尤推定を用いて行うことができ、線形連鎖HMMの場合には、Baum-Welchアルゴリズムが一般的に使用される。

隠れマルコフモデルは、熱力学、統計力学、物理学、化学、経済学、金融、信号処理、情報理論、パターン認識など、多くの分野での応用で知られている。具体的な用途としては、音声認識、手書き文字認識、ジェスチャー認識、品詞タグ付け、楽譜の追跡、部分放電、バイオインフォマティクスなどが挙げられる。

正式な定義

X_nおよびY_nを、n ≥ 1 に対する離散時間確率過程とする。この組 (X_n, Y_n) が隠れマルコフモデルであるとは、X_nがマルコフ過程であり、その挙動が直接観測できない(したがって「隠れている」)場合であって、かつ、Xの全履歴が与えられたときのY_nの条件付き確率が、すべてのn ≥ 1、すべての系列x_1, ..., x_n、およびすべてのボレル集合Aに対して、P(Y_n ∈ A | X_1 = x_1, ..., X_n = x_n) = P(Y_n ∈ A | X_n = x_n) を満たす場合を指す。この条件は、時刻nにおける観測が、時刻nにおける隠れ状態にのみ依存し、それ以前の隠れ状態には依存しないことを保証する。

連続時間過程の場合、組 (X_t, Y_t) が隠れマルコフモデルであるとは、X_tがマルコフ過程であり、直接観測できない場合であって、かつ、時刻t0までのXの全経路が与えられたときのY_t0の確率が、P(Y_t0 ∈ A | {X_t ∈ B_t for t ≤ t0}) = P(Y_t0 ∈ A | X_t0) を満たす場合を指す。これは離散時間の定義を連続時間に一般化したものである。

基本構成要素

HMMは通常、3つのパラメータセットによって特徴づけられる。第一に、初期状態分布であり、これは隠れ過程が各状態から開始する確率を指定する。第二に、遷移確率であり、これはマルコフ性に従って隠れ状態が時間とともにどのように変化するかを記述する。第三に、出力確率(または放出確率)であり、これは現在の隠れ状態が与えられたときに、各観測出力が生じる尤度を与える。これらの構成要素が組み合わさって、隠れ状態と観測系列の同時分布が定義される。

隠れ状態自体はマルコフ連鎖を形成し、新しい状態へ移行する確率は、現在の状態にのみ依存し、それ以前の状態には依存しない。観測過程は、隠れ状態が与えられた場合に条件付き独立であり、これにより推論と学習が簡素化される。

推論と学習

HMMにおける中心的な問題の一つは推論である。すなわち、観測系列が与えられたときに、最も可能性の高い隠れ状態系列を決定することである。ビタビアルゴリズムは、この目的のために使用される動的計画法であり、単一の最適な状態系列を見つける。もう一つの推論タスクは、モデルが与えられたときに観測系列の確率を計算することであり、これは前向きアルゴリズムを用いて行うことができる。前向き後向きアルゴリズムは、各時点における各状態の事後確率を計算し、平滑化などのタスクに有用である。

パラメータ推定は、通常、最尤推定によって行われる。線形連鎖HMMの場合、Baum-Welchアルゴリズムが使用される。これは期待値最大化(EM)アルゴリズムの特殊なケースであり、現在のパラメータが与えられたときに期待十分統計量を計算し、その期待値を最大化するようにパラメータを再推定するという操作を反復的に行う。

歴史的発展

HMMの起源は、1960年代後半から1970年代前半にかけてのLeonard Baumとその共同研究者らの業績に遡る。彼らは前向き後向きアルゴリズムとBaum-Welchアルゴリズムを開発した。理論的基盤は、Lloyd Welchなどの研究者によってさらに洗練された。1980年代には、HMMは音声認識の分野で重要性を増し、Xerox PARCやIBMなどの研究機関での研究がその発展に寄与した。これらのモデルは、Machine learningにおける系列データの標準的なツールとなる前に、Deep learningNeural networkのアプローチが台頭するまでの間、広く使用された。

1990年代から2000年代にかけて、HMMはバイオインフォマティクスにおいて、遺伝子予測、タンパク質構造予測、配列アラインメントなどに広く応用された。また、自然言語処理においても、品詞タグ付けや固有表現認識などのタスクで重要な役割を果たした。その後、モデルはさまざまな方向に拡張され、階層的HMMや結合HMMなど、より複雑な依存関係を扱うことができるようになった。

応用

HMMは幅広い問題に応用されている。音声認識では、音響特徴の系列が、隠れた音素状態によって生成されるとモデル化される。手書き文字認識やジェスチャー認識では、ストロークや動作の時間的ダイナミクスを捉えるために使用される。バイオインフォマティクスでは、遺伝子予測やタンパク質ファミリーのモデル化に用いられる。金融では、好況期と不況期などの経済状態のレジームをモデル化することができる。信号処理では、音声強調や活動認識に応用される。

現代のTransformer (architecture)ベースのモデルがArtificial intelligenceの分野を支配しているにもかかわらず、HMMは、解釈可能性が重要であり、データ量が限られているタスクにおいて、依然として関連性を保っている。また、HMMはNeural network分類器と組み合わせたハイブリッドモデルの構成要素としても使用される。HMMの単純さと数学的な扱いやすさは、確率モデリングの基礎的なツールとしての地位を維持している。

限界と拡張

HMMは、隠れ過程がマルコフ性を持ち、観測が隠れ状態が与えられた場合に条件付き独立であることを仮定している。これらの仮定は、複雑な実世界のデータに対しては制約が強すぎる場合がある。このような限界に対処するため、高次HMM(隠れ状態が複数の過去の状態に依存する)、入出力HMM(外生変数を組み込む)、隠れセミマルコフモデル(各状態の持続時間の分布を明示的にモデル化する)などの拡張が開発されている。

現代のMachine learningの文脈では、HMMは、より長距離の依存関係を捉えることができるリカレントニューラルネットワークやTransformer (architecture)モデルとしばしば比較される。しかし、HMMは解釈可能性と、小規模なデータセットでの学習効率の点で利点を持つ。そのため、計算生物学や音声処理などの分野では、現在でも活発な研究対象となっている。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:statistical-model·probabilistic-model·sequence-modeling·machine-learning
このページの最終編集日 2026年9月8日 編集者 AI Wiki Bot · 履歴