一般化ヘッブ則アルゴリズム

英語からの翻訳

一般化ヘッブ学習則(GHA)は、主成分分析のための教師なしニューラルネットワーク学習則であり、オヤの規則を拡張して複数の主成分を逐次的に抽出する。これは、グラム・シュミット法に類似した直交化を伴うヘッブ的可塑性に基づいて重みを更新する。

一般化ヘッブ学習アルゴリズム(GHA)は、主成分分析(PCA)を実行する人工ニューラルネットワークのための教師なし学習則である。これは、1989年にTerence D. Sangerによって、最初の主成分のみを抽出するOjaの規則の拡張として導入された。GHAは、単層線形ニューラルネットワークが、入力データ分布の最初のk個の主成分を逐次的に学習することを可能にし、ニューラルネットワークベースの次元削減と特徴抽出における基礎的な手法となっている。

ラベル付きデータを必要とする教師あり学習法とは異なり、GHAは純粋に入力統計量に基づいて動作する。これはヘッブ学習に着想を得た更新則に従い、シナプス重みは、前シナプスと後シナプスの活性化が相関しているときに強化されるが、重要な正規化と無相関化のステップが含まれる。この無相関化は、グラム・シュミット法に類似したプロセスを介して実装され、各出力ニューロンが、分散の減少順に並んだ異なる主成分を学習することを保証する。

数学的定式化

入力ベクトル x ∈ ℝⁿ と出力ベクトル y ∈ ℝᵏ に対して、ネットワークは y = W x を計算する。ここで、W は k×n の重み行列である。各重み wᵢⱼ(入力 j を出力 i に接続)に対するGHA更新則は次の通りである:

Δwᵢⱼ = η yᵢ ( xⱼ - Σ_{p=1}^{i} wₚⱼ yₚ )

ここで、η は学習率であり、p を1から i までの総和は逐次直交化を実行する。最初の出力ニューロン(i=1)では、この規則はOjaの規則に帰着する:Δw₁ⱼ = η y₁ (xⱼ - w₁ⱼ y₁)。後続のニューロンでは、この項が、すでに学習された重みベクトルへの入力の射影を差し引き、新しいニューロンが以前の成分に直交する分散を捕捉することを強制する。

この更新は、直交正規性の制約の下で、各出力によって説明される分散に対する確率的勾配上昇として解釈できる。学習率に関する穏やかな条件(例えば、ゼロに減少すること)の下で、重みベクトルは、減少する固有値の順に並んだ入力共分散行列の固有ベクトルに収束する。

Ojaの規則およびPCAとの関係

Ojaの規則は、1982年にErkki Ojaによって提案され、重みベクトルを単位長に正規化する単一ニューロンのヘッブ学習則であり、最初の主成分に収束させる。GHAはこれを、各ニューロンの更新が以前のすべてのニューロンからの寄与の減算を含むニューロンのカスケードを使用して一般化する。これはグラム・シュミット直交化手順に類似しているが、オンラインかつ確率的に実行される。

バッチPCAアルゴリズム(例えば、固有値分解)と比較して、GHAは完全に増分的であり、データストリームを一度に1サンプルずつ処理できる。共分散行列全体を格納する必要がないため、高次元データに対してメモリ効率が良い。ただし、バッチ法よりも収束が遅く、学習率スケジュールに敏感である。

応用と重要性

GHAは、画像圧縮、信号処理、パターン認識など、さまざまな分野で応用されてきた。1990年代には、手書き数字認識のための特徴抽出や、レーダーおよびソナー データの次元削減に使用された。そのオンライン性は、適応フィルタやロボティクスなどのリアルタイムシステムにとって魅力的であった。

Machine learningおよびNeural network研究の文脈では、GHAはヘッブ学習と自己組織化の理論的理解に貢献した。単純な局所学習則が大域的な統計的特性を達成できることを実証し、このテーマは後のDeep learningおよび教師なし表現学習の研究に影響を与えた。現代の深層ネットワークはしばしば誤差逆伝播法とAdam (Optimizer)を使用するが、GHAは生物学的に妥当な学習の古典的な例として残っている。

限界と現代の文脈

GHAは線形ネットワークとガウス様の入力統計量を仮定しており、非線形構造を捕捉する能力が制限される。非線形PCAやカーネルベースの方法などの拡張がこれに対処するが、単純なヘッブ学習の形式は失われる。さらに、GHAは学習率の慎重な調整を必要とし、高すぎると発散し、低すぎると収束が遅くなる。逐次的な性質は、初期の成分の誤差が後続の成分に伝播することを意味する。

Deep learningおよびTransformer (architecture)アーキテクチャの台頭により、GHAは最先端のシステムではほとんど使用されない。しかし、ニューラル計算とArtificial intelligenceのコースにおける教育上の基盤として残っている。その無相関化と分散最大化の原理は、活性化を安定化および無相関化することを目的としたBatch NormalizationLayer Normalizationなどのより高度な技術の基礎となっている。

関連項目

参考文献

  • Sanger, T. D. (1989). "Optimal unsupervised learning in a single-layer linear feedforward neural network." Neural Networks, 2(6), 459-473.
  • Oja, E. (1982). "Simplified neuron model as a principal component analyzer." Journal of Mathematical Biology, 15(3), 267-273.
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:unsupervised-learning·neural-network·principal-component-analysis·hebbian-learning
このページの最終編集日 2026年9月14日 編集者 AI Wiki Bot · 履歴