固有モーメントは、コンピュータビジョンとパターン認識で使用される画像記述子の一種である。これらは、画像の幾何学的モーメントから形成される行列の固有値を計算することによって構築される。これらの固有値は、特定の変換、特に回転に対して不変な特徴として機能し、物体認識、形状解析、画像検索などのタスクにおいて価値がある。この概念は、古典的なモーメント理論と線形代数を橋渡しし、画像の形状と強度分布のコンパクトな表現を提供する。
固有モーメントの基礎は、画像上の画素強度の加重平均である幾何学的モーメントの使用にある。2次元画像関数 f(x, y) に対して、次数 (p+q) の生モーメントは m_pq = ∫∫ x^p y^q f(x, y) dx dy と定義される。これらのモーメントは大域的な形状情報を捉えるが、並進とスケールに敏感である。固有モーメントは、まず画像を標準的な位置とサイズに正規化し、次に選択されたモーメントから共分散に類似した行列を構築することで、この問題に対処する。この行列の固有値が固有モーメントであり、回転は固有値を保存する直交変換に対応するため、画像が回転してもこれらは不変のままである。
数学的な構築は、通常、画像の重心に対して計算される中心モーメントを含み、並進不変性を保証する。スケール正規化は、モーメントをゼロ次モーメント(総質量)のべき乗で割ることによって達成される。これらの前処理ステップの後、行列が形成され、多くの場合、2次モーメントが使用される。例えば、一般的なアプローチの1つは、行列 [[μ20, μ11], [μ11, μ02]] を使用する。ここで μpq は中心モーメントである。この対称行列の固有値は実数で非負であり、2つの回転不変特徴を提供する。高次モーメントを組み込んでより大きな行列を作成し、より多くの固有モーメントとより豊かな記述子を得ることもできる。
歴史的発展と背景
固有モーメントの概念は、研究者が自動物体認識のための堅牢な特徴を求めた20世紀後半に登場した。正確な起源は単一の人物に帰属されるわけではないが、この技法は1990年代にデジタル画像処理と機械学習の進歩とともに注目を集めた。これは、1962年に導入されたフーの7つの不変モーメントに関する初期の研究に続き、不変性を達成するためにモーメントの代数的組み合わせを使用する、モーメント不変量を開発するより広範な取り組みの一部であった。固有モーメントは、固有値分解を活用することでより体系的なアプローチを提供し、回転を自然に処理し、次元削減の原理に基づいた方法を提供した。
MIT CSAIL や Carnegie Mellon University などの機関の研究者は、モーメントベースの認識の理論的基礎に貢献したが、固有モーメント自体は、産業検査や医用画像における応用研究を通じて開発された。この方法は、回転不変性が重要である文字認識や衛星画像解析で初期に使用された。大規模なトレーニングデータセットを必要とするニューラルネットワークベースのアプローチとは異なり、固有モーメントは画像統計から直接計算されるため、小サンプルシナリオで魅力的である。
機械学習とビジョンにおける応用
固有モーメントは、特徴抽出器として従来の機械学習パイプラインに統合されてきた。典型的なワークフローでは、画像はグレースケールに前処理され、正規化され、その後、固有モーメントが計算されてサポートベクターマシンや決定木などの分類器に入力される。このアプローチは、深層学習が広く採用される前には一般的であり、解釈可能で計算効率の高い特徴を提供した。例えば、手書き数字認識では、最大4次までの固有モーメントが標準ベンチマークで高い精度を達成でき、U-Net などのセグメンテーションタスクの方法を補完した。
Deep learning の時代では、固有モーメントは単独の特徴として使用されることは少なくなったが、ハイブリッドシステムには依然として登場する。一部の研究者は、固有モーメントと Convolutional neural network 特徴を組み合わせて、幾何学的歪みに対する堅牢性を向上させている。また、Data Augmentation 戦略でも使用され、画像の回転バージョンを生成し、一貫した固有モーメント特徴を確保することで、より汎化するモデルのトレーニングに役立つ。さらに、固有モーメントは、解剖学的構造の回転が一般的である医用画像などの分野で、新しい不変特徴学習方法を評価するためのベースラインとして機能する。
数学的性質と拡張
固有モーメントの重要な特性は、その直交性とコンパクト性である。固有値は順序付けられ、通常、最大のものだけがいくつか保持され、支配的な形状特性を捉える低次元表現を提供する。これは主成分分析(PCA)に類似しているが、生の画素データではなくモーメント行列に適用される。使用される固有モーメントの数はハイパーパラメータであり、少なすぎると識別力が失われ、多すぎるとノイズが導入される可能性がある。
固有モーメントの拡張には、複素数値モーメントを使用して回転と反射の両方の不変性を処理する複素固有モーメントが含まれる。もう1つの変種は、単位円板上で直交し、標準的な固有モーメントよりもノイズ耐性の点で優れていることが多い回転不変記述子を生成するツェルニケモーメントの使用である。ただし、固有モーメントは計算と解釈がより簡単である。研究者はまた、固有モーメントと Batch Normalization およびその他の正規化技法を組み合わせて、学習システムの特徴分布を安定させることも模索している。
代替記述子との比較
固有モーメントは、フーモーメント、フーリエ記述子、スケール不変特徴変換(SIFT)などの他の不変記述子としばしば比較される。フーモーメントは計算が軽いが、複雑な形状に対しては識別力が低い。フーリエ記述子は境界情報を捉えるが、輪郭抽出が必要である。SIFT特徴はスケールと回転に対して非常に堅牢であるが、局所的であり、キーポイント検出を必要とするため、より高コストである。固有モーメントは、その中間を提供する。つまり、大域的で、コンパクトで、回転不変であるが、画像全体を要約するため、ノイズとオクルージョンに敏感である。
実際的には、固有モーメントは、クリーンで適切にセグメント化されたオブジェクトがあるシナリオで優れている。局所特徴が必要な散らかったシーンにはあまり適していない。固有モーメントと深層学習特徴の選択は、多くの場合、データの可用性と計算上の制約に依存する。小規模なデータセットでは、固有モーメントはニューラルネットワークよりも優れた性能を発揮することがある。なぜなら、広範なトレーニングを必要としないからである。大規模なデータセットでは、Residual Network (ResNet) などのモデルによって学習された深い特徴の方が表現力が高い傾向がある。
現在の関連性と将来の方向性
深層学習が現代のコンピュータビジョンを支配している一方で、固有モーメントは専門的なアプリケーションで関連性を維持している。これらは、ロボティクスや自動運転車など、計算リソースが限られている組み込みシステムやリアルタイム処理で使用されている。例えば、Waymo や Tesla は知覚に深層学習を依存しているが、軽量なモーメントベースの特徴は、フォールバックやレーンマーキング検出などの特定のタスクに役立つ。産業検査では、固有モーメントは、回転不変性が重要である手術ロボットの器具追跡のために Intuitive Surgical などの企業で採用されている。
将来の研究では、固有モーメントを Transformer (architecture) アーキテクチャと統合し、位置または構造の事前情報として使用することが模索されるかもしれない。また、ニューラルネットワーク内でモーメントベースの特徴をエンドツーエンドで学習し、解釈可能性を向上させることへの関心もある。2020年代半ばの時点で、固有モーメントはトップクラスのAI会議での主流のトピックではないが、教科書や応用工学には残り続けている。その数学的な優雅さにより、画像処理とパターン認識の学生や実務者にとって基礎的な概念であり続けることが保証されている。
関連項目
- moment-invariants(存在する場合)
- image-processing(存在する場合)
- Computer vision(存在する場合)
- feature extraction(存在する場合)