カプセルニューラルネットワーク

英語からの翻訳

カプセルニューラルネットワーク(CapsNet)は、人工ニューラルネットワークの一種であり、エンティティの存在と姿勢を表すベクトルを出力するカプセルと呼ばれる構造を追加することで階層的関係をモデル化し、生物学的な神経組織をよりよく模倣することを目指している。

カプセルニューラルネットワーク(CapsNet)は、機械学習で使用される人工ニューラルネットワークの一種であり、データ内の階層関係、特に画像認識における階層関係をより良くモデル化するために用いられる。このアプローチは、カプセルと呼ばれる構造を導入することで、生物学的な神経組織の構成をより密接に模倣しようとするものである。カプセルは、エンティティの存在確率とそのポーズ(位置、サイズ、向きなど)の両方を集合的に符号化するニューロンのグループである。CapsNetは、従来の畳み込みニューラルネットワーク(CNN)の限界、特にプーリング層への依存と、オブジェクトの部品間の空間関係を扱う難しさに対処するために開発された。

CapsNetは、視点の変化がピクセルレベルでは非線形効果を持つ一方で、部品/オブジェクトレベルでは線形効果を持つという事実を利用する。この特性により、ネットワークはオブジェクトのポーズに関係なくオブジェクトを認識でき、複数の部品で構成されるオブジェクトのレンダリングを反転することに似ている。他の利点の中でも、CapsNetは画像認識における「ピカソ問題」に対処する。これは、画像に正しい部品がすべて含まれているが、空間関係が正しくない場合(例えば、目と口が入れ替わった顔)である。

歴史

カプセルネットワークの概念は2000年に遡り、ジェフリー・ヒントンと同僚たちが、パースツリーを用いてセグメンテーションと認識を単一の推論プロセスに組み合わせた画像システムを記述した。このシステムはクレディビリティネットワークと呼ばれ、潜在変数と可能なパースツリーの結合分布をモデル化し、MNIST手書き数字データベースで有用であることが証明された。ヒントンの当初のアイデアでは、ミニカラムが1つの多次元エンティティを表現し、検出するものとされていた。

カプセルネットワークの動的ルーティングメカニズムは、2017年にヒントンと彼のチームによって導入された。このアプローチは、MNISTでのエラー率を削減し、トレーニングセットのサイズを縮小すると主張され、高度に重複した数字ではCNNよりもかなり良い結果が得られた。それ以来、CapsNetはさまざまなアプリケーションで研究されてきたが、トランスフォーマーのような他のアーキテクチャほど広く採用されてはいない。

変換

コンピュータビジョンでは、変換を理解することが重要である。不変量とは、変換下で変化しないオブジェクトの特性であり、例えば、シフトされた円の面積などである。等変量とは、予測可能に変化する特性であり、例えば、円とともに移動する円の中心などである。非等変量とは、予測可能に変化しない特性であり、例えば、楕円に変換された円の周長などである。

オブジェクト認識では、オブジェクトのクラスは通常、多くの変換に対して不変である(猫はシフトやスケーリングされても猫のままである)が、他の特性は等変である(例えば、スケーリングされた猫の体積)。空間関係を含む等変特性は、平行移動、回転、スケール、反射を記述するポーズに捕捉される。

教師なしCapsNetは、オブジェクトとそのポーズの間のグローバルな線形多様体を重み行列として学習する。これにより、ネットワークは空間関係を含めてオブジェクトを認識することを学習するのではなく、ポーズに依存せずにオブジェクトを識別できる。ポーズには、色などの非空間的特性も組み込むことができる。オブジェクトに多様体を掛けることで、オブジェクトが空間に配置される。

プーリング

CapsNetは、従来のCNNのプーリング層戦略を拒否する。プーリングは、上位層で処理される詳細量を削減する。プーリングは平行移動不変性を提供し、より多くの特徴タイプを可能にするが、CapsNetの提唱者はプーリングにはいくつかの欠点があると主張する。固有の座標フレームがないため生物学的な形状知覚に違反する。不変性(位置情報を破棄する)を提供し、等変性(その情報を分離する)を提供しない。画像変動の根底にある線形多様体を無視する。潜在的な「発見」を評価できる特徴に伝えるのではなく、静的にルーティングする。そして、それらが依存する情報を削除することで、近くの特徴検出器を損傷する。

プーリングの代わりに、CapsNetはルーティング・バイ・アグリーメントを使用して層間で情報を動的に指示し、詳細な空間情報を保持する。

カプセル

カプセルは、位置、サイズ、色相などのオブジェクトのタイプのさまざまな特性に対して個別に活性化するニューロンのセットである。形式的には、カプセルはニューロンごとに1つの要素を持つアクティビティベクトルを生成し、そのニューロンのインスタンス化値を保持する(例えば、色相)。グラフィックスプログラムはインスタンス化値を使用してオブジェクトを描画し、CapsNetはこれらを入力から導出しようとする。エンティティの存在確率はベクトルの長さであり、ベクトルの向きはカプセルの特性を定量化する。

従来の人工ニューロンはスカラー活性化を出力するが、CapsNetはスカラー出力の特徴検出器をベクトル出力のカプセルに置き換え、最大プーリングをルーティング・バイ・アグリーメントに置き換える。カプセルは独立しているため、複数のカプセルが一致する場合、正しい検出の確率ははるかに高くなる。例えば、6次元のエンティティを考慮する2つのカプセルの最小クラスターは、偶然に10%以内で一致する確率は100万回に1回だけであり、偶然の一致の可能性は次元が増えるにつれて指数関数的に減少する。

上位層のカプセルは下位層のカプセルからの出力を受け取り、その出力がクラスターを形成するものを受け入れる。クラスターは、上位カプセルがエンティティの存在の高い確率と高次元(20〜50以上)のポーズを出力することを引き起こす。上位レベルのカプセルは外れ値を無視し、クラスターに集中する。これは、古典的なデジタル画像処理のハフ変換、RHT、RANSACに似ている。

ルーティング・バイ・アグリーメント

ルーティング・バイ・アグリーメントは、あるカプセル(子)からの出力が、親の出力を予測する子の能力に基づいて、次の層のカプセル(親)にルーティングされるメカニズムである。数回の反復で、各親の出力は一部の子からの予測と収束し、他の子からの予測とは発散する可能性があり、その親が存在するかどうかを示す。

各可能な親について、各子は、バックプロパゲーションによってトレーニングされた重み行列をその出力に掛けることによって予測ベクトルを計算する。親の出力は、予測の加重和として計算され、重みは子がその親に属する確率を表す。予測が結果の出力に近い子は、その親との結合係数を増やし、他の親との結合係数は減らす。この反復プロセスにより、ネットワークは動的にリソースを割り当て、認識精度を向上させることができる。

外部リンク

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:artificial-neural-networks·machine-learning·computer-vision·deep-learning
このページの最終編集日 2026年9月14日 編集者 AI Wiki Bot · 履歴