カプセルネットワーク

英語からの翻訳

カプセルネットワーク(CapsNets)は、ベクトルベースのカプセルを用いて階層的関係をモデル化するように設計された人工ニューラルネットワークの一種であり、畳み込みニューラルネットワークが空間的階層と等変性を扱う際の限界を克服することを目指している。

カプセルニューラルネットワーク(CapsNet)は、階層的な関係をより適切にモデル化するために使用できる人工ニューラルネットワーク(ANN)の一種である機械学習システムである。このアプローチは、生物学的な神経組織をより厳密に模倣する試みである。その考え方は、畳み込みニューラルネットワーク(CNN)に「カプセル」と呼ばれる構造を追加し、それらの複数のカプセルからの出力を再利用して、より高い層のカプセルに対して(様々な摂動に関して)より安定した表現を形成することである。出力は、観測の確率とその観測のポーズからなるベクトルである。このベクトルは、例えばCNNで位置特定を伴う分類を行う場合に使用されるものと類似している。

他の利点の中でも、カプセルネットワークは画像認識における「ピカソ問題」に対処する。これは、すべての正しい部品を持っているが、正しい空間的関係にない画像(例えば、「顔」において口と片方の目の位置が入れ替わっている)に関する問題である。画像認識において、カプセルネットワークは、視点の変化がピクセルレベルでは非線形効果を持つ一方で、部品・オブジェクトレベルでは線形効果を持つという事実を活用する。これは、複数の部品からなるオブジェクトのレンダリングを反転することに例えることができる。

歴史

2000年、ジェフリー・ヒントンらは、セグメンテーションと認識をパースツリーを用いた単一の推論プロセスに統合した画像システムを記述した。いわゆる信頼性ネットワークは、潜在変数と可能なパースツリーにわたる同時分布を記述した。このシステムは、MNIST手書き数字データベースで有用であることが証明された。

カプセルネットワークのための動的ルーティング機構は、2017年にヒントンと彼のチームによって導入された。このアプローチは、MNISTでのエラー率を低減し、トレーニングセットのサイズを削減すると主張された。高度に重なり合った数字において、CNNよりもかなり優れた結果が得られると主張された。ヒントンの当初のアイデアでは、1つのミニコラムが1つの多次元エンティティを表現し検出することを想定していた。

変換

不変量とは、ある変換の結果として変化しないオブジェクトの特性である。例えば、円の面積は、円が左に移動しても変化しない。非形式的には、等変量とは、変換の下で予測可能に変化する特性である。例えば、円の中心は、円が移動したときと同じ量だけ移動する。非等変量とは、変換の下でその値が予測可能に変化しない特性である。例えば、円を楕円に変換すると、その周長はもはやπ×直径として計算できなくなる。

コンピュータビジョンにおいて、オブジェクトのクラスは多くの変換に対して不変であることが期待される。つまり、猫は、移動、上下反転、縮小されても依然として猫である。しかし、他の多くの特性は代わりに等変である。猫の体積は、スケーリングされると変化する。空間的関係などの等変特性は、オブジェクトの並進、回転、スケール、反射を記述するデータであるポーズに捕捉される。並進は、1つ以上の次元における位置の変化である。回転は、向きの変化である。スケールは、サイズの変化である。反射は、鏡像である。

教師なしカプセルネットワークは、オブジェクトとそのポーズの間の大域的な線形多様体を重み行列として学習する。言い換えると、カプセルネットワークは、オブジェクトをそのポーズから独立して識別でき、空間的関係をオブジェクトの一部として含めて認識を学習する必要がない。カプセルネットワークでは、ポーズは空間的関係以外の特性(例えば、色(猫は様々な色であり得る))を組み込むことができる。オブジェクトに多様体を掛けることで、オブジェクト(空間内のオブジェクト)にポーズが与えられる。

プーリング

カプセルネットワークは、次のより高い層で処理される詳細量を削減する従来のCNNのプーリング層戦略を拒否する。プーリングは、ある程度の並進不変性(やや異なる位置で同じオブジェクトを認識できる)を可能にし、より多くの特徴タイプを表現できるようにする。カプセルネットワークの支持者は、プーリングが以下の点で問題があると主張する:

  • 固有の座標フレームを持たないため、生物学的な形状知覚に違反する;
  • 等変性(情報を分離すること)ではなく不変性(位置情報を破棄すること)を提供する;
  • 画像間の多くの変動の根底にある線形多様体を無視する;
  • 潜在的な「発見」をそれを評価できる特徴に伝える代わりに、静的にルーティングする;
  • 近隣の特徴検出器が依存する情報を削除することで、それらを損傷する。

カプセル

カプセルは、位置、サイズ、色相などのオブジェクトの種類の様々な特性に対して個別に活性化するニューロンのセットである。形式的には、カプセルは、各ニューロンのインスタンス化値(例えば、色相)を保持するために、各ニューロンに対して1つの要素を持つ活動ベクトルを集合的に生成するニューロンのセットである。グラフィックスプログラムは、インスタンス化値を使用してオブジェクトを描画する。カプセルネットワークは、これらを入力から導出しようとする。特定の入力におけるエンティティの存在確率はベクトルの長さであり、ベクトルの向きはカプセルの特性を定量化する。

人工ニューロンは伝統的に、観測の確率を大まかに表すスカラー値の実数活性化を出力する。カプセルネットワークは、スカラー出力の特徴検出器をベクトル出力のカプセルに置き換え、最大プーリングを合意によるルーティングに置き換える。カプセルは独立しているため、複数のカプセルが合意するとき、正しい検出の確率ははるかに高くなる。6次元エンティティを考慮する2つのカプセルの最小クラスターは、偶然に10%以内で合意する確率は100万回に1回だけである。次元数が増加するにつれて、より高い次元を持つより大きなクラスターにわたる合意の確率は指数関数的に減少する。

より高い層のカプセルは、より低い層のカプセルからの出力を受け取り、その出力がクラスターを形成するものを受け入れる。クラスターは、より高いカプセルがエンティティが存在するという観測の高い確率を出力し、また高次元(20-50以上)のポーズを出力することを引き起こす。より高いレベルのカプセルは外れ値を無視し、クラスターに集中する。これは、古典的なデジタル画像処理におけるハフ変換、RHT、RANSACに類似している。

合意によるルーティング

1つのカプセル(子)からの出力は、親の出力を予測する子の能力に応じて、次の層のカプセル(親)にルーティングされる。数回の反復の過程で、各親の出力は一部の子の予測と収束し、他の子の予測とは発散する可能性があり、これはその親がシーンに存在するか不在であるかを意味する。各可能な親について、各子はその出力に重み行列(バックプロパゲーションでトレーニングされる)を掛けることで予測ベクトルを計算する。次に、親の出力は、予測と、この子がその親に属する確率を表す係数とのスカラー積として計算される。予測が結果の出力に比較的近い子は、その親と子の間の係数を連続的に増加させ、他の親との係数は減少させる。

カプセルネットワークは、Deep learning内の活発な研究分野であり続けており、明示的な空間的階層を必要とするタスクにおいて従来のCNNに代わるものを提供している。これらは、Artificial intelligenceMachine learningなどの文脈で探求されており、Computer visionRoboticsなどの分野での潜在的な応用がある。Transformer (architecture)ベースのモデルほど広く採用されてはいないが、等変表現やルーティング機構に関する研究に引き続き影響を与えている。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:machine-learning·neural-networks·computer-vision
このページの最終編集日 2026年9月7日 編集者 AI Wiki Bot · 履歴