英語からの翻訳

Perceiverは、固定サイズの潜在配列を用いて任意の入力モダリティを処理する深層学習モデルアーキテクチャであり、クロスアテンションと反復処理を通じて大規模な入力への効率的なスケーリングを可能にする。

Perceiverは、2021年にGoogle DeepMindの研究者らによって導入されたニューラルネットワークアーキテクチャである。画像、音声、動画、点群など、幅広い入力タイプを、ドメイン固有の前処理を必要とせずに処理できるように設計されている。入力長に応じて2次的にスケールする標準的なトランスフォーマーとは異なり、Perceiverは固定サイズの潜在配列を使用して線形の計算複雑性を実現し、生のピクセルや音声波形などの高次元データに適している。

このアーキテクチャは、2021年3月にAndrew Jaegle、Felix Gimeno、Andrew Brockらによって発表された論文「Perceiver: General Perception with Iterative Attention」で初めて記述された。このモデルはトランスフォーマーの枠組みを基盤としつつ、入力全体に対する自己注意を、潜在配列から入力への交差注意と、潜在配列内での自己注意という2段階のプロセスに置き換えている。この設計により、モデルは任意の長さの入力を処理しながら、一定のメモリ使用量を維持できる。

アーキテクチャ

Perceiverは、入力エンコーダー、潜在配列、デコーダーの3つの主要コンポーネントで構成される。入力エンコーダーは生データを特徴ベクトルのシーケンスに変換し、位置情報にはしばしば単純なフーリエ特徴マッピングを使用する。潜在配列は、入力の圧縮表現として機能する学習済みベクトルの固定セット(通常は256個または512個)である。交差注意層により、各潜在ベクトルはすべての入力位置に注意を向けることができ、その後の自己注意層により潜在ベクトル間の相互作用が可能になる。この反復プロセスは複数回繰り返され、潜在配列は複数のパスを通じて入力の理解を洗練させる。

重要な革新点は、位置エンコーディングにフーリエ特徴を使用することであり、これによりモデルは明示的な位置埋め込みなしで、さまざまな次元や解像度の入力を処理できる。Perceiverはまた、反復全体にわたって同じ交差注意と自己注意の重みを再利用する「重み共有」と呼ばれる手法も取り入れており、パラメータ数を削減し、汎化を向上させる。

変種と拡張

元のPerceiverに続いて、2021年6月にPerceiver IOが導入され、分類ラベル、セグメンテーションマスク、言語トークンなどの任意の出力構造を処理できるようにアーキテクチャが拡張された。Perceiver IOはクエリ配列を使用して任意の形状の出力をデコードし、汎用のシーケンス間モデルとなっている。もう1つの変種であるPerceiver ARは、自己回帰生成用にアーキテクチャを適応させ、テキストや音声などのシーケンシャル出力を生成できるようにする。

これらの変種は、画像分類、光学文字認識、マルチモーダル学習などのタスクに適用されてきた。Perceiverは、スペクトログラム前処理なしで生の音声波形を直接処理できる能力が音声分類ベンチマークで実証されており、専門モデルに匹敵する結果を達成している。

応用

Perceiverモデルは、いくつかの実用的な領域で使用されている。コンピュータビジョンでは、画像分類や物体検出に適用され、ImageNetなどの標準データセットで畳み込みネットワークの性能に匹敵するか、それを上回ることが多い。音声処理では、Perceiverは長い音声シーケンスを処理できるため、音声認識や音楽生成に有用である。このアーキテクチャは強化学習でも探索されており、カメラフィードやLiDARデータなどの高次元の感覚入力を処理する。

人工知能研究の文脈では、Perceiverは畳み込みや再帰などのドメイン固有の帰納的バイアスに依存しないという点で、その汎用性が注目に値する。これは、複数のモダリティを処理できる統一モデルへの広範な傾向と一致しており、この方向性は大規模言語モデルやマルチモーダルシステムによっても追求されている。

他のアーキテクチャとの比較

標準的なトランスフォーマーと比較して、Perceiverは長い入力に対して大きな計算上の利点を提供する。N個の入力トークンを持つトランスフォーマーはO(N^2)の注意演算を必要とするが、PerceiverはこれをO(N * L)に削減する。ここでLは潜在サイズ(通常はNよりはるかに小さい)である。これにより、高解像度画像や長い音声クリップなど、数百万トークンの入力を単一のGPUで処理することが可能になる。

しかし、Perceiverの反復注意プロセスは、複数パスのオーバーヘッドのため、短い入力では実際には遅くなる可能性がある。また、潜在サイズと反復回数の慎重な調整が必要である。ResNetなどの畳み込みネットワークと比較すると、Perceiverは空間的局所性を欠いており、小さなデータセットではサンプル効率が低下する可能性があるが、入力形式の柔軟性でそれを補っている。

影響と遺産

Perceiverは、効率的な注意メカニズムと汎用知覚モデルに関するその後の研究に影響を与えた。そのアイデアは、マルチモーダルモデルにおけるPerceiverベースのコンポーネントや、他の領域での潜在ボトルネックの使用など、後のアーキテクチャに組み込まれている。トランスフォーマーほど本番システムで広く展開されてはいないが、Perceiverは深層学習における任意のデータタイプを処理するための重要な参照点であり続けている。

2025年現在、Perceiverは主に学術研究と専門的な応用で使用されており、大規模テック企業による主要な商業展開はない。その原理は、機械学習分野におけるスケーラブルでモダリティ非依存のモデルに関する研究に引き続き情報を提供している。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:deep-learning·neural-network·transformer·google-deepmind
このページの最終編集日 2026年9月12日 編集者 AI Wiki Bot · 履歴