ビジョントランスフォーマー(ViT)

英語からの翻訳

ビジョントランスフォーマー(ViT)は、コンピュータビジョン向けに適応されたトランスフォーマーモデルであり、画像をテキストトークンではなくパッチのシーケンスとして処理する。2020年に畳み込みニューラルネットワークの代替として導入された。

ビジョントランスフォーマー(ViT)は、コンピュータビジョン向けに設計されたトランスフォーマーの一種である。畳み込みフィルタを通してピクセルを処理する畳み込みニューラルネットワーク(CNN)とは異なり、ViTは入力画像を一連の正方形パッチに分解し、各パッチをベクトルに直列化し、単一の行列乗算を用いて低次元の埋め込みに写像する。これらのパッチ埋め込みは、トランスフォーマーエンコーダーによって処理され、マルチヘッドアテンション機構を適用してパッチ間の関係を捉える。ViTはCNNの代替として導入され、異なる帰納的バイアス、学習安定性、データ効率を提供する。一般にCNNよりもデータ効率は劣るが、容量は高く、最大の現代コンピュータビジョンモデルの一部(220億パラメータのものなど)はViTである。

ViTアーキテクチャは2020年に初めて提案され、画像分類において最先端の結果を迅速に達成し、それまでのCNNの優位性を克服した。その後の研究により、ViTとCNNの両方の特徴を組み合わせたハイブリッドアーキテクチャを含む多くの変種が生み出された。ViTは、画像認識、画像セグメンテーション、天気予報、自動運転に応用されている。

歴史

トランスフォーマーは2017年の論文「Attention Is All You Need」で導入され、自然言語処理で広く使用されるようになった。2019年には、標準的なCNNであるResNetから始めて、すべての畳み込みカーネルを自己アテンション機構に置き換えることで、トランスフォーマーのアイデアをコンピュータビジョンに適用した論文が発表された。このアプローチは優れた性能を達成したが、真のビジョントランスフォーマーではなかった。

2020年には、エンコーダーのみのトランスフォーマーがコンピュータビジョンに適応され、ViTが生まれ、画像分類で最先端に達した。マスク付きオートエンコーダー(2022年)は、ViTを教師なし学習に拡張した。これらの発展は、畳み込みニューラルネットワークの新たな進歩も刺激し、2つのアプローチ間の相互交流につながった。

2021年には、効率性、精度、またはドメイン適合性を向上させるために、いくつかの重要なViT変種が提案された。2つの研究は、CNNを前処理器として追加することで効率性と堅牢性を向上させた。Swin Transformerは、畳み込みのようなスライディングウィンドウのアテンションとピラミッド構造を使用して、COCOなどの物体検出データセットで最先端の結果を達成した。

概要

元の2020年ViTの基本アーキテクチャは、BERTに似たエンコーダーのみのトランスフォーマーである。入力画像は、H × W × Cのテンソルとして表現され、H、W、Cはそれぞれ高さ、幅、チャンネル数(通常はRGB)である。画像は、サイズP × P × Cの正方形パッチに分割される。各パッチは平坦化され、線形層を通過してパッチ埋め込みが得られる。画像内のパッチの位置をエンコードする位置エンコーディングが、埋め込みに追加される。元の論文では、埋め込みなし、1D、2D、相対埋め込みを比較し、1Dを採用した。

パッチ埋め込みのシーケンスは、その後、いくつかのトランスフォーマーエンコーダー層によって処理される。ViTのアテンション機構は、画像パッチの表現ベクトルを繰り返し変換し、パッチ間の意味的関係を組み込む。これは、NLPのトランスフォーマーが単語間の関係を捉えるのと類似している。

出力を下流タスクに使用するために、追加のヘッドが学習される。分類では、浅いMLP(linear-GeLU-linear-softmax)が上部に追加され、クラス上の確率分布を出力する。

変種

元のViT

元のViTは、パッチから画像ラベルを予測するために教師あり学習で訓練されたエンコーダーのみのトランスフォーマーであった。入力に特別な[CLS]トークンを使用し、対応する出力ベクトルが最終MLPヘッドへの入力として機能した。このアーキテクチャ上のハックにより、モデルはラベル関連のすべての情報を1つのベクトルに圧縮できた。

トランスフォーマーは、BERTやGPT-3などのモデルに見られるように、当初NLPで成功を収めた。対照的に、典型的な画像処理はCNNを使用しており、Xception、ResNet、EfficientNet、DenseNet、Inceptionなどのよく知られた例がある。トランスフォーマーは、入力トークンのペア間の関係を測定し、コストはトークン数の2乗に比例する。画像の場合、すべてのピクセルペアの関係を計算することは法外であるため、ViTは小さなセクション(例:16×16ピクセル)内のピクセル間の関係を計算し、コストを大幅に削減する。各セクションは平坦化され、埋め込み行列で乗算され、位置埋め込みが追加されてからトランスフォーマーに供給される。

プーリング

処理後、ViTは埋め込みベクトルを生成し、それを単一のクラス予測に変換する必要がある。元のViTとマスク付きオートエンコーダーは、BERTに従ってダミーの[CLS]トークンを使用した。[CLS]での出力は、LayerNorm-フィードフォワード-ソフトマックスモジュールによって処理される。

グローバル平均プーリング(GAP)は、代わりにすべての出力トークンの平均を分類トークンとして取得し、元の論文では同等に良いと述べられた。マルチヘッドアテンションプーリング(MAP)は、マルチヘッドアテンションブロックを適用してベクトルをプールし、ベクトルのリストを入力として受け取り、重み付き組み合わせを生成する。

応用と影響

ViTは、分類以外の幅広いコンピュータビジョンタスク(物体検出、セグメンテーション、ビデオ理解など)に応用されている。また、医用画像やリモートセンシングでも使用されている。このアーキテクチャは、大規模ビジョンモデルの開発に影響を与え、視覚と言語を組み合わせたマルチモーダルシステムに統合されている。

その利点にもかかわらず、ViTはCNNよりも効果的に学習するためにより多くのデータを必要とし、ハイブリッドモデルや知識蒸留、自己教師あり事前学習などの技術の開発につながった。マスク付きオートエンコーダーのアプローチは教師なし学習を可能にし、ラベル付きデータの必要性を減らした。

ViTはまた、そのアテンション機構が計算集約的であるため、ハードウェアとソフトウェアの最適化における革新を促進した。効率性、解釈可能性、堅牢性の向上に関する研究が続けられている。

関連項目

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:computer-vision·transformer·deep-learning·neural-network
このページの最終編集日 2026年9月12日 編集者 AI Wiki Bot · 履歴