Swin Transformerは、コンピュータビジョンタスク向けに設計されたビジョントランスフォーマーアーキテクチャの一種である。2021年にマイクロソフトリサーチアジアとカーネギーメロン大学の研究者によって発表された。「Swin」という名前はShifted Windowの略であり、連続する層間でシフトする局所的な非重複ウィンドウ内で自己注意を計算するという中核的なメカニズムを指している。この設計により、モデルは局所的および大域的な視覚情報を効率的に捕捉でき、画像全体にわたって大域的に注意を計算し、画像解像度に対して二次関数的にスケールするという初期のビジョントランスフォーマーの主要な制限に対処している。
自然言語処理用に元々開発された標準的なトランスフォーマーとは異なり、Swin Transformerは畳み込みニューラルネットワークに類似した階層構造を組み込んでいる。高解像度のパッチから始まり、徐々に低解像度で高次元の表現へと統合される複数スケールの特徴マップを構築する。この階層設計により、画像分類、物体検出、セマンティックセグメンテーションを含む幅広い視覚タスクに適しており、さまざまなコンピュータビジョンモデルの汎用バックボーンとして機能できる。
アーキテクチャ
Swin Transformerは、入力画像をまず非重複パッチ(通常は4x4ピクセル)に分割して処理する。各パッチは平坦化され、線形に特徴ベクトルへ埋め込まれる。その後、モデルは複数のステージを適用し、各ステージはいくつかのSwin Transformerブロックで構成される。各ブロック内では、7x7パッチなどの固定サイズの局所ウィンドウ内で自己注意が計算される。この局所注意により、計算複雑性が画像サイズに対して二次関数的から線形に削減される。
ウィンドウ間の情報交換を可能にするため、アーキテクチャは標準のウィンドウベースブロックとシフトウィンドウブロックの2種類を交互に使用する。シフトウィンドウブロックでは、ウィンドウ分割が一定数のパッチだけオフセットされ、モデルが以前は異なるウィンドウにあった隣接領域に注意を向けることができる。このシフトメカニズムは、効率を維持しながら長距離依存関係をモデル化するために重要である。ステージ間では、パッチマージング層が空間解像度を2分の1に削減し、特徴次元を増加させて、階層的な特徴ピラミッドを作成する。
主な特徴
Swin Transformerは、初期のビジョントランスフォーマーと区別するいくつかの革新を導入している。シフトウィンドウアプローチにより、効率的な計算が可能になりながら、連続する層を通じて大域的なコンテキストモデリングも可能になる。階層アーキテクチャは、物体がさまざまなスケールで現れる物体検出やセグメンテーションなどのタスクに不可欠な多スケール特徴マップを提供する。さらに、モデルは相対位置エンコーディングを使用しており、絶対位置エンコーディングよりも異なる入力解像度への一般化に優れている。
もう一つの重要な特徴は、バックボーンネットワークとしての柔軟性である。Swin Transformerは、ResNetスタイルのアーキテクチャや特徴ピラミッドネットワークなどの既存のコンピュータビジョンフレームワークに、最小限の変更で統合できる。これにより、医療画像から自動運転まで、多くの下流アプリケーションで人気のある選択肢となっている。
性能と影響
元の論文では、Swin Transformerはいくつかのベンチマークで最先端の結果を達成した。ImageNet-1K分類で84.0%のトップ1精度を達成し、以前のビジョントランスフォーマーや畳み込みネットワークを上回った。COCO物体検出データセットでは、Mask R-CNN検出器でボックスAP 51.9を達成し、ADE20Kセマンティックセグメンテーションでは53.5 mIoUに達した。これらの結果は、純粋なトランスフォーマーアーキテクチャが確立された畳み込みモデルの性能に匹敵するか、それを超えることができることを示した。
Swin Transformerはコンピュータビジョンの分野に大きな影響を与えた。トレーニング安定性の問題に対処し、モデルをより大規模な容量にスケールしたSwin Transformer V2を含む一連のモデルを生み出した。また、他の階層型ビジョントランスフォーマーや、畳み込みと注意メカニズムを組み合わせたハイブリッドモデルの設計にも影響を与えた。このアーキテクチャは、特に高解像度入力や多スケール特徴抽出を必要とするタスクにおいて、研究および産業で広く採用されている。
応用
Swin Transformerは、多様なコンピュータビジョン問題に応用されている。医療画像では、腫瘍セグメンテーション、疾患分類、画像再構成に使用されている。リモートセンシングでは、土地被覆分類や衛星画像の物体検出に役立っている。このモデルはまた、フレームを追加の次元として扱うことで時空間データを処理するビデオ理解タスクのバックボーンとしても機能する。その効率性と精度により、エッジデバイスでのリアルタイムアプリケーションに適しており、PyTorchやTensorFlowなどのフレームワークに統合され、簡単に展開できる。
変種と拡張
特定のニーズに対応するため、Swin Transformerのいくつかの変種が開発されている。2021年にリリースされたSwin Transformer V2は、大規模モデルのトレーニング安定性を向上させるための残差後正規化やコサイン注意などの改善を導入した。また、さまざまな入力解像度をより適切に処理するための対数間隔連続相対位置バイアスも提案した。他の拡張には、医療画像セグメンテーション用にアーキテクチャを適応させたSwin-Unetや、超解像やノイズ除去などの画像復元タスク用に設計されたSwinIRがある。これらの変種は、シフトウィンドウの概念がさまざまな問題領域に適応可能であることを示している。
制限
その強みにもかかわらず、Swin Transformerにはいくつかの制限がある。固定ウィンドウサイズはすべての画像に最適とは限らず、シフトウィンドウメカニズムは実装に複雑さを追加する。畳み込みネットワークと比較して、トランスフォーマーは一般的にゼロからトレーニングするためにより多くのデータと計算リソースを必要とする。モデルはまた、マルチヘッド自己注意に依存しており、局所ウィンドウ設計がこの問題を軽減するものの、非常に高解像度の入力ではメモリ集約的になる可能性がある。研究者はこれらの課題に対処する方法を引き続き探求しており、効率的なビジョントランスフォーマー設計のさらなる革新につながっている。