Segment Anything ViTは、Metaが開発したプロンプト可能な画像セグメンテーションシステムであるSegment Anything Model(SAM)の画像エンコーダー基盤として機能するビジョントランスフォーマーアーキテクチャです。このモデルは、トランスフォーマーベースの設計を用いて入力画像を高次元の特徴埋め込みに変換し、その後、軽量なマスクデコーダーが処理して、点、ボックス、テキストなどのユーザープロンプトに基づいてセグメンテーションマスクを生成します。この基盤は、2023年にSAMフレームワークとともに、1,100万枚の画像に10億以上のマスクを含むSegment Anythingデータセットと併せて導入されました。
Segment Anything ViTは、標準的なビジョントランスフォーマー構造に基づいており、画像を固定サイズのパッチに分割し、積み重ねられたマルチヘッドアテンション層を通じて処理します。残差ネットワークやU-Netなどの従来の畳み込み基盤とは異なり、ViT基盤は各層で画像全体のグローバルな文脈を捉えるため、オブジェクトの境界や関係性の理解を必要とするタスクに適しています。このアーキテクチャには、空間情報を保持するための位置エンコーディングが含まれており、ViT-B、ViT-L、ViT-Hの複数のモデルサイズをサポートし、最大のバージョンは約6億3,200万パラメータを持ちます。
アーキテクチャと設計
Segment Anything ViTは、Dosovitskiyらによって提案された元のビジョントランスフォーマー設計に従い、高密度予測タスク向けに調整された修正を加えています。パッチサイズは16x16ピクセルを使用し、1024x1024の入力画像は64x64のパッチに分割されます。各パッチは線形に埋め込みベクトルへ投影され、トランスフォーマーブロックの前に学習可能な位置エンコーディングが追加されます。この基盤は内部的に標準的なエンコーダー・デコーダー構造を採用していますが、SAMフレームワークでは純粋にエンコーダーとして機能し、層ごとのアップサンプリングプロセスを通じて空間解像度を保持した特徴マップを出力します。
重要な設計上の選択は、ウィンドウ化されたアテンションではなく、グローバルアテンションメカニズムを使用することです。これにより、モデルは任意のパッチの特徴を計算する際に画像全体を考慮でき、広い領域にまたがるオブジェクトや曖昧な境界を持つオブジェクトのセグメンテーションに重要です。また、この基盤には、出力をマスクデコーダーに渡す前に特徴次元をコンパクトな埋め込み空間(通常256チャンネル)に削減するネックモジュールも組み込まれています。
トレーニングとデータ
Segment Anything ViTは、1,100万枚の画像と10億以上のセグメンテーションマスクを含む大規模なコレクションであるSegment Anythingデータセットでトレーニングされました。このデータセットは、自動マスク生成と人間による洗練を組み合わせたデータエンジンを使用して作成されました。トレーニングプロセスでは、マスクアノテーションに対する教師あり学習と、新しいマスクが生成されるにつれてViT基盤を反復的に改善するモデルインザループアプローチを組み合わせました。
トレーニングでは、最適化のためのAdamオプティマイザー、一般化を向上させるためのデータ拡張、トレーニングを安定させるための勾配クリッピングなど、標準的な深層学習技術が採用されました。モデルはGPUクラスターでトレーニングされましたが、具体的なハードウェアの詳細は公に文書化されていません。より大きな容量を持つViT-Hバリアントは、最高のセグメンテーション品質を達成しましたが、トレーニングと推論の両方でより多くの計算リソースを必要としました。
アプリケーションと影響
Segment Anything ViTは、SAMモデルがゼロショットセグメンテーション、つまり特定のカテゴリに対する事前のファインチューニングなしで画像内のオブジェクトをセグメント化する能力を実行できるようにしました。これは、人工知能の分野、例えば医用画像、自動運転、ロボティクスなどに幅広い応用があります。例えば、この基盤はクロスアテンションメカニズムと組み合わせてテキストプロンプトを統合でき、ユーザーが自然言語でオブジェクトを記述してセグメント化できるようにします。
SAMとそのViT基盤のリリースは、その後の対話型セグメンテーションやコンピュータビジョンの基盤モデルに関する研究に影響を与えました。これは、多様なデータでトレーニングされた単一のモデルが、大規模言語モデルがテキストタスク全体で一般化するのと同様に、未知のオブジェクトやシーンに一般化できることを実証しました。このアーキテクチャは、深度推定やエッジ検出などの他の高密度予測タスクに適応され、さまざまなオープンソースツールキットに統合されています。
パフォーマンスと限界
ベンチマーク評価では、Segment Anything ViT-H基盤は、複数のデータセットにわたって平均Intersection over Union(mIoU)などの標準的なセグメンテーションメトリクスで強力なパフォーマンスを達成しました。しかし、このモデルには既知の限界があります。非常に小さなオブジェクト、重度に遮蔽されたオブジェクト、または異常な照明条件の画像では苦労することがあります。また、ViT基盤は計算集約的であり、かなりのメモリと処理能力を必要とするため、最適化なしではエッジデバイスでの使用が制限されます。
研究によると、入力画像が大幅にダウンスケールされると、パッチ埋め込みプロセスで細かい詳細が失われるため、基盤のパフォーマンスが低下します。さらに、このモデルは本質的にオブジェクトの意味を理解していません。視覚パターンに基づいてセグメント化するため、カテゴリ知識に基づくものではなく、曖昧なケースでは過剰セグメンテーションや過少セグメンテーションが発生する可能性があります。
関連する発展
Segment Anything ViTは、元のViTモデルや階層的設計などのその後の改善を含む、ビジョントランスフォーマーに関する初期の研究に基づいています。これは、局所受容野を通じて画像を処理する残差ネットワークやU-Netなどの畳み込みアプローチとは異なります。また、この基盤は、計算コストを削減するための効率的なアテンションメカニズムやスパーストランスフォーマーを組み込んだ後続モデルにも影響を与えました。
生成AIのより広い文脈では、Segment Anything ViTは、単一のアーキテクチャで複数の視覚タスクを処理できる統一モデルへのシフトを表しています。その成功は、オーディオやビデオセグメンテーションなどの他の分野での同様の取り組みを促進し、オープンソースAIモデルの成長するエコシステムに貢献しています。