文脈画像分類は、Machine learningとコンピュータビジョンの下位分野であり、個々のピクセルやオブジェクトを単独で分析するのではなく、より広いシーンからの情報を活用して、画像または画像領域にラベルを割り当てる。このアプローチは、視覚要素の意味がしばしばその周囲に依存することを認識している。例えば、小さくぼやけた形状は、道路上にある場合よりも空にある場合の方が鳥である可能性が高い。オブジェクト間の関係、空間配置、シーンレベルの手がかりをモデル化することで、文脈的手法は曖昧さを減らし、特に雑然とした環境や自然環境での分類精度を向上させることを目指している。
この概念は、1970年代から1980年代の初期のコンピュータビジョン研究にルーツを持ち、Xerox PARCやMIT CSAILなどの機関の研究者が、空間的文脈がオブジェクト認識にどのように役立つかを探求し始めた。各画像を独立して扱う従来のピクセルベースの分類器とは異なり、文脈分類は、隣接領域、グローバルなシーン統計、またはオブジェクトの共起パターンからの特徴を統合する。これにより、局所的な外観だけでは不十分なことが多い、リモートセンシング、医用画像、自動運転などのアプリケーションに特に有用となる。
歴史的発展
1980年代の初期の研究では、マルコフ確率場などの確率的グラフィカルモデルを使用して、隣接するピクセルまたはセグメント間の空間的依存関係を符号化した。これらのモデルにより、分類器は画像全体にラベル情報を伝播させ、ノイズの多い予測を平滑化できた。1990年代には、Carnegie Mellon UniversityやStanford AI Labの研究者が、道路や建物の存在などの高レベルのシーン文脈を組み込んで、オブジェクトラベルを洗練させるためにこれらのアイデアを拡張した。
2010年代のDeep learningの台頭により、この分野は変革した。畳み込みニューラルネットワーク(CNN)、特にResidual Network (ResNet)やU-Netなどのアーキテクチャは、局所的な文脈を暗黙的に捉える階層的特徴を学習した。しかし、明示的な文脈モデリングは、Waymo自動運転車やTeslaシステムにおけるシーン理解など、グローバルな推論を必要とするタスクにとって依然として価値があった。そこでは、歩行者の姿勢と周囲の交通信号を共同で解釈する必要がある。
主要技術
現代の文脈画像分類は、いくつかの技術ファミリーを採用している。空間文脈手法は、Data Augmentationとマルチスケール分析を使用して、より大きな受容野からの情報を組み込む。例えば、分類器は最初に画像を領域にセグメント化し、次に2番目のネットワークを使用して、隣接領域からの特徴に基づいて各領域を分類する。
意味的文脈手法は、オブジェクトの共起統計を活用する。モデルがステアリングホイールを検出した場合、近くの暗い形状が部分的に遮蔽されていても、それをシートとして分類する可能性が高い。これらのアプローチは、多くの場合、グラフィカルモデルやAttentionメカニズム(Transformer (architecture)アーキテクチャに見られるMulti-Head Attentionなど)を使用して、異なるシーン要素の影響を重み付けする。
グローバル文脈手法は、オブジェクトカテゴリのヒストグラムや低次元埋め込みなどのシーンレベルの記述子を計算し、それを使用して局所予測を条件付ける。これは、都市部の衛星画像がピクセルレベルのスペクトルデータと近隣統計を組み合わせて分類されるリモートセンシングで一般的である。
アプリケーション
最も活発なアプリケーション分野の1つはリモートセンシングである。Google CloudやOracle Cloud Infrastructureサービスなどのプラットフォームによって取得された衛星および航空画像には、多くの場合、境界が微妙な大きな均質領域(森林、水域、作物)が含まれる。文脈分類は、テクスチャと隣接パターンを考慮することで類似の土地被覆タイプを区別するのに役立ち、土地利用マッピングと環境モニタリングの精度を向上させる。
医用画像では、文脈的手法がCTまたはMRIスキャンで解剖学的構造にラベルを付けることで放射線科医を支援する。例えば、肺スキャン内の小さな結節は、胸膜の近くまたは以前の炎症領域内に現れる場合、悪性である可能性が高い。Samsung ResearchやNokia Bell Labsで開発されたシステムは、文脈的特徴を使用してがん検診の偽陽性を減らしてきた。
自動運転は文脈分類に大きく依存している。WaymoとTeslaはカメラとLiDARデータを使用してオブジェクトを識別するが、文脈は状況を明確にするのに役立つ。木の枝に部分的に隠れた一時停止標識は、交差点での典型的な位置のために依然として認識される。同様に、Intuitive Surgicalロボットシステムは、手術中の組織タイプを区別するために文脈的手がかりを使用する。
課題と将来の方向性
その利点にもかかわらず、文脈画像分類はいくつかの課題に直面している。計算コストは重要であり、長距離依存関係をモデル化するには、多くの場合、大きな受容野または反復推論が必要となる。Model Pruningや効率的なアテンションメカニズムなどの技術がこれを軽減するために開発されている。
文脈の曖昧さもパフォーマンスを損なう可能性がある。シーンが異常であるか、矛盾する手がかりを含む場合、文脈モデルはエラーを強化する可能性がある。例えば、ビーチのペンギンは、その外観が明確であるにもかかわらず、海岸の文脈のために鳥として誤分類される可能性がある。
将来の研究は、Large language model埋め込みと視覚的特徴の統合を探求しており、分類器が自然言語でシーンについて推論できるようにする。OpenAIやGoogle DeepMindなどの企業は、テキストと画像を共同で処理するマルチモーダルモデルを開発しており、より柔軟な文脈推論を可能にする可能性がある。2025年の時点で、これらのアプローチは実験的なままであるが、視覚環境の常識的理解を必要とするタスクに有望を示している。