背景差分は、コンピュータビジョンおよび映像処理における基本的な手法であり、一連のフレーム内で比較的静的な背景から動く前景オブジェクトを分離するものである。その核となる考え方は、背景シーンの統計的またはヒューリスティックなモデルを構築し、新しいフレーム内の各ピクセルを、モデルに一致する場合は背景、大きく逸脱する場合は前景として分類することである。この手法は、ビデオ監視、交通監視、人間とコンピュータの相互作用、オブジェクト追跡など、多くのアプリケーションを支えており、オブジェクトの外観に関する事前知識なしに関心領域を特定することを目的としている。
このアプローチは、カメラが固定されており、背景が時間とともにほぼ変化しないことを前提としているが、徐々に変化する照明、カメラノイズ、小さな反復動作(例えば、木の葉の揺れ)などの変動は処理する必要がある。背景差分は、より最近の深層学習ベースのセグメンテーション手法とは異なり、通常、学習された意味的特徴ではなくピクセル単位の統計に基づいて動作し、計算効率が高く、組み込みハードウェア上のリアルタイムシステムに適している。
歴史的発展
背景差分の起源は1970年代から1980年代に遡り、初期の映像解析システムでは、連続するフレームを差分して変化を検出する単純なフレーム差分法が使用されていた。画期的な進歩は1997年、クリス・スタウファーとW.E.L.グリムソンによるMITコンピュータ科学・人工知能研究所での研究であり、各ピクセルをガウス分布の混合としてモデル化した。この適応的アプローチは、ちらつくモニターや水面などの多峰性の背景を処理でき、10年以上にわたって事実上の標準となった。
その後の改良には、キムら(2004年)によるコードブックアルゴリズムがあり、背景サンプルをコードワードに圧縮してメモリ効率を向上させた。また、2011年にオリビエ・バーニッシュとマルク・ヴァン・ドローヘンブルックによって導入されたViBe(Visual Background Extractor)法は、ランダムポリシーを使用して背景サンプルを更新し、低計算コストで高速性を実現した。2010年代までに、研究は影や照明変化に対する堅牢性を向上させるために、色、テクスチャ、エッジ特徴を統合する方向へシフトした。
主要技術
単純な背景差分パイプラインは、背景初期化から始まり、最初のNフレームを使用して初期モデルを推定する。最も基本的な形式は移動平均であり、各ピクセルの背景値はB_t = (1 - alpha) B_{t-1} + alpha I_tとして更新され、alphaは学習率である。前景検出はしきい値を適用し、|I_t - B_t| > Tの場合、そのピクセルは前景としてマークされる。これは制御された環境ではうまく機能するが、動的な条件下では失敗する。
より高度な方法には、ガウス混合モデル(GMM)があり、各ピクセルに対してK個のガウス分布を維持し、それぞれに重み、平均、分散を持つ。ピクセルは、特定の標準偏差内でいずれかの分布に一致する場合、背景として分類される。パラメータは期待値最大化に似た手順を使用してオンラインで更新される。もう一つの一般的なアプローチは、ノンパラメトリックなカーネル密度推定であり、最近のピクセル値のヒストグラムを使用して確率密度を推定し、特定のパラメトリック形式を仮定せずに任意の背景分布を可能にする。
課題と現代のアプローチ
実世界のシーンにはいくつかの課題がある:突然の照明変化(例えば、雲が通過する)、前景オブジェクトによって投影される影、カメラのジッター、そして動き始める背景オブジェクト(例えば、駐車していた車が去る)などである。影は特に問題であり、背景と同じテクスチャを共有するが輝度が低い。多くのアルゴリズムは、色度と輝度を分離するためにHSVなどの色空間を組み込むか、グラデーションベースの特徴を使用して影を真の前景と区別する。
2010年代半ば以降、機械学習およびニューラルネットワークアプローチが注目を集めている。畳み込みニューラルネットワーク、特にU-Netアーキテクチャの変種は、CDnet 2014などのラベル付きデータセットでトレーニングされ、ピクセル単位の前景セグメンテーションを実行する。これらの方法は、古典的な技術よりも影を抑制し、動的な背景を効果的に処理することを学ぶが、大規模な注釈付きデータセットとかなりの計算リソースを必要とする。ハイブリッドシステムは、多くの場合、初期検出に高速な古典的方法と、精度と速度のバランスを取るための深層モデルを組み合わせる。
アプリケーション
背景差分は、セキュリティおよび監視システムで広く展開されており、固定カメラフィード内の侵入者や放置されたオブジェクトを検出する。交通管理では、車両をカウントし、高速道路での速度を推定する。人間の動作解析では、歩容認識やジェスチャー制御のために人物のシルエットを分離し、初期のインタラクティブシステムで使用された。この技術はまた、医療画像処理で造影前画像から造影後画像を差分するため、天文学では望遠鏡画像から静的な空の背景を除去するために登場する。
産業環境では、背景差分により組立ラインでの品質検査が可能になり、コンベアベルト上の欠陥や異物を検出する。エッジコンピューティングの台頭により、ARMやQualcommなどの低消費電力デバイスでの実装により、ドローンやスマートカメラでのリアルタイム処理が可能になり、従来のサーバーベースのシステムを超えて技術の範囲が広がっている。
評価とデータセット
アルゴリズムの比較にはベンチマークが重要である。モントリオール大学によって作成されたCDnet 2012およびCDnet 2014データセットは、ベースライン、動的背景、断続的な動き、影などのカテゴリをカバーする、ピクセルレベルのグラウンドトゥルースアノテーションを備えた多様なビデオシーケンスを提供する。メトリクスには、精度、再現率、F値、誤分類の割合が含まれる。2014年版では、53本のビデオを含む11カテゴリが導入され、学術評価の標準となった。
より最近の取り組みには、LASISESTAデータセットがあり、難易度の異なる合成および実シナリオを追加する。深層学習モデルはこれらのベンチマークでより高いF値を達成することが多いが、古典的な方法は速度の点で競争力があり、トレーニングデータが不足している場合や解釈可能性が必要な場合に好まれる。アルゴリズムの選択は、最終的には、ハードウェアの制限、リアルタイム要件、シーンの予想される変動性など、アプリケーションの特定の制約に依存する。
関連項目
- データ拡張
- 残差ネットワーク
- コンピュータビジョン(注:提供されたスラッグリストにないため省略)
- 機械学習