オブジェクトトラッキングは、ビデオトラッキングとも呼ばれ、カメラを使用して時間経過に伴う移動物体(または複数の物体)の位置を特定するプロセスです。人間とコンピュータの相互作用、セキュリティおよび監視、ビデオ通信および圧縮、拡張現実、交通制御、医用画像、ビデオ編集など、さまざまな用途があります。このタスクは、ビデオ内の大量のデータのため時間がかかることがあり、多くの場合、それ自体が困難な物体認識技術を必要とします。
ビデオトラッキングの目的は、連続するビデオフレーム内の対象物体を関連付けることです。この関連付けは、物体がフレームレートに対して速く移動する場合や、追跡対象の物体が時間とともに向きを変える場合に困難になります。これらの状況に対処するため、トラッキングシステムは通常、可能なさまざまな動きに対して対象の画像がどのように変化するかを記述する運動モデルを採用します。単純な運動モデルには、平面物体のための2D変換(アフィンまたはホモグラフィ)、剛体物体のための3D位置および向き、ビデオ圧縮のためのマクロブロック並進、変形可能な物体のためのメッシュ変形が含まれます。
アルゴリズム
トラッキングを実行するために、アルゴリズムは連続するビデオフレームを分析し、フレーム間の対象の動きを出力します。主要な2つの構成要素があります:対象の表現および位置特定、ならびにフィルタリングおよびデータ関連付けです。対象の表現および位置特定は、移動物体を識別するボトムアッププロセスであり、カーネルベースのトラッキング(平均シフト)や輪郭トラッキングなどの方法があります。これらの方法は計算効率が高いですが、複雑な相互作用には苦労する場合があります。フィルタリングおよびデータ関連付けは、事前情報を組み込み、物体の動力学を処理するトップダウンプロセスであり、障害物の背後でのトラッキングを可能にします。一般的なフィルタリングアルゴリズムには、線形ガウスシステムに最適なカルマンフィルタや、非線形および非ガウスプロセスを処理するパーティクルフィルタがあります。フィルタリング方法の計算複雑性は通常より高くなります。
応用
オブジェクトトラッキングには多くの実用的な応用があります。セキュリティおよび監視では、人や車両の自動監視を可能にします。人間とコンピュータの相互作用では、ジェスチャ認識や動きベースの制御を可能にします。拡張現実では、トラッキングが仮想オブジェクトを現実世界の位置に固定します。交通制御では、車両の流れを監視し、インシデントを検出します。医用画像では、時間経過に伴う解剖学的構造や造影剤を追跡します。ビデオ圧縮では、動き推定がフレーム間の差分のみを符号化することでデータを削減します。
課題
物体がフレームレートに対して速く移動すると、フレーム間の大きな変位が生じるため、トラッキングは困難になります。物体が部分的または完全に隠されるオクルージョンは、関連付けを複雑にします。向き、スケール、および照明の変化も性能に影響を与えます。オフショアまたは移動プラットフォームでは、動力学を低減するためにカメラを事前に安定化させる慣性計測システムがよく使用されます。アルゴリズムの選択は、精度、堅牢性、および計算コストのバランスを取りながら、意図された用途に依存します。
歴史と発展
オブジェクトトラッキングの初期の研究は1980年代に遡り、迷路を通るボールを追跡するために使用されたCromemco Cyclops Cameraなどの例があります。それ以来、この分野はコンピュータビジョンと機械学習の進歩とともに発展してきました。現代のアプローチは、特徴抽出および物体検出のために深層学習とニューラルネットワークを統合することが多く、複雑なシーンでの堅牢性を向上させています。研究はMIT CSAILやStanford AI Labなどの機関で続けられており、WaymoやTeslaなどの企業は自動運転車でトラッキングを適用しています。
関連項目
- motion-estimation
- optical-flow
- コンピュータビジョン
- augmented-reality