アンカーフリーフリー物体検出は、画像内の物体を位置特定し分類するためのコンピュータビジョンにおけるパラダイムであり、事前に定義されたアンカーボックスのセットに依存しない。従来の物体検出器、例えばFaster R-CNNやSSDは、様々なスケールとアスペクト比を持つ多数のアンカーボックスを参照候補として使用する。検出器はこれらのアンカーを調整して、グラウンドトゥルースの物体に一致させる。対照的に、アンカーフリー手法は物体の位置と範囲を直接予測し、多くの場合、中心や角などのキーポイントを特定するか、各ピクセルが物体の中心領域に属するかどうかを分類する。このアプローチは、アンカー生成とマッチングに関連する設計選択の数と計算オーバーヘッドを削減し、標準的なベンチマークで競争力のある、または優れた精度を達成することが示されている。
アンカーフリー検出への移行は、よりシンプルで柔軟な検出フレームワークへの欲求によって推進されてきた。アンカーベースの手法は、アンカーのスケール、アスペクト比、数の慎重な調整を必要とし、これはデータセット固有となる可能性がある。アンカーフリー手法はこれらのハイパーパラメータを排除し、新しいドメインへの適応を容易にする。さらに、アンカーフリー検出器はしばしばより単純なアーキテクチャを持ち、トレーニングと推論の両方でより効率的である。この概念は、CornerNet、CenterNet、FCOSなどのモデルの成功により注目を集め、アンカーフリーアプローチがアンカーベースの対応物と同等以上の性能を発揮できることを実証した。
歴史的背景
アンカーなしで物体を検出するという考えは、キーポイント検出とセマンティックセグメンテーションに関する初期の研究にルーツがある。2010年代には、Deformable Parts Model(DPM)などの手法がアンカーに依存しないパーツベースのモデルを使用していたが、これらはアンカーベースの領域提案ネットワークを好む深層学習アプローチによって大部分が置き換えられた。アンカーフリー検出の復活は、2018年頃にCornerNetの導入から始まり、これは物体を左上と右下の角のキーポイントのペアとして検出した。これに続いて、物体の中心とそのサイズを予測するCenterNet、および検出をピクセルごとの予測問題として扱うFCOS(Fully Convolutional One-Stage)が登場した。これらのモデルは、アンカーフリー手法がCOCOなどのデータセットで最先端の結果を達成できることを示し、その後の研究で広く採用されることにつながった。
基本原則
アンカーフリー検出器は通常、キーポイントベースとセンターベースの2つのカテゴリに分類される。CornerNetやExtremeNetなどのキーポイントベースの手法は、物体上の特定の点(例えば、角や極値点)を特定し、それらをグループ化してバウンディングボックスを形成する。CenterNetやFCOSなどのセンターベースの手法は、各物体の中心を予測し、中心からバウンディングボックスの端までの距離を回帰する。FCOSはまた、物体中心から遠い低品質の予測の重みを下げるための中心性スコアを予測する。これらの手法はしばしば完全畳み込みネットワークを使用し、高密度の特徴マップ上で動作するため、ニューラルネットワークや深層学習フレームワークなどの現代の深層学習アーキテクチャと自然に互換性がある。
1つの重要な利点は、複雑で計算集約的になり得るアンカーマッチングプロセスの排除である。アンカーベースの手法では、トレーニング中に各アンカーに、Intersection over Union(IoU)しきい値に基づいてグラウンドトゥルースの物体または背景ラベルを割り当てる必要がある。アンカーフリー手法は代わりに、ピクセルが物体の中心領域内にあるかどうかなどの空間的位置に基づいてラベルを割り当てる。これによりトレーニング目的が簡素化され、より速い収束につながる可能性がある。
注目すべきアーキテクチャ
いくつかのアンカーフリーアーキテクチャが影響力を持つようになった。CornerNet(2018)は、左上と右下の角のヒートマップを予測し、同じ物体に属する角をグループ化するための埋め込みを予測する概念を導入した。CenterNet(2019)は、物体中心の単一のヒートマップを予測し、幅と高さを回帰することでこれを簡素化した。FCOS(2019)は、検出を高密度予測タスクとして定式化し、各ピクセルが物体の中心領域内にある場合にバウンディングボックスを予測する。RepPoints(2019)やDETR(2020)などの後のモデルは、さらに限界を押し広げた。Transformerアーキテクチャを使用するDETRは、物体検出をセット予測問題として扱い、アンカーや非最大値抑制などの手作りのコンポーネントを完全に排除した。これらのモデルは、自動運転や医用画像処理を含む様々なアプリケーションに統合されている。
利点と課題
アンカーフリー検出器はいくつかの利点を提供する。ハイパーパラメータの数を減らし、調整と展開を容易にする。また、パイプラインがより単純である傾向があり、GPUなどのハードウェア上でより効率的である。さらに、事前定義されたアンカー形状に依存しないため、異常な物体形状やスケールに対してより適応性が高い。しかし、課題にも直面している。キーポイントベースの手法は、重なり合う物体や曖昧なキーポイントを持つ物体に苦労する可能性がある。センターベースの手法は、中心領域が適切に定義されない可能性があるため、非常に大きいまたは非常に小さい物体で困難を抱えることがある。さらに、一部のアンカーフリー手法は、グループ化や非最大値抑制などの後処理ステップを依然として必要とし、これがボトルネックになる可能性がある。
応用と影響
アンカーフリー検出は、実世界のシステムで広く採用されている。自動運転では、歩行者、車両、交通標識の検出が重要であり、アンカーフリー手法は様々な物体サイズと形状に対する堅牢性を提供する。監視やロボティクスでは、アンカーフリーモデルの単純さがエッジデバイスでのリアルタイム処理を容易にする。WaymoやTesla Autopilotなどの企業は、知覚スタックのためにそのような技術を探求してきた。この概念は、インスタンスセグメンテーションやポーズ推定などの他のタスクにも影響を与えており、同様の直接予測の原則が適用されている。2025年現在、アンカーフリー手法は現代の物体検出フレームワークの標準的なコンポーネントとなり、ハイブリッドアプローチでアンカーベースの技術と組み合わせられることが多い。