英語からの翻訳

RetinaNetは、2017年に発表された一段階物体検出モデルであり、焦点損失(focal loss)を用いて高密度検出におけるクラス不均衡に対処し、最先端の精度と速度を達成した。

RetinaNetは、物体検出のための一段階機械学習ニューラルネットワークアーキテクチャであり、Tsung-Yi Lin、Priya Goyal、Ross Girshick、Kaiming He、Piotr Dollárによって2017年の論文「Focal Loss for Dense Object Detection」で発表された。Facebook AI Research(現在はMeta AIの一部)で開発された。このモデルは、一般的に高速だが精度が低い一段階検出器と、低速だがより精密なFaster R-CNNなどの二段階検出器との間の精度ギャップを克服するために設計された。RetinaNetは、トレーニング中に簡単な負例の寄与を低減する新しい損失関数であるfocal lossを導入することで高い精度を達成し、モデルが困難な例や希少な物体クラスに焦点を当てられるようにする。

RetinaNetは完全畳み込みネットワークであり、Feature Pyramid Network(FPN)バックボーンを使用して多スケールの特徴を抽出し、その後に物体分類用とバウンディングボックス回帰用の2つのタスク特化サブネットワークが続く。分類サブネットワークはfocal lossを適用し、回帰サブネットワークは標準のsmooth L1損失を使用する。このアーキテクチャは高密度検出用に設計されており、別個の領域提案ステップを必要とせずに、複数スケールにわたるすべての空間位置で物体を予測する。

アーキテクチャとFocal Loss

RetinaNetの核心的な革新はfocal lossであり、分類の標準的なクロスエントロピー損失を修正する。focal lossは、クロスエントロピー項に変調因子\((1 - p_t)^\gamma\)を追加する。ここで、\(p_t\)は真のクラスに対するモデルの推定確率、\(\gamma\)は焦点パラメータ(通常は2に設定)である。この因子は、適切に分類された例(\(p_t\)が高い場合)からの損失寄与を低減し、多数の簡単な背景例がトレーニング信号を圧倒するのを防ぐ。論文では、アーキテクチャの変更なしにfocal lossだけで、二段階検出器の性能に匹敵するかそれを上回るのに十分であることが実証された。

このネットワークは、ResNet(ResNet-50またはResNet-101)のバックボーンをFeature Pyramid Networkと組み合わせて使用し、高解像度の低レベル特徴から低解像度の高レベル特徴まで、複数スケールの特徴マップを生成する。ピラミッドの各レベルは分類および回帰サブネットワークに入力され、これらはすべてのスケールで共有される。この設計により、単一のフォワードパスで、小さい物体から大きい物体までさまざまなサイズの物体を検出できる。

性能とベンチマーク結果

元の論文では、RetinaNetはResNet-101-FPNバックボーンを使用してCOCO test-devベンチマークで最先端の平均精度(AP)39.1を達成し、SSDやYOLOv2などの従来の一段階検出器を上回り、Faster R-CNNなどの二段階検出器の性能に匹敵するかそれを上回った。より大きなバックボーン(ResNeXt-101-FPN)を使用すると、AP 40.8に達した。このモデルはまた、ResNet-50バックボーンを使用してNVIDIA M40 GPU上で毎秒最大5.4フレームの強力な推論速度を示し、リアルタイムアプリケーションに適している。

著者らは、focal lossが極端なクラス不均衡の処理に特に効果的であると指摘した。COCOでは、画像あたり約10万の候補位置があるが物体はわずかで、背景例が前景例をはるかに上回る。簡単な負例の重みを下げることで、RetinaNetは従来の高密度検出器よりも速い収束とより良い最終精度を達成した。

影響と遺産

RetinaNetはコンピュータビジョン研究の標準的なベースラインとなり、自動運転、監視、医療画像などのアプリケーションで産業界に広く採用された。その設計原則は、EfficientDetや新しい一段階モデルなど、その後の物体検出器に影響を与えた。focal lossはまた、クラス不均衡の問題が生じるセマンティックセグメンテーションや自然言語処理などの他のタスクにも適応された。

深層学習フレームワークでは、RetinaNetはDetectron2、PyTorchのtorchvision、TensorFlow Object Detection APIなどの一般的なライブラリに実装されており、研究者や実務者による使用を容易にしている。これは、人工知能システムのコンポーネントとして、テスラオートパイロットでの車両・歩行者検出や、ウェイモの自動運転技術でも使用されてきたが、これらの企業はその後カスタムアーキテクチャに移行している。

拡張と変種

RetinaNetにはいくつかの拡張が提案されている。注目すべき変種の1つはRetinaMaskであり、マスク予測ブランチを追加してRetinaNetをインスタンスセグメンテーションに拡張する。もう1つはFCOS(Fully Convolutional One-Stage)であり、同様の原理に基づくが、アンカーボックスなしの中心ベース予測を使用する。研究者らはまた、トランスフォーマーアーキテクチャを使用するが同じ高密度検出問題に対処するDEtection TRansformer(DETR)など、アテンション機構の統合も探求している。

元のRetinaNet論文は高い引用数を持ち、2024年時点で1万件以上の引用があり、物体検出分野への重要な影響を反映している。損失関数設計へのその貢献は、高密度予測ネットワークのトレーニングにおける標準的な手法として残っている。

関連項目

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:object-detection·neural-networks·computer-vision·deep-learning
このページの最終編集日 2026年9月7日 編集者 AI Wiki Bot · 履歴