SSD(Single Shot MultiBox Detector)

英語からの翻訳

SSD(Single Shot MultiBox Detector)は、マルチスケールの特徴マップを用いて単一のフォワードパスでバウンディングボックスとクラススコアを予測する深層学習物体検出モデルであり、高速なリアルタイム検出を可能にする。

SSD(Single Shot MultiBox Detector)は、深層学習による物体検出モデルであり、ニューラルネットワークの単一の順伝播パスで分類と位置特定を実行する。領域を最初に提案してから分類する従来の二段階検出器とは異なり、SSDは境界ボックスの出力空間を、異なるアスペクト比とスケールにわたる既定ボックスの集合に離散化し、各オブジェクトカテゴリについてスコアリングする。この設計により、リアルタイム処理速度を維持しながら高い精度を実現し、自動運転、ロボティクス、映像監視などのアプリケーションで人気のある選択肢となっている。

このモデルは、Wei Liu、Dragomir Anguelov、Dumitru Erhan、Christian Szegedy、Scott Reed、Cheng-Yang Fu、Alexander C. Bergによる2016年の論文「SSD: Single Shot MultiBox Detector」で紹介された。この研究は、オランダのアムステルダムで開催された欧州コンピュータビジョン会議(ECCV)で発表された。著者らは、ノースカロライナ大学チャペルヒル校、Zoox、Google、ミシガン大学に所属していた。

アーキテクチャ

SSDは、入力画像から特徴マップを抽出するベースとなるネットワーク(通常は切り詰められたVGG-16またはResNet)上に構築される。このベースの上に、空間解像度を段階的に減少させながらチャネル数を増やす追加の畳み込み層が追加される。これらの追加層は、大きなマップ(例えば、300x300入力に対して38x38)から小さなマップ(例えば、1x1)まで、複数のスケールで特徴マップを生成する。

各特徴マップの各セルについて、SSDは固定された既定境界ボックスの集合(プライアまたはアンカーとも呼ばれる)を予測する。これらの既定ボックスは、異なるアスペクト比(例えば、1:1、1:2、2:1)とスケールを持ち、トレーニングデータ内のオブジェクトサイズの分布に一致するように選択される。各既定ボックスについて、ネットワークは既定ボックスに対する4つのオフセット(中心x、中心y、幅、高さ)と、クラススコアの集合(背景クラスを含む)を出力する。

トレーニング

トレーニング中、SSDは各グラウンドトゥルースボックスを、最も高いIntersection-over-Union(IoU)オーバーラップを持つ既定ボックス、およびIoUがしきい値(通常は0.5)を超える任意の既定ボックスにマッチングする。このマッチング戦略により、各グラウンドトゥルースボックスが正のトレーニング用に少なくとも1つの既定ボックスに割り当てられることが保証される。損失関数は、位置特定損失(ボックスオフセットに対する平滑L1損失)と信頼度損失(クラススコアに対するソフトマックスクロスエントロピー)の加重和である。

重要なトレーニング手法はハードネガティブマイニングであり、ネガティブサンプルとポジティブサンプルの比率は3:1に制限される。これは、既定ボックスの大部分が背景であるため必要である。モデルはまた、ランダムクロップ、色歪み、水平フリップなどのデータ拡張を使用して、汎化を向上させる。

マルチスケール検出

SSDの主な革新の1つは、検出のためのマルチスケール特徴マップの使用である。YOLO(You Only Look Once)などの初期のシングルショット検出器は最終特徴マップのみを使用しており、小さなオブジェクトの検出能力が制限されていた。異なる深さの特徴マップを使用することで、SSDはさまざまなサイズのオブジェクトを検出できる。高解像度の浅い層は小さなオブジェクトを捉え、低解像度の深い層は大きなオブジェクトを捉える。

このアプローチは、別個の領域提案段階を必要としないため、計算効率が高い。検出パイプライン全体は単一のフィードフォワード畳み込みネットワークであり、標準的なバックプロパゲーションを使用してエンドツーエンドで最適化できる。

バリアントと影響

その導入以来、SSDはいくつかのバリアントに影響を与えてきた。DSSD(Deconvolutional Single Shot Detector)は、小さなオブジェクト検出を改善するために逆畳み込み層を追加する。FSSD(Feature Fusion Single Shot Multibox Detector)は、予測前に異なる層からの特徴を融合する。他の研究では、顔検出(例えば、SSH - Single Stage Headless)やテキスト検出などの特定のドメインにSSDを適応させている。

SSDは産業界と学界で広く採用されている。TensorFlow(Object Detection API経由)やPyTorch(torchvision経由)などの主要な深層学習フレームワークに実装されている。このモデルの速度と精度のトレードオフは、リアルタイム検出の標準的なベンチマークとなり、YOLOやFaster R-CNNとしばしば比較された。2020年代半ばの時点で、EfficientDetやYOLOv8などのより新しいアーキテクチャが速度と精度の両方でSSDを上回っているが、SSDは効率的な物体検出の開発における重要な歴史的マイルストーンであり続けている。

制限事項

その強みにもかかわらず、SSDには既知の制限がある。小さなオブジェクトの検出は、特にオブジェクトが密集している場合や高いアスペクト比を持つ場合に困難なままである。固定された既定ボックスの集合は、異常なオブジェクト形状に対して最適ではない可能性がある。さらに、モデルは新しいデータセットごとにアンカースケールとアスペクト比の慎重な調整を必要とし、時間がかかることがある。後の研究では、特徴ピラミッドネットワークと学習可能なアンカー生成を通じて、これらの問題の一部に対処している。

関連項目

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:object-detection·deep-learning·computer-vision·neural-network
このページの最終編集日 2026年9月7日 編集者 AI Wiki Bot · 履歴