PASCAL VOC 2012は、物体検出、分類、およびセグメンテーションのためのベンチマークデータセットであり、PASCAL Visual Object Classes(VOC)チャレンジシリーズの一部です。20の物体カテゴリにわたるラベル付き画像を提供し、分類、検出、およびセグメンテーションタスクのためのアノテーションが含まれています。2012年にリリースされ、コンピュータビジョンアルゴリズムの標準的な評価スイートとなり、ResNetやU-Netなどの深層学習モデルの開発に影響を与えました。
このデータセットには、トレーニングと検証用の11,530枚の画像と、テスト用の10,991枚の画像が含まれており、人、動物、乗り物、家庭用品を含む20クラスをカバーするアノテーションが付いています。チャレンジでは、曖昧なインスタンスのための「difficult」フラグと、画像境界で切り取られた物体のための「truncated」フラグも導入されました。セグメンテーションのアノテーションはピクセルレベルのマスクとして提供され、セマンティックおよびインスタンスレベルの両方の評価を可能にします。
歴史と背景
PASCAL VOCチャレンジは、欧州連合が資金提供するプロジェクトであるPASCAL Network of Excellenceによって組織され、2005年から2012年まで開催されました。2012年版が最後であり、そのデータセットは長年にわたる参照点となりました。ImageNetやCOCOのような大規模データセットが台頭する前は、VOC 2012は物体検出とセグメンテーションの主要なベンチマークでした。その比較的小さなサイズ(後のデータセットと比較して)は、研究者が迅速に反復することを可能にしましたが、過学習なしで深層モデルをトレーニングするための課題も提起しました。
チャレンジには、分類(物体の存在の予測)、検出(バウンディングボックス)、およびセグメンテーション(ピクセルレベルのマスク)のタスクが含まれていました。評価指標には、検出のための平均精度(AP)とセグメンテーションのための平均交差オーバーユニオン(mIoU)が含まれていました。2012年のチャレンジには多くの学術および産業チームが参加し、優勝したソリューションはしばしば最先端を押し上げました。
データセットの構造とアノテーション
VOC 2012の画像は、Flickrやその他の公開コレクションから取得され、現実的なシーンに焦点を当てています。各画像には、異なるカテゴリの複数の物体が含まれる場合があります。アノテーションは、検出と分類用のXMLファイルと、セグメンテーション用のPNGマスクに保存されています。データセットはトレイン、バル、テストのサブセットに分割され、テストラベルは公式評価のために保留されています。研究者は開発にトレインとバルセットを、最終報告にテストセットを使用することがよくあります。
20の物体クラスは、飛行機、自転車、鳥、ボート、ボトル、バス、車、猫、椅子、牛、ダイニングテーブル、犬、馬、オートバイ、人、鉢植え、羊、ソファ、電車、テレビ/モニターです。「difficult」フラグは、小さすぎるか曖昧な物体を示し、これらは通常評価から除外されます。「truncated」フラグは、画像フレームの外に部分的にある物体をマークします。
コンピュータビジョンへの影響
VOC 2012は、現代の物体検出およびセグメンテーション手法の開発において重要な役割を果たしました。R-CNNやその変種などの初期の深層学習検出器は、VOC 2012で評価され、従来の特徴ベースの手法よりも大幅な改善を示しました。このデータセットは、平均平均精度(mAP)を標準的な指標として普及させ、これは現在もこの分野で一般的です。
セグメンテーションに関しては、VOC 2012はU-Netや後の完全畳み込みネットワークなどのモデルにとって重要なベンチマークでした。ピクセルレベルのアノテーションにより、研究者はセマンティックセグメンテーション技術を開発および比較することができました。データセットの適度なサイズは、データ拡張やImageNetなどの大規模データセットからの転移学習の使用を促進しました。
遺産と継続的な使用
PASCAL VOCチャレンジは2012年に終了しましたが、データセットは研究と教育のために広く使用され続けています。多くの論文が今でもVOC 2012での結果を報告しており、しばしば他のベンチマークと組み合わせて使用されます。これは新しいモデルの健全性チェックと、方法を比較するための共通の基盤として機能します。このデータセットは、物体検出とセグメンテーションを教える学術コースでも使用されています。
COCOなどの後のデータセットは、より大規模でより多くのカテゴリを持っていますが、VOC 2012はそのシンプルさと明確に定義された評価プロトコルにより、その重要性を維持しています。オックスフォード大学が維持する公式評価サーバーは、テストセットの提出を今でも受け付けており、年を超えた一貫した比較を保証しています。
制限と批判
VOC 2012は、現代のデータセットと比較してカテゴリ数と画像数が限られていることで批判されてきました。画像も比較的低解像度であり、高解像度モデルのトレーニングを妨げる可能性があります。アノテーションの品質は一般的に高いですが、一部のラベルにはエラーや不整合が含まれています。さらに、このデータセットは、特定の物体のポーズや文脈の過剰表現など、ウェブソース画像に共通するバイアスを示しています。
これらの制限にもかかわらず、VOC 2012は貴重なリソースであり続けています。その小さなサイズは迅速なプロトタイピングを可能にし、よく理解された指標は明確な比較を促進します。研究者は、より大規模なデータセットにスケールアップする前に、出発点としてこれを使用することがよくあります。