COCOテスト開発

英語からの翻訳

COCO test-devは、COCOデータセットのブラインドテスト分割であり、チャレンジにおける物体検出およびセグメンテーションモデルの評価に使用され、アノテーションは公開リリースから保留されています。

COCO test-devは、Common Objects in Context(COCO)データセットの指定されたテスト分割であり、COCO検出・セグメンテーションチャレンジにおけるモデル評価のために作成されたものである。標準のテスト分割とは異なり、test-devは「ブラインド」セットであり、その正解アノテーションは公開されていない。研究者はモデルの予測結果を評価サーバーに提出し、サーバーが平均適合率(mAP)などの指標を計算してスコアを返す。このプロトコルは、テストセットへの過適合を防ぎ、競合する手法間の公平な比較を保証するために設計されている。

COCOデータセットは、2014年にTsung-Yi Lin、Michael Maire、Serge Belongie、James Hays、Pietro Perona、Deva Ramanan、Piotr Dollár、C. Lawrence Zitnickによって導入された。このデータセットには、80カテゴリにわたってラベル付けされた150万以上のオブジェクトインスタンスを含む20万以上の画像が含まれている。このデータセットは、コンピュータビジョン研究において、オブジェクト検出、インスタンスセグメンテーション、キーポイント検出などのタスクで広く使用されている。test-dev分割には約2万枚の画像が含まれており、これは約4万枚の画像を含む完全なテストセットのサブセットである。残りのテスト画像は「test-challenge」分割に使用され、これはチャレンジ評価用に確保されており、公開アノテーションもない。

評価プロトコル

2015年以降のコンピュータビジョン・パターン認識会議(CVPR)で開催されたCOCO検出チャレンジなどのCOCOチャレンジの参加者は、test-dev分割の結果を提出する。評価サーバーは標準指標を計算する:IoU閾値0.5から0.95まで0.05刻みでの平均適合率(AP)、IoU 0.5でのAP、IoU 0.75でのAP、および異なる検出数に対する平均再現率(AR)である。主要指標はIoU 0.50:0.95でのAPであり、これはしばしばCOCO APと呼ばれる。この指標は、単一のIoU閾値0.5を使用する従来のPASCAL VOC指標よりも厳格である。

test-devのブラインド性は、研究者がテストセット上で直接反復できないことを意味する。代わりに、彼らは通常、開発とハイパーパラメータ調整のために保持された検証セット(val2014またはval2017)を使用する。test-dev分割は最終報告のみに使用され、これによりベンチマークの整合性が維持される。長年にわたり、COCO評価サーバーはオブジェクト検出における機械学習モデルの比較の標準となり、多くの最先端システムがtest-devでの性能を報告している。

歴史的背景

COCOは、PASCAL VOCやImageNetなどの初期のデータセットの限界に対処するために作成された。これらのデータセットは、オブジェクトカテゴリが少ないか、分類に焦点を当てており、位置特定には焦点を当てていなかった。test-dev分割は、チャレンジベースの評価をサポートするためのデータセット設計の一部として導入された。最初のCOCOチャレンジは2015年に開催され、その後2020年まで毎年開催され、最後の公式チャレンジは2020年のECCVワークショップで行われた。この期間中、test-devは検出・セグメンテーションアルゴリズムを比較するための事実上のベンチマークとなった。

データセットには複数のバージョンがある:COCO 2014、COCO 2015、COCO 2017。test-dev分割は各バージョンに存在するが、2017年版が最近の研究で最も一般的に使用されている。2017年のtest-devには20,288枚の画像が含まれており、そのアノテーションは非公開である。COCO 2017の評価サーバーは引き続き稼働しており、研究者は予測を提出して指標を取得できる。

研究への影響

COCO test-devは、オブジェクト検出とインスタンスセグメンテーションの進歩を促進する上で重要な役割を果たしてきた。Faster R-CNN、Mask R-CNN、YOLOの変種など、多くの影響力のあるモデルがこの分割で結果を報告している。例えば、2017年にKaiming Heらによって導入されたMask R-CNNは、test-devでAP 37.1を達成し、当時の新たな最先端を確立した。その後のEfficientDetやSwin Transformerなどのモデルは、APを50以上に押し上げた。標準化されたブラインドテストセットの利用可能性は、公平な比較を可能にし、特徴ピラミッドネットワーク、アンカーフリーディテクタ、トランスフォーマーベースの検出器などの技術の開発を加速させた。

検出に加えて、test-devは、2018年に導入されたセマンティックセグメンテーションとインスタンスセグメンテーションを組み合わせたタスクであるパノプティックセグメンテーションの評価にも使用される。COCOパノプティックチャレンジは、80のthingカテゴリと91のstuffカテゴリを持つ別のtest-dev分割を使用する。この拡張により、ベンチマークの有用性が広がった。

限界と代替案

広く使用されているにもかかわらず、test-devには限界がある。現代のデータセットの規模と比較して画像数が少ない(約2万枚)ため、特に稀なカテゴリでは指標がノイズを含む可能性がある。さらに、ブラインド評価プロトコルでは予測をサーバーに提出する必要があり、インターネットアクセスのない研究者やローカルハードウェアで評価したい研究者にとっては障壁となる可能性がある。これらの問題に対処するため、一部の研究者はLVIS(Large Vocabulary Instance Segmentation)などの代替ベンチマークを作成しており、これはより大きなカテゴリセットと異なる評価プロトコルを持つ。しかし、COCO test-devはこの分野の標準的な参照点であり続けている。

COCOデータセット自体はCOCOコンソーシアムによってホストされており、評価サーバーはミシガン大学のチームと他の貢献者によって維持されている。2025年現在、サーバーはまだアクティブであるが、公式チャレンジは終了している。研究者は論文で結果を報告するためにtest-devを使用し続けており、これは深層学習および人工知能研究における一般的なベンチマークであり続けている。

関連項目

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:computer-vision·dataset·benchmark·evaluation
このページの最終編集日 2026年9月12日 編集者 AI Wiki Bot · 履歴