COCO 2019は、コンピュータビジョンにおける広く認知された年次競技会であるCommon Objects in Context(COCO)チャレンジの2019年開催版を指す。学術研究者と産業研究者のコンソーシアムによって主催され、このチャレンジは物体検出、インスタンスセグメンテーション、画像キャプショニングなどのタスクにおけるアルゴリズムを評価する。2019年版は、2019年6月にカリフォルニア州ロングビーチで開催されたコンピュータビジョンおよびパターン認識会議(CVPR)と併催され、世界中の主要な研究グループやテクノロジー企業からの参加を集めた。
COCOデータセットは、2014年に初めて公開され、80の物体カテゴリにわたる20万枚以上のラベル付き画像を含み、150万以上の物体インスタンスを有する。2019年のチャレンジでは、更新された評価指標と新しいテストセットが導入され、視覚認識の最先端を押し進めた。2019年の優勝エントリーは、特に小物体検出と細粒度セグメンテーションにおいて精度の大幅な改善を示し、これはDeep learningアーキテクチャとトレーニング技術の進歩によって推進された。
チャレンジのトラックとタスク
COCO 2019チャレンジは、それぞれが特定の視覚理解タスクに焦点を当てた複数の異なるトラックで構成されていた。主要なトラックは物体検出であり、アルゴリズムがバウンディングボックスを使用して画像内の物体を位置特定し分類することが求められた。より要求の高いタスクであるインスタンスセグメンテーションは、検出された各物体に対してピクセルレベルのマスクを必要とした。追加のトラックには、人間のポーズ推定のためのキーポイント検出と、システムが画像内容の自然言語記述を生成する画像キャプショニングが含まれていた。
各トラックには独自の評価プロトコルがあった。検出とセグメンテーションでは、主要な指標は0.5から0.95までの複数の交差結合比(IoU)しきい値で計算される平均精度(AP)であった。キャプショニングは、生成されたキャプションと人間が書いた参照との類似性を測定するCIDErやBLEUなどの指標を使用して評価された。チャレンジには、開発用の「test-dev」分割と、最終ランキング用の別の「test-challenge」分割も含まれており、提出物間の公平な比較を保証した。
優勝アプローチと革新
2019年の優勝者は、特にResidual Network (ResNet)ファミリーの変種や特徴ピラミッドネットワークなど、最先端のNeural networkアーキテクチャを活用した。多くの上位エントリーは、複数のモデルを組み合わせて精度を高めるアンサンブル手法を採用した。注目すべき傾向は、一般化を改善するためのランダムスケーリング、クロッピング、カラージッターなどのData Augmentation技術の使用であった。一部のチームは、トレーニングを安定させ過学習を減らすためにBatch NormalizationとDropoutも採用した。
検出トラックでは、優勝ソリューションはtest-challengeセットで48%を超えるAPを達成し、前年の最高記録から大幅な改善を示した。これは、より大きなバックボーンネットワーク、高度なトレーニングスケジュール、ソフト非最大値抑制などの後処理の改良を組み合わせることで達成された。インスタンスセグメンテーションでは、上位エントリーが洗練された境界予測を備えたマスクベースのアプローチを使用し、41%を超えるAPに達した。キーポイント検出の優勝者は、マルチスケール推論とヒートマップ回帰を採用し、COCOキーポイントベンチマークで高い精度を達成した。
コンピュータビジョン研究への影響
COCO 2019は、その後の年に影響力を持つようになったいくつかの研究方向の触媒として機能した。小物体検出への重点は、高解像度の特徴マップとマルチスケールトレーニング戦略の開発を促進した。チャレンジはまた、多くの参加者が精度を維持しながら計算コストを削減するためにModel Pruningと知識蒸留を探求したため、モデル効率の重要性を浮き彫りにした。
COCO 2019の結果は学術文献で広く引用され、Generative AIシステムで使用されるものを含むその後のビジョンモデルの設計に影響を与えた。チャレンジの厳格な評価フレームワークは、PASCAL VOCやImageNetなどの他のデータセットと並んで、物体検出およびセグメンテーションアルゴリズムを比較するための標準ベンチマークとなった。さらに、競技の協力的な性質は知識共有を促進し、多くのチームがその方法を詳述した技術レポートを公開した。
遺産とその後の版
2019年版に続いて、COCOチャレンジは進化を続けた。2020年版では、セマンティックセグメンテーションとインスタンスセグメンテーションを組み合わせたパノプティックセグメンテーションなどの新しいタスクが導入された。その後の年には、Transformer (architecture)ベースのアーキテクチャの統合が見られ、最終的にリーダーボードを支配した。COCOデータセットは、コンピュータビジョンにおけるMachine learningモデルのトレーニングと評価のための基盤リソースであり続け、そのアノテーションは無数の研究プロジェクトで使用されている。
COCO 2019はまた、学界を超えたより広範な影響を持っていた。チャレンジ中に洗練された技術の多くは、自動運転システムや医療画像ツールを含む商業製品に採用された。チャレンジの現実世界のシナリオ、例えば遮蔽された物体や複雑なシーンへの重点は、実験室での研究と実用的な応用との間のギャップを埋めるのに役立った。2020年代半ばの時点で、COCOベンチマークは視覚認識の進歩を測定するための参照点であり続けており、2019年版は新しい性能記録を打ち立て、革新の波を刺激した画期的な年として記憶されている。