COCO 2020は、コンピュータビジョンにおける長年にわたるベンチマークおよび競技シリーズであるCommon Objects in Context(COCO)チャレンジの2020年版を指す。学術および産業界の研究者からなるコンソーシアムによって主催され、このチャレンジは物体検出、インスタンスセグメンテーション、画像キャプション生成などのタスクにおけるアルゴリズムを評価する。2020年版は2020年6月にコンピュータビジョンおよびパターン認識会議(CVPR)と併催されたが、COVID-19パンデミックのため、物理的なイベントはバーチャル形式に置き換えられた。このチャレンジには主要な研究グループやテクノロジー企業が参加し、結果はオンラインで発表された。
COCOデータセット自体は2014年に初めて公開され、80の物体カテゴリにわたる20万枚以上のラベル付き画像を含み、150万以上の物体インスタンスが存在する。2020年のチャレンジでは2017年版のデータセットが使用され、画像はトレーニングセット(118,000枚)、バリデーションセット(5,000枚)、テストセット(20,000枚)に分割されている。検出およびセグメンテーションの主要な評価指標は、様々な交差結合比(IoU)閾値における平均精度(AP)であり、主要指標はIoU 0.50:0.95でのAPである。キャプション生成では、BLEU、METEOR、ROUGE、CIDEr、SPICEなどの指標が使用される。
チャレンジタスクと受賞者
2020年のチャレンジには、検出、インスタンスセグメンテーション、キーポイント検出、画像キャプション生成の複数のトラックが含まれていた。検出タスクでは、優勝チームがテスト開発セットでAP 0.617を達成し、2019年の優勝者の0.493から大幅な改善を示した。上位のソリューションは、深層学習の高度なアーキテクチャを採用しており、残差ネットワークやニューラルネットワークの設計にバッチ正規化やドロップアウトの技術を組み合わせたバリエーションが含まれていた。インスタンスセグメンテーションの優勝者はAP 0.582を達成し、キーポイント検出の優勝者はAP 0.764を達成した。キャプション生成では、最良のモデルがCIDEr 1.302を獲得し、トランスフォーマーベースのシーケンス・ツー・シーケンスアーキテクチャをマルチヘッドアテンションや位置エンコーディングとともに使用した。
技術的革新
COCO 2020の参加者は、いくつかの方向で最先端を押し進めた。多くの上位エントリーは、データ拡張戦略を採用し、ランダムクロップ、スケーリング、カラーシフトなどを用いて汎化性能を向上させた。学習率スケジュールの技術、例えばコサインアニーリングやウォームアップが広く採用された。一部のチームは、精度を維持しながら計算コストを削減するためにモデルプルーニングを使用した。AdamやAdamオプティマイザなどのSGDバリアントの使用が一般的であり、トレーニングを安定させるために勾配クリッピングと組み合わせられることが多かった。レイヤー正規化とバッチ正規化は、ネットワークの異なる部分で両方適用された。競技ではまた、自然言語処理研究からのトランスフォーマーの革新に基づいて、検出ヘッドでのクロスアテンションメカニズムの使用が増加した。
影響と遺産
COCO 2020の結果は、その後のコンピュータビジョン研究に影響を与えた。優勝したアーキテクチャとトレーニングレシピは、自動運転、ロボティクス、医療画像などの人工知能アプリケーションを含む多くの後続プロジェクトで採用された。このチャレンジは、大規模な機械学習の重要性と、高精度を達成するためのニューラルネットワーク設計の役割を浮き彫りにした。COCOベンチマークは標準的な評価ツールであり続け、2020年版は将来の競技のための新しいベースラインを設定した。このイベントはまた、MIT CSAIL、スタンフォードAIラボ、バークレーAIリサーチなどの学術機関と、Google DeepMindやOpenAIなどの産業ラボとの間の協力を促進したが、優勝チームの正確な所属はさまざまであった。
他のベンチマークとの比較
COCO 2020は物体レベルの理解に焦点を当てていた一方、ImageNetなどの他のベンチマークは画像分類を対象としている。COCOのインスタンスセグメンテーションとキャプション生成への重点は、それをより困難で、現実世界のシーン理解に近いものにした。2020年版では、最良と平均のパフォーマンスの間に顕著なギャップが見られ、改善の余地があることを示した。決定論的なチェスコンピュータベンチマークとは対照的に、COCOタスクは視覚的な変動性と曖昧さを扱う必要がある。この競技はまた、テキスト生成ではなく視覚知覚に焦点を当てている点で、大規模言語モデルの評価とは異なっていた。これらの違いにもかかわらず、キャプション生成におけるトップkサンプリングなどのCOCO 2020の技術は、生成AIモデルとの類似点を見出した。
将来の方向性
COCO 2020の後、コミュニティはLVISやOpen Imagesなど、より多くのカテゴリとロングテール分布を含む、より包括的なベンチマークへと移行した。2020年のチャレンジの効率性への焦点は、ARMホールディングスやクアルコムなどのエッジデバイスに展開可能な軽量モデルへの研究を促進した。2020年に普及したトランスフォーマーベースの検出器の使用は、その後の数年間で主流となった。COCO 2020のデータセットと結果は、多くの深層学習フレームワークでの事前トレーニングと評価に引き続き使用されている。2025年現在、COCOは参照点であり続けているが、より高解像度でビデオデータを含む新しいデータセットが登場している。