COCO 2023は、Common Objects in Context(COCO)チャレンジの2023年版であり、物体検出、インスタンスセグメンテーション、画像キャプショニングにおける最先端の手法を評価する年次コンペティションである。学術研究者と産業研究者のコンソーシアムによって主催され、このチャレンジは80の物体カテゴリにわたる20万枚以上のラベル付き画像を含むCOCOデータセットを使用する。2023年版では、更新された評価プロトコルが導入され、世界中のチームからの参加が奨励され、機械学習と深層学習における進行中の進歩を反映している。
COCOチャレンジは、2015年の開始以来、コンピュータビジョンのベンチマークとなっている。2023年版もこの伝統を継続し、参加者は検出、セグメンテーション、キーポイント推定を含む複数のトラックで競い合った。このチャレンジは、さまざまなIntersection-over-Union(IoU)閾値における平均適合率(mAP)などの厳格な評価指標と、複数の物体を含む複雑なシーンを描いた画像を用いた実世界の文脈への重点で知られている。
チャレンジのトラックとタスク
COCO 2023では、それぞれ特定のタスクに焦点を当てた複数のトラックが設けられた。主要なトラックは物体検出であり、モデルは画像内の物体を位置特定して分類する必要がある。インスタンスセグメンテーションでは、各物体に対してピクセルレベルのマスクが必要であり、パノプティックセグメンテーションはセマンティックセグメンテーションとインスタンスセグメンテーションを統合した。さらに、キーポイント検出トラックは人間のポーズ推定に焦点を当て、キャプショニングトラックは画像の自然言語記述の生成を評価した。各トラックには独自のリーダーボードがあり、主要なコンピュータビジョン会議と併催された関連ワークショップで受賞者が発表された。
データセットとアノテーション
2014年に初めてリリースされたCOCOデータセットは、定期的に更新された。2023年には、主催者が固定のトレーニング分割と検証分割を提供し、テスト画像は評価用に保留された。アノテーションには、バウンディングボックス、セグメンテーションマスク、キャプションが含まれ、すべて人間のアノテーターによってキュレーションされた。日常的なシーンから取得された画像によるデータセットの多様性は、これを困難なベンチマークにしている。2023年には、データセットに33万枚以上の画像が含まれ、250万以上のラベル付きインスタンスがあった。チャレンジには開発目的の「test-dev」セットも含まれ、最終結果は非公開のテストセットで計算された。
評価指標
COCO 2023の評価では、標準的なCOCO指標が使用された。IoU閾値を0.5から0.95まで0.05刻みで平均した平均適合率(AP)、およびIoU=0.50とIoU=0.75でのAPである。セグメンテーションでは、マスクIoUに基づいてAPが計算された。キーポイント検出では、Object Keypoint Similarity(OKS)が使用された。キャプショニングは、CIDEr、BLEU、METEORなどの指標を使用して評価された。これらの指標はモデル性能の包括的な評価を提供し、物体のスケールとカテゴリにわたって適合率と再現率のバランスを取る手法を奨励する。
注目すべき参加者と結果
COCO 2023の具体的な優勝チームは公開情報源に文書化されていないが、このチャレンジは通常、Google DeepMind、OpenAI、およびさまざまな大学を含む主要な研究機関や企業からのエントリーを引き付ける。過去数年間、上位のパフォーマーはしばしば残差ネットワークアーキテクチャ、マルチヘッドアテンションメカニズム、およびデータ拡張やモデルプルーニングなどの高度なトレーニング技術を採用していた。2023年版では、トランスフォーマーベースの検出器とキャプショニングのための生成AIの革新によって、精度の継続的な改善が見られた可能性が高い。しかし、公式記録がないため、具体的な優勝者は未確認のままである。
影響と遺産
COCOチャレンジはコンピュータビジョン研究に大きな影響を与え、物体認識とシーン理解の進歩を促進するベンチマークを設定してきた。COCO 2023は、その前身と同様に、手法を比較し、コラボレーションを促進し、視覚言語タスクのための大規模言語モデルの統合などの新たなトレンドを強調するための共通プラットフォームを提供した。このチャレンジの実世界の複雑さへの重点は、自動運転、ロボティクス、画像検索などの分野に適用可能な、より堅牢なモデルにつながった。分野が進化するにつれて、COCOは適応を続け、将来の版では新しいタスクとより大規模なデータセットが組み込まれる可能性が高い。