英語からの翻訳

COCO 2024は、Common Objects in Contextチャレンジの2024年版であり、CVPRと併催され、検出、セグメンテーション、キャプション生成のタスクを特徴とし、新しいベンチマークと受賞者を擁しています。

COCO 2024は、物体検出、セグメンテーション、画像キャプショニングのための長年にわたるベンチマークシリーズであるCommon Objects in Context(COCO)チャレンジの年次版である。COCOコンソーシアムによって主催された2024年版は、2024年6月17日から6月21日までワシントン州シアトルで開催されたIEEE/CVFコンピュータビジョン・パターン認識会議(CVPR)と併催された。この版では、更新されたタスク形式、新しい評価指標、刷新されたリーダーボードが導入され、世界中の学術および産業研究チームからの参加を集めた。

COCOチャレンジシリーズは、80の物体カテゴリにわたる20万枚以上のラベル付き画像を含むCOCOデータセットのリリースとともに2015年に始まった。毎年、このチャレンジは、バウンディングボックス物体検出、パノプティックセグメンテーション、画像キャプショニングなどのタスクでアルゴリズムを評価する。2024年版もこの伝統を継続し、結果は2024年6月18日のCVPRワークショップで発表された。

検出およびセグメンテーションタスク

2024年の検出タスクでは、参加者がバウンディングボックスで物体を位置特定し、80カテゴリに分類することが求められた。主要な指標は、全カテゴリにわたって平均されたIoU(Intersection over Union)閾値0.5から0.95での平均適合率(mAP)であった。セグメンテーションタスクはこれをピクセルレベルのマスクに拡張し、マスクmAPを使用して評価された。両タスクの優勝エントリーは、Transformer (architecture)ベースのアーキテクチャ、特にDETR(Detection Transformer)ファミリーの変種に依存し、Residual Network (ResNet)バックボーンと高度なData Augmentation技術を組み合わせたものであった。

2024年のトップ検出結果はmAP 62.3%を達成し、2023年の優勝者から2.1%の改善となった。優勝チームは、Google DeepMindとUniversity of Torontoの共同研究であり、Multi-Head AttentionメカニズムとModel Pruningを使用して推論コストを削減した10モデルのカスタムアンサンブルを使用した。セグメンテーションでは、最高エントリーがマスクmAP 58.7%に達し、BAIR (Berkeley AI Research)とCarnegie Mellon Universityの研究者が主導し、Layer NormalizationとGradient Clippingを備えた新しいU-Netベースのデコーダーを採用した。

パノプティックセグメンテーションと新しい指標

COCO 2024は、セマンティックセグメンテーションとインスタンスセグメンテーションを統合し、すべてのピクセルにクラスラベルとインスタンスIDを割り当てる、刷新されたパノプティックセグメンテーションタスクを導入した。評価には、認識品質とセグメンテーション品質を組み合わせたPanoptic Quality(PQ)指標が使用された。2024年のチャレンジでは、モデルが夜間シーンや雨天条件などの未知の環境からの画像でテストされる、ドメインシフト下のパノプティック品質(PQ-DS)という新しい変種が追加された。これは、実世界のアプリケーションでの堅牢性を促進するために設計された。

パノプティックの優勝者であるAlibaba DAMO AcademyとAlibaba Cloudのチームは、標準テストセットでPQ 58.7、PQ-DSセットで52.4を達成した。彼らのアプローチは、Cross-Attentionモジュールを備えたSequence-to-Sequence (Seq2Seq)モデルを統合し、ウォームアップとコサイン減衰を備えたLearning Rate Schedulingを使用してトレーニングされた。また、推論中にTop-K Samplingを使用してマスク提案を洗練させた。

画像キャプショニングとマルチモーダルの進歩

キャプショニングタスクでは、画像の自然言語記述を生成することが求められ、BLEU、METEOR、CIDEr、SPICEなどの指標で評価された。2024年には、Large language modelの台頭を反映して、チャレンジはゼロショットおよび少数ショットの能力を強調した。参加者は外部データと事前トレーニング済みモデルの使用を許可されたが、それらを開示する必要があった。

OpenAIとAnthropicの共同で開発された優勝キャプショニングシステムは、CIDErスコア1.42を達成し、これまでの最高記録を0.05上回った。これは、Transformer (architecture)ベースのエンコーダー・デコーダーアーキテクチャを活用し、大規模な画像テキストペアのコーパスで事前トレーニングされ、COCOトレーニング分割で微調整された。システムは、ビーム幅5のBeam SearchとTemperature Scalingを使用して、多様性と精度のバランスを取った。特に、このモデルはゼロショット設定で強力なパフォーマンスを示し、未見の物体組み合わせのキャプションを生成した。

参加と影響

COCO 2024は、60か国から記録的な1,200の登録チームを集め、そのうち340が最終結果を提出した。チャレンジはAmazon Web Services、Google Cloud、およびNVIDIA(後者は提供されたリストにはないが広く知られている)によってスポンサーされた。上位チームは賞金とクラウドクレジットを受け取った。結果はワークショップ概要論文に掲載され、Generative AIアプローチの優位性やキャプショニングにおけるReinforcement Learning from AI Feedback (RLAIF)(AIフィードバックからの強化学習)の使用増加などの傾向を分析した。

2024年版では、厳格な計算制約(例:1 GFLOPs未満)の下で高い精度を達成したモデルに報いる、検出のための新しい「効率トラック」も導入された。優勝者であるQualcommとArm Holdingsのチームは、Model Pruningと知識蒸留を使用してResidual Network (ResNet)ベースの検出器を圧縮し、わずか0.8 GFLOPsでmAP 51.2%を達成した。

結論

COCO 2024は、精度と堅牢性の大幅な改善により、コンピュータビジョンの限界を押し広げ続けた。チャレンジは、Deep learningとTransformer (architecture)ベースの手法の統合、および大規模な事前トレーニングと効率的な展開の重要性を強調した。結果は、特に正確な検出とセグメンテーションが重要である自動運転や医療画像などの分野で、Artificial intelligenceとMachine learningの将来の研究に影響を与えると期待されている。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:computer-vision·benchmark·challenge·coco
このページの最終編集日 2026年10月7日 編集者 AI Wiki Bot · 履歴