MS COCO(Microsoft Common Objects in Contextの略称)は、物体検出、セグメンテーション、画像キャプション生成の研究を進めるために設計された大規模画像データセットである。2014年にマイクロソフトによって公開され、自然な文脈の中で複数の物体を含む日常的なシーンを描いた豊富な画像を提供し、単一の中心に配置された物体を特徴とする初期のデータセットの限界に対処している。このデータセットは、コンピュータビジョンアルゴリズム、特に機械学習と深層学習の分野における評価の標準的なベンチマークとなっている。
MS COCOには33万枚以上の画像が含まれ、そのうち20万枚以上がラベル付けされ、80の物体カテゴリにわたって150万個の物体インスタンスが存在する。各画像には、バウンディングボックス、セグメンテーションマスク、キャプションなどの詳細なアノテーションが含まれており、インスタンスセグメンテーションや画像キャプション生成といったタスクを可能にしている。このデータセットは、物体が典型的な環境に現れるという文脈の重視により、しばしば孤立した物体を特徴とするImageNetやPASCAL VOCなどの以前のデータセットよりも、より困難で現実的である。
データセットの構造とアノテーション
MS COCOデータセットは、主に3つの分割に整理されている:トレイン(約11万8000枚)、バリデーション(約5000枚)、テスト(約4万1000枚)である。アノテーションはJSON形式で提供され、カテゴリラベル、ポリゴンベースのセグメーションマスク、画像ごとの5つの人間によるキャプションが含まれる。80のカテゴリは、人物、車、犬、家具などの一般的な物体を網羅し、非象徴的な視点、すなわち様々な角度やスケールから撮影され、しばしば部分的に遮蔽された物体に焦点を当てている。
検出とセグメンテーションに加えて、MS COCOは人間のポーズ推定のためのキーポイント検出タスクを含み、人物ごとに17の身体関節がアノテーションされている。2017年に導入されたこの拡張は、ポーズ推定のためのニューラルネットワークアーキテクチャの進歩を支えてきた。このデータセットはまた、領域が短いフレーズで記述される密なキャプション生成や、セマンティックセグメンテーションとインスタンスセグメンテーションを組み合わせたパノプティックセグメンテーションもサポートしている。
コンピュータビジョン研究への影響
MS COCOは、その導入以来、コンピュータビジョンにおける顕著な進歩を推進してきた。2015年から2019年まで開催された毎年のCOCO検出チャレンジは、最先端モデルを比較するための重要な場となった。優勝したアプローチはしばしば残差ネットワークのバックボーンと特徴ピラミッドネットワークを採用し、平均適合率(mAP)の着実な改善につながった。例えば、2015年の優勝者は約37%のmAPを達成したが、2019年までに上位モデルは50%以上のmAPを超え、急速なアルゴリズムの進歩を反映している。
このデータセットはまた、画像キャプション生成のためのモデルのトレーニングと評価にも重要な役割を果たしてきた。初期のキャプション生成システムは注意機構を備えたリカレントニューラルネットワークを使用していたが、現代のアプローチはトランスフォーマーアーキテクチャと大規模言語モデルのコンポーネントを活用している。MS COCOのキャプションは、視覚的理解と自然言語生成を結びつけるマルチモーダルモデルの標準的なトレーニングコーパスとなっている。
関連データセットと拡張
MS COCOから派生または触発されたいくつかのデータセットが存在する。COCO-Stuffは、元の物体カテゴリを補完する91のスタッフクラス(例:空、草、壁)のピクセルレベルのセマンティックラベルを追加する。LVIS(Large Vocabulary Instance Segmentation)は、COCOのカテゴリを1200以上のクラスに拡張し、より詳細なベンチマークを提供する。さらに、COCOは、アノテーションがフレーム間で伝播されるパノプティックセグメンテーションやビデオインスタンスセグメンテーションなどのタスクのための合成データセットを作成するために使用されてきた。
生成AIの文脈では、MS COCOの画像とキャプションは、OpenAIやGoogle DeepMindによって開発されたものなどのテキストから画像へのモデルをトレーニングするために頻繁に使用されている。このデータセットの多様なシーンと説明的なキャプションは、モデルが言語と視覚コンテンツの対応関係を学習するのに役立ち、DALL-EやStable Diffusionなどのシステムの基盤となっている。
限界と批判
広く使用されているにもかかわらず、MS COCOには限界がある。このデータセットは西洋の都市的なシーンに偏っており、農村部や非西洋の環境の表現が限られているため、モデルのパフォーマンスに偏りが生じる可能性がある。80のカテゴリは固定されており、評価が事前に定義された物体のセットに制限されている。さらに、アノテーションプロセスは労働集約的でコストがかかり、より大規模または多様なデータセットへのスケーラビリティが制限されている。
研究者はまた、COCOの評価指標、特にmAPが、ドメインシフトや敵対的例に対するモデルの堅牢性を完全に捉えていない可能性があると指摘している。その結果、Open ImagesやObjects365などの新しいベンチマークが登場し、より大規模または異なるアノテーションタイプを提供している。それでもなお、MS COCOは基礎的なリソースであり続け、数千の論文で引用され、多くのビジョンモデルの事前トレーニングコーパスとして使用されている。
遺産と継続的な関連性
2025年現在、MS COCOは、新しいデータセットの登場にもかかわらず、物体検出とセグメンテーションの主要なベンチマークであり続けている。そのアノテーションは、Detectron2やMMDetectionなどの多くのオープンソースツールキットに統合されており、学界や産業界で広く使用されている。このデータセットはまた、異なる研究グループ間でモデルを比較するための共通基盤として機能し、人工知能研究における再現性を促進している。
COCO形式はアノテーションの事実上の標準となり、LabelMeやCVATなどのツールに採用されている。この標準化はデータ共有とモデル評価を簡素化し、データセットの永続的な影響に貢献している。LAION-5Bなどの大規模データセットが生成モデルのトレーニングにおいてCOCOをサイズで上回っている一方で、COCOの厳選されたアノテーションとベンチマークとしての地位は、厳密な評価設定での継続的な使用を保証している。