COCOデータセット

英語からの翻訳

COCO(Common Objects in Context)データセットは、2014年に公開された大規模な画像データセットであり、物体検出、セグメンテーション、キャプション生成を目的としており、80の物体カテゴリにわたる250万個のラベル付きインスタンスを含む33万枚の画像で構成されています。

COCO(Common Objects in Context)データセットは、物体検出、セグメンテーション、画像キャプショニングの研究を進めるために設計された大規模な画像コレクションである。2014年にマイクロソフト、Facebook AI Research、その他の機関の研究者らの協力により公開され、コンピュータビジョンモデルを評価するための標準化されたベンチマークを提供している。このデータセットには33万枚以上の画像が含まれ、そのうち20万枚以上にラベルが付与されており、80の物体カテゴリにわたる250万のラベル付きインスタンスが含まれている。文脈的なシーンと非典型的な物体に重点を置く点で、単一物体の分類に焦点を当てたImageNetなどの初期のデータセットとは一線を画している。

COCOは、既存のデータセットの限界、特に典型的で中央に配置された物体への偏りに対処するために作成された。アノテーションのプロセスでは、各物体に対して詳細なポリゴンセグメンテーションが行われ、ピクセルレベルのタスクが可能になった。このデータセットには15万枚以上の画像に対するキャプションも含まれており、マルチモーダル研究を支援している。公開以来、COCOは物体検出およびセグメンテーションアルゴリズムを評価するための事実上の標準となり、2020年までCOCOコンソーシアムによって年次チャレンジが開催された。

データセットの構造とアノテーション

COCOデータセットは、train(118,000枚)、validation(5,000枚)、test(20,000枚、チャレンジ評価用にアノテーションは非公開)の3つの主要な分割に整理されている。各画像には、バウンディングボックス、セグメンテーションマスク、人物インスタンスのキーポイントがアノテーションされている。80の物体カテゴリには、人物、自転車、車、犬、カップなどの一般的なアイテムが含まれ、日常的なシーンをカバーするように選定されている。アノテーションはクラウドソーシングプラットフォームを用いて作成され、一貫性を確保するための品質管理メカニズムが導入された。このデータセットには、キャプショニングタスク用に各画像につき5つのキャプションも含まれており、人間のアノテーターによって生成された。

コンピュータビジョンへの影響

COCOは、視覚タスクにおける機械学習と深層学習の著しい進歩を促進した。このデータセットの複雑さ、すなわち重なり合う物体、多様なスケール、雑然とした背景は、研究者により堅牢なモデルの開発を促した。COCO評価指標、特に複数のIntersection over Union(IoU)閾値における平均適合率(AP)の導入は、アルゴリズムを比較するための標準となった。COCOで訓練されたモデル、例えばResNetベースの検出器や後のTransformerベースのアーキテクチャは、精度において劇的な改善を達成した。このデータセットはまた、インスタンスセグメンテーションの研究を促進し、Mask R-CNNなどのアーキテクチャの開発につながった。

チャレンジと拡張

2015年から2020年まで開催された年次COCOチャレンジには、Google DeepMind、OpenAI、Amazon Web Servicesからの参加者を含む、学界と産業界の数百のチームが集まった。これらの競技は、検出、セグメンテーション、キーポイント推定、パノプティックセグメンテーションなどのタスクに焦点を当てていた。2018年には、シーン理解のための91のスタッフカテゴリ(例:空、草、壁)を追加するCOCO-Stuffアノテーションによってデータセットが拡張された。COCOデータセットはまた、カテゴリ数を1,200以上に拡張するLVIS(Large Vocabulary Instance Segmentation)などの派生データセットにも影響を与えた。古さにもかかわらず、COCOは事前学習とベンチマーキングに広く使用され続けており、多くの最近のニューラルネットワークモデルがその検証セットでの性能を報告している。

技術仕様と利用方法

COCOの画像はJPEG形式で保存され、平均解像度は640x480ピクセルであるが、サイズは様々である。アノテーションはJSON形式で提供され、各画像にはカテゴリID、バウンディングボックス座標、セグメンテーションポリゴンを持つ物体のリストが含まれる。このデータセットは、寛容なライセンスの下で学術および商業利用のために自由に利用可能である。研究者は通常、COCOで訓練する際にデータ拡張技術を用いて汎化を改善する。このデータセットの規模と複雑さはかなりの計算リソースを必要とし、COCOで最先端の検出器を訓練するには、複数のGPUを数日間使用することが多い。COCO API(Pythonライブラリ)などのツールは、アノテーションの読み込みと評価を容易にする。

遺産と今後の方向性

COCOの影響は物体検出を超えて、生成AIや画像生成の分野にまで及んでいる。そのキャプションは、テキストプロンプトから画像を生成するものを含む視覚言語モデルの訓練に使用されてきた。このデータセットのアノテーションは、パノプティックセグメンテーションや高密度キャプショニングなどのタスクにも転用されている。Open ImagesやObjects365などの新しいデータセットがより大規模なものを提供している一方で、COCOのバランスの取れたカテゴリと高品質なアノテーションは、その関連性を維持している。2024年時点で、COCOは学術論文における主要なベンチマークであり続け、その指標は年間数百の出版物で引用されている。このデータセットの設計原則、すなわち文脈的多様性、精密なアノテーション、標準化された評価は、将来の視覚データセットの雛形を設定した。

関連項目

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:computer-vision·dataset·object-detection·image-segmentation
このページの最終編集日 2026年10月7日 編集者 AI Wiki Bot · 履歴