COCO 2014(Common Objects in Context)は、Microsoft COCOデータセットの最初の公開リリースであり、物体検出、セグメンテーション、画像キャプションの進歩を目的とした大規模な画像コレクションである。2014年にTsung-Yi Lin、Michael Maire、Serge Belongie、James Hays、Pietro Perona、Deva Ramanan、Piotr Dollár、C. Lawrence Zitnickによる論文で初めて発表され、このデータセットは80の物体カテゴリにわたる250万以上のラベル付きインスタンスを含む328,000枚の画像で構成されている。その特徴的な点は、物体が自然な空間的関係にある日常的なシーンに重点を置いていることであり、中心に配置された孤立した被写体を多く含むImageNetのような初期のデータセットとは対照的である。
2014年のリリースは、ベンチマークの慣例となった標準的なトレイン/バリデーション(val)分割を確立した。トレーニングセットには82,783枚の画像が含まれ、バリデーションセットには40,504枚の画像が含まれる。別のテストセット(40,775枚)は評価に使用されたが、過学習を防ぐためにラベルは一時的に非公開とされた。アノテーションには、バウンディングボックスだけでなくインスタンスごとのセグメンテーションポリゴン、画像ごとの5つの自然言語キャプション、そして一部のサブセットには人間のポーズ推定のためのキーポイントアノテーション(具体的には、トレーニング画像5,000枚とバリデーション画像2,000枚における17の身体関節)が含まれる。データセットには、画像レベルのシーンカテゴリや、コンテキストのための「スタッフ」カテゴリ(例:空、草)も含まれるが、これらは後のリリースでより完全に発展された。
アノテーション形式と課題
COCO 2014は、業界標準となったJSONベースのアノテーション形式を導入した。各画像はセグメントに関連付けられ、これらはポリゴン座標の配列として保存される。インスタンスには、極値点から導出されたバウンディングボックスも含まれる場合がある。現実世界の難しさを反映するため、データセットには意図的に小さく、遮蔽され、切り詰められた物体が含まれ、一部のインスタンスには多くの検出チャレンジが無視した「困難」フラグが設定されている。公式の評価メトリクスである、0.5から0.95まで0.05刻みの複数のIntersection-over-Union(IoU)しきい値でのAverage Precision(AP)は、正確なマスクとボックスを生成する手法を促進し、粗い位置特定を超えて分野を押し進めた。
コンピュータビジョン研究への影響
COCO 2014のリリースは、ICCVやCVPRなどの主要な会議と並行して開催された2015年のCOCO検出チャレンジを皮切りに、一連のチャレンジを触発した。勝利したシステムは、古典的な手作り特徴から、畳み込みニューラルネットワークに基づく初期の深層学習モデルへと急速に進歩した。データセットの規模とアノテーションの詳細さにより、研究者はセグメンテーシンやポーズ推定のための残差ネットワークや他のアーキテクチャを訓練することができ、後のパノプテッィク・セグメンテーシンなどの後続タスクの基盤となった。キャプシンも、画像キャプシンンのための系列対系列モデルの発展を促し、マルチモーダル学習の台頭に直接貢献した。
現代のAI開発における役割
2020年代現在、COCO 2014は人工知能で最も引用されるデータセットの1つであり続けている。物体検出におけるネーラル・ネットワークの評価のための共通のテスッベッドとして機能し、Detectron2やYOLOなどのフレーmワークが日常的にそのメートリクスを報告している。2014年の分割は再現性の点で特に価値が高い。後のCOCO 2017版がトレイン/バル分割の規模を変更し、118k/5k画像に移行したのとは異なり、2014年版の正確な構成は広くアーカイブされ、研究されている。多く の機会学習実務者は、訓練済みモデルやコーdベースが2014年のデイレクトリ構成とアノテーションIDを期待することが多いため、今なお原版をダウンロードする。
後のリリースとの違異
COCO 2014は、いくつかの技術的な点で2017年版と区別される。2014年のト レインセットには82,783枚の画像が含まれる一方、2017年のトレインには118,287枚があり、2014年のバルセット(40,504枚)は2017年の(5,000枚)よりもはるかに大きい。2017年のテストセットもより大きかった。さらに、2014年のリリースには公式の「ラベルなし」サブセットがなく、2017年には半教師あり学習のための123,000枚のラベルなし画像が追加された。2014年のキーポイントアノテーションは数千枚の画像でのみ利用可能であるが、2017年にはすべてのトレーニングおよびバリデーション画像に拡張された。これらの違いは、2014年のデータを使用する際に、現代のベンチマークと結果を比較するには注意が必要であることを意味するが、多くの古典的な論文が2014年の分割で報告しており、歴史的分析にとって関連性を保っている。
遺産と継続的利用
COCO 2014の成功は、豊かにアノテーションされ、コンテキストに重きを置いたデータセットの価値を示し、後のLVISやOpen Imagesなどの取組に影響を与えた。そのアノテーション・スキーマは、ポリゴン・マスクの解析やインスタンス・セグメンテーシンの評価のためのデフォルトであり続けるCOCO APIなどの現代のツールに残っている。新し いデー タセットが登場するにつれても、COCO 2014の規模、アノテーションの深さ、公開分割の安定性の組み合わせは、アルゴリズム開発のための「理論的標準」としての役割を保証している。分野がより大規模なマルチモーダル・デー タセットへと移行している一方で、COCO 2014は今なお無数の博土論分や産業用モデルの評価を支えており、ビジョン研究におけるその永続的な有用性を証している。
関連項目
- Data Augmentation - COCO画像の訓練でよく使われる技法
- Loss Functions - 検出およびセグメンテーション損失で使用される関数タイプ
- AWS - COCOのホスティングと処理に一般的に使用されるクラウドプラットフォーム
- Stanford AI Lab - COCOベースの評価に貢献してきた研究グループ