COCO Captions 2015は、画像キャプション生成のための広く使用されるベンチマークデータセットであり、Microsoft COCO(Common Objects in Context)2014および2015コレクションの各画像に対して、5つの独立した人間による記述が含まれている。このデータセットは、人工知能および機械学習の研究、特に視覚コンテンツの自然言語記述を生成するタスクを支援するために導入された。各キャプションは、対応する画像に存在する物体、動作、関係を記述する完全な文であり、整列された視覚言語データの豊富な情報源を提供する。
キャプションはAmazon Mechanical Turkを通じて収集され、ワーカーは画像の重要な部分をすべて1文で記述するよう指示された。データセットには33万以上の画像が含まれ、各画像に5つのキャプションがペアリングされ、150万以上のキャプションと画像のペアが生成されている。COCO Captions 2015は、コンピュータビジョンと自然言語処理における深層学習技術を組み合わせたモデルの標準的な評価セットとなり、しばしばニューラルネットワークアーキテクチャ(エンコーダー・デコーダーモデルなど)が使用される。このデータセットの設計は、異なるアノテーターが同じシーンを様々な方法で記述するため、表現の多様性を促進し、モデルの流暢で意味的に正確なテキスト生成能力を試す。
構造と統計
COCO Captions 2015データセットは、トレーニング、検証、テストの各分割に編成されており、テスト分割はさらに公開テストセットと公式評価に使用される非公開テストセットに分かれている。トレーニング分割には約82,783枚の画像、検証分割には40,504枚の画像、テスト分割には40,775枚の画像が含まれる。各画像には5つのキャプションが関連付けられているが、過学習を防ぐためテストセットのキャプションは公開されておらず、研究者は評価サーバーに予測を提出する。キャプションの長さは様々で、通常8語から25語の範囲であり、人、動物、乗り物、屋内・屋外の設定など、日常的なシーンの広い範囲をカバーしている。
評価指標
COCO Captions 2015の標準的な評価指標には、BLEU、METEOR、ROUGE-L、CIDErが含まれる。CIDEr(Consensus-based Image Description Evaluation)は画像キャプション生成のために特別に設計され、TF-IDF重み付けされたn-gramオーバーラップを使用して、生成されたキャプションと人間の参照セット間のコンセンサスを測定する。データセットの公式評価スクリプトは非公開テストセットでこれらの指標を計算し、リーダーボードは最先端モデルの性能を追跡する。2015年には、トップパフォーマンスのシステムがBLEU-4スコア約0.30、CIDErスコア約1.0を達成したが、その後のトランスフォーマーベースのアーキテクチャと大規模言語モデルの事前学習の進歩により、これらの数値は大幅に改善されている。
モデル開発における役割
COCO Captions 2015は、現代の画像キャプション生成システムの開発において重要な役割を果たしてきた。初期のアプローチでは、視覚的特徴抽出に残差ネットワークまたはU-Netバックボーンを使用し、テキスト生成にリカレントニューラルネットワークを組み合わせた。その後、トランスフォーマーアーキテクチャで導入されたマルチヘッドアテンションおよびクロスアテンションメカニズムがリカレントコンポーネントを置き換え、より効率的な並列トレーニングを可能にした。データセットはまた、データ拡張およびカリキュラム学習の研究、ならびにビームサーチおよびトップpサンプリング復号戦略の使用を促進した。OpenAIやGoogle DeepMindを含む多くの生成AIモデルが、COCO Captions 2015を事前学習または評価ベンチマークとして使用しているが、Flickr30kやVisual Genomeのような新しいデータセットが登場している。
限界と遺産
このデータセットには既知の限界があり、一般的な物体と単純な文構造への偏り、およびクラウドワーカーによるアノテーションノイズの可能性が含まれる。また、より最近のベンチマークに現れる細かい空間関係や構成的推論の課題が欠けている。これらの問題にもかかわらず、COCO Captions 2015は画像キャプション生成方法の比較と視覚言語アライメントの研究のための基礎的なリソースであり続けている。画像ごとに5つのキャプションを提供する設計は後のデータセットに影響を与え、その評価プロトコルは学術研究で引き続き使用されている。データセットは学術利用のために自由に利用可能であり、そのアノテーションは文献で広く引用されている。
関連ベンチマークと拡張
COCO Captions 2015の拡張には、中国語キャプションを追加するCOCO-CNや、新しい物体のキャプション生成に焦点を当てたnocapsが含まれる。データセットはまた、COCO検出およびセグメンテーションタスクと重複しており、マルチタスク学習を可能にする。研究者はしばしばCOCO Captions 2015を他のデータセットと組み合わせて一般化を改善し、視覚言語タスクにおけるシーケンス・ツー・シーケンスモデルのテストの一般的な選択肢であり続けている。データセットの影響はAmazon Web ServicesやGoogle Cloudの提供物にも及び、クラウドベースのモデルトレーニング用の前処理済みバージョンを提供している。