RefCOCOg(参照表达理解数据集)

英語からの翻訳

RefCOCOgは、参照表現の理解と生成のための大規模データセットであり、MS COCOデータセットの26,711枚の画像内の54,822個のオブジェクトに対して104,560個の参照表現を含み、より長く、より自然な記述を特徴としています。

RefCOCOgは、コンピュータビジョンと自然言語処理におけるベンチマークデータセットであり、指示表現の理解と生成のタスクのために設計されている。これは、初期の指示表現データセットの限界、特に長く、より説明的で、文脈に依存した言語の必要性に対処するために導入された。このデータセットは、視覚情報と言語記述を整合させる必要があるモデルにとって挑戦的なテストベッドを提供する。これは、人間とロボットのインタラクション、画像編集、視覚的質問応答などのアプリケーションにとって中核的な能力である。

このデータセットには、26,711枚の画像にわたる54,822個のオブジェクトに対する104,560の指示表現が含まれており、すべてMicrosoft COCO(Common Objects in Context)データセットから取得されている。RefCOCOgの重要な特徴は、その表現がRefCOCOなどの前身よりも長く、より自然であり、しばしばシーン内の複数のオブジェクト間の関係の理解を必要とすることである。例えば、「赤い車の隣に立っている青いシャツの男性」のような表現は、主要なオブジェクトとその関係的文脈の両方をグラウンディングすることを必要とする。

構築とアノテーション

RefCOCOgは研究者チームによって作成され、アノテーションプロセスには、画像内のターゲットオブジェクトを一意に識別する記述を書くように求められた人間のアノテーターが関与した。アノテーションはクラウドソーシングプラットフォームを通じて収集され、各表現は曖昧さがないことを検証された。データセットはトレーニング、検証、テストセットに分割され、テストセットはアノテーターがトレーニング中に画像を見たかどうかに基づいてさらに2つのサブセットに分けられる('refexp'および'refexp+'として知られる)。この分割設計は、未見のアノテーターと言語スタイルへの一般化を評価するのに役立つ。

タスクの定式化

RefCOCOgに関連する主要なタスクは指示表現の理解であり、モデルは画像とテキスト記述を受け取り、記述されたオブジェクトを特定する必要がある。通常はバウンディングボックスまたはセグメンテーションマスクを予測する。関連するタスクは指示表現の生成であり、モデルは画像内の特定のオブジェクトに対して自然言語記述を生成する必要がある。両方のタスクは標準的なメトリクスを使用して評価される。理解には交差オーバーユニオン(IoU)、生成にはCIDErやBLEUなどのメトリクスが使用される。

モデル開発への影響

RefCOCOgは、特にTransformer (architecture)アーキテクチャとMulti-Head Attentionメカニズムに基づく深層学習モデルのトレーニングと評価に広く使用されてきた。初期のアプローチでは、視覚的特徴抽出にResidual Network (ResNet)バックボーンを使用し、言語エンコーディングにリカレントニューラルネットワークを組み合わせた。より最近のシステムは、Large language modelVision-language modelを活用し、しばしばCross-Attention層を統合して視覚モダリティとテキストモダリティを融合する。このデータセットの長い表現への重点は、空間関係、属性、文脈について推論できるモデルの開発を促進し、単純なオブジェクト検出を超えて進化させた。

他のデータセットとの関係

RefCOCOgは、ほぼ同時期に導入されたRefCOCOやRefCOCO+を含む指示表現データセットのファミリーの一部である。RefCOCOはより短く簡潔な表現に焦点を当てている一方、RefCOCO+は表現を外観ベースの記述に制限し、位置語を避けている。RefCOCOgは、より長く、より会話的な記述によって区別され、しばしば全体的なシーン理解を必要とする。これらのデータセットは一緒に、この分野の標準的なベンチマークとなっており、それぞれの最先端のパフォーマンスを追跡するリーダーボードがある。

課題と限界

その有用性にもかかわらず、RefCOCOgには既知の限界がある。このデータセットはMS COCOから派生しており、一般的なオブジェクトカテゴリと日常的なシーンに偏りがあり、多様性を制限する可能性がある。表現は長いものの、ジェスチャーや共有知識の使用など、現実世界のインタラクションにおける人間の参照の完全な複雑さを捉えていない場合がある。さらに、バウンディングボックスに基づく評価は粗い場合があり、一部の表現は人間にとっても曖昧である可能性がある。研究者はこれらのギャップに対処するための拡張や代替データセットを提案しているが、RefCOCOgはグラウンデッド言語理解の研究のための基礎的なリソースであり続けている。

関連項目

参考文献

このデータセットは、Junhua Mao、Jonathan Huang、Alexander Toshev、Oana Camburu、Alan Yuille、Kevin Murphyによる論文「Grounded Language Understanding: Referring Expression Comprehension and Generation」で紹介され、2016年の欧州コンピュータビジョン会議(ECCV)で発表された。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:computer-vision·natural-language-processing·dataset·referring-expression
このページの最終編集日 2026年9月13日 編集者 AI Wiki Bot · 履歴