Flickr30k Entities

英語からの翻訳

Flickr30k Entitiesは、Flickr30kを拡張したフレーズグラウンディングデータセットであり、244kの共参照チェーンと31,783個のバウンディングボックスを追加し、名詞句を画像領域にリンクさせる。視覚的グラウンディングやマルチモーダルモデルの評価に使用される。

Flickr30k Entitiesは、フレーズグラウンディング(キャプション内の自然言語フレーズを画像内の対応する領域にリンクするタスク)のためのデータセットである。これは、Flickr30k画像キャプションデータセットを拡張し、エンティティのテキスト上の言及をその視覚的な位置に接続する詳細なアノテーションを追加することで作成された。このデータセットは、言語と視覚コンテンツの関係を理解する必要があるモデルを訓練・評価するために、コンピュータビジョンおよびマルチモーダル機械学習研究で広く使用されている。

このデータセットには、画像内の名詞句の視覚的な指示対象を特定する31,783個のバウンディングボックスが含まれている。また、単一の画像に対する複数のキャプションにわたって同じエンティティの異なる言及をグループ化する244kの照応連鎖も提供する。この構造により、研究者は直接的なフレーズと領域の対応付けだけでなく、マルチモーダル文脈における文間照応解決も研究できる。アノテーションは、日常的な物体、人物、動物の広範な語彙をカバーしており、このデータセットはグラウンディングされた言語理解の現実的なベンチマークとなっている。

アノテーション構造

Flickr30k Entitiesの各画像には、5つの独立した人間が書いたキャプションが関連付けられている。アノテーターはこれらのキャプション内の名詞句を特定し、視覚的な指示対象が存在する場合、各フレーズを画像内のバウンディングボックスにリンクした。同じエンティティがキャプション内または5つのキャプションにわたって複数回言及された場合、その言及は照応連鎖にグループ化された。この設計により、フレーズの位置特定とエンティティレベルの推論の両方でモデルを評価でき、モデルは複数のテキスト上の言及から証拠を集約する必要がある。

バウンディングボックスは、参照オブジェクトを密に囲む軸平行な矩形である。データセットはセグメンテーションマスクを提供せず、グラウンディングタスクに十分な粗い位置特定に焦点を当てている。照応連鎖は、視覚的質問応答やエンティティ状態に基づく画像検索など、モデルが異なる記述にわたってエンティティを追跡する必要があるタスクに不可欠である。

構築と統計

このデータセットは、写真共有ウェブサイトFlickrから収集された31,783枚の画像からなる元のFlickr30kコーパスに基づいて構築された。画像は、活動中の人物、動物、日常的な物体など、多様なシーンを描いている。エンティティアノテーションは、一貫性を確保するための品質管理措置を備えたクラウドソーシングパイプラインを通じて生成された。最終データセットには244kの照応連鎖と31,783個のバウンディングボックスが含まれ、画像あたり平均で約1つのバウンディングボックスがあるが、多くの画像には複数のエンティティが含まれている。

注目すべき特徴は、画像内に視覚的に存在しないエンティティを指すフレーズが含まれていることである。これらはそのようにマークされ、モデルがグラウンディングされた言及とされていない言及を区別することを学習できる。この側面は、キャプションがフレーム外のオブジェクトに言及する可能性がある実世界のアプリケーションにとって重要である。

研究での使用

Flickr30k Entitiesは、フレーズグラウンディングおよび指示表現理解の標準的なベンチマークとなっている。モデルは通常、与えられた名詞句に対して正しいバウンディングボックスを予測する能力で評価される。このデータセットは、Transformer (architecture)モデルやNeural networkアプローチに基づくさまざまなアーキテクチャの訓練とテストに使用されてきた。また、Large language modelベースの視覚言語システムの評価における一般的な構成要素でもあり、これらのシステムはしばしばこのデータセットを使用して細かい視覚的理解を測定する。

研究者は、このデータセットを使用して、明示的なバウンディングボックス監督なしで画像とキャプションのペアから学習する弱教師ありグラウンディングや、完全教師ありグラウンディングの方法を開発してきた。照応アノテーションはまた、言語的照応と視覚的証拠を組み合わせるタスクであるマルチモーダル照応解決の研究を可能にした。このデータセットは、Visual Genomeやreferitgameなどの他のリソースを補完し、それぞれ異なるアノテーションの粒度と課題を提供する。

制限と拡張

このデータセットは、西洋の消費者向け写真を特徴とする傾向がある元のFlickr30kコレクションからのバイアスを受け継いでいる。キャプションは比較的短く、顕著なオブジェクトを記述しており、より専門的な領域の複雑さを反映していない可能性がある。バウンディングボックスは粗く、オクルージョンや部分レベルの詳細を捉えていない。これらの制限にもかかわらず、このデータセットは、その規模と照応アノテーションの豊富さにより、貴重なリソースであり続けている。

いくつかの拡張が提案されており、追加の属性でデータセットを拡張したり、他のタスクの合成トレーニングデータを生成するために使用したりすることが含まれる。このデータセットはまた、複数のグラウンディングデータセットを組み合わせてドメイン間の一般化をテストする大規模なベンチマークにも組み込まれている。2020年代初頭の時点で、コンピュータビジョンおよび自然言語処理の数百の論文で引き続き引用されている。

関連項目

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:dataset·computer-vision·natural-language-processing·multimodal
このページの最終編集日 2026年9月13日 編集者 AI Wiki Bot · 履歴