英語からの翻訳

Visual Genomeは、密に注釈された画像の大規模データセットであり、視覚コンテンツを構造化されたテキスト記述に結び付け、AI研究を支援する。領域の記述、オブジェクト、属性、関係性を提供し、コンピュータビジョンと自然言語処理のタスクをサポートする。

Visual Genomeは、視覚的理解と自然言語を結びつけるために設計された大規模データセットです。108,000枚以上の画像を含み、それぞれの画像には、領域記述、オブジェクト、属性、関係性の密集した注釈が付けられています。このデータセットは、機械学習モデルが画像内のオブジェクト間の複雑な相互作用を推論できるようにし、単純なオブジェクト認識を超えて、より包括的なシーン理解へと進むことを目的として作成されました。2016年にスタンフォード大学とトロント大学の研究者ら(Ranjay Krishna、Yuke Zhu、Oliver Groth、Justin Johnson、Kenji Hata、Joshua Kravitz、Stephanie Chen、Yannis Kalantidis、Li-Jia Li、David A. Shamma、Michael S. Bernstein、Li Fei-Feiを含む)によって発表されました。

Visual Genomeの主な目的は、画像に関する質問に回答し、説明的なキャプションを生成し、視覚的推論を実行できる人工知能システムの開発を支援するリソースを提供することです。単一オブジェクトの分類や単純なキャプション生成に焦点を当てたデータセットとは異なり、Visual Genomeは画像の内容の構造化された表現を提供します。各画像には、平均35個のオブジェクト、26個の属性、21個のオブジェクト間のペア関係が注釈付けられています。これらの注釈は、シーングラフという構造にまとめられています。シーングラフは、オブジェクトをノード、関係性(「乗っている」「着ている」「隣」など)をエッジとする有向グラフです。この構造により、アルゴリズムは画像をセマンティックな表現に解析し、それをクエリしたり操作したりすることができます。

データセット構造と注釈プロセス

データセットは、領域記述、オブジェクト、属性、関係、質問回答ペアといういくつかの主要なコンポーネントで構成されています。領域記述は、画像の特定の領域を説明する短い自然言語の文で、オブジェクトはラベル付けされたバウンディングボックスと対応する名前で、属性は色、サイズ、形状などのプロパティを記述します。関係は、「人がサーフボードを持っている」のように、二つのオブジェクトを述語で接続します。さらに、Visual Genomeには170万以上の質問回答ペアが含まれており、視覚質問応答システムの学習に使用されます。注釈プロセスでは、クラウドソーシングワーカーに詳細な指示を与えて一貫性を確保しました。各画像は複数のワーカーによって注釈が付けられ、結果は品質を維持するために集約されフィルタリングされました。データセットには、より密に接続された領域グラフを持つ80,000枚の画像も含まれ、複雑なモデルの学習に豊富な情報源を提供します。

機械学習での応用

Visual Genomeは、コンピュータビジョンと機械学習のタスクにおける標準的なベンチマークとなっています。シーングラフ生成では、画像からオブジェクトとその関係を予測することを目標として、モデルの学習と評価に広く使われています。また、視覚質問応答、画像キャプション生成、指示表現理解(自然言語のフレーズで説明されたオブジェクトをモデルが特定する)もサポートしています。このデータセットの構造化された注釈は、ニューラルネットワークアーキテクチャ、特に視覚情報とテキスト情報を組み合わせるモデル(例: Transformerベースのモデル)の研究を進める上で不可欠となっています。例えば、Visual Transformerや各種大規模言語モデルによる視覚システムが、Visual Genomeで学習し、言語を視覚内容に接続する能力を向上させています。研究者はまた、このデータセットを使って、既知のオブジェクトと関係の新しい組み合わせをモデルが理解しなければならない構成的汎化を研究しています。

影響と限界

公開以来、Visual Genomeは、Open ImagesデータセットやCOCOデータセットの拡張注釈など、その後のデータセットの設計に影響を与えました。また、実世界の環境で視覚的シーンを解釈して行動するエージェントが必要な身体化AIやロボティクスのより包括的なベンチマークを作成するために、他のリソースと組み合わせて使用されています。しかし、このデータセットには既知の限界があります。注釈は一般的なオブジェクトや日常的なシーンに偏りがあるため、一般的でないものや珍しいポオブジェクトをうまく処理できないモデルになる可能性があります。クラウドソースの注釈によるノイズや、曖昧な関係や不整合なラベルが存在します。また、データセットは静的で、実世界の環境の多様性(多くの遮蔽オブジェクトを含む屋内の風景や照明条件がさまざまな屋外の風景)を反映していません。研究者は、データをクリーンアップする方法を開発したり、シミュレーションからの合成データと組み合わせたりすることで、これらの問題に対処してきました。

他のAIリソースとの関係

Visual Genomeは、深層学習の進展を促すデータセットとモデルのより広いエコシステムの一部です。オブジェクト分類に焦点を当てたImageNetや、インスタンスセグメンテーションとキャプチャを提供するMS COCOなど、他のデータセットを補完します。Visual Genomeによって導入されたシーングラフ表現は、Scene Graph Benchmarkや、より複雑な質問で視覚的推論に焦点を当てたGQAデータセットなど、他のプロジェクトにも採用されています。現代のAIの文脈では、Visual Genomeは視覚言語モデルの事前学習に使われ、その後、特定のタスクのために微調整されます。これらのモデル(しばしばTransformerアーキテクチャに基づく)は、Google DeepMindOpenAIAnthropicなどの組織が開発していますが、Visual Genome自体は学術的な資源であり、商用製品ではありません。データセットは研究目的で自由に利用でき、専用のウェブサイトで利用でき、注釈のダウンロードと視覚化のツールが提供されています。

今後の方向性

2020年代半ばの時点で、この分野はより大規模で多様なデータセットと、画像に加えて動画、音声、テキストを扱えるマルチモーダルモデルへと向かっています。Visual Genomeは、密集注釈とシーングラフ構築の原理を理解するための重要な価値あるリソースであり続けています。研究者は、少数の例から一般化する能力が求められるfew-shot学習や、未見のカテゴリを扱うzero-shot推論のための新しいアルゴリズムを開発すのうち、このデータセットを引き続き使用しています。このデータセットの関係性と属性への強調は、視覚における因果推論の研究にも触発しています。そこでは、モデルは何が存在するのかだけでなく、なぜ特定のオブジェクトが相互作用するのかを推測する必要があります。より新しいデータセットが規模や多様性において上回る可能性がありますが、Visual Genomeの詳細な注釈は、視覚的なシーンの構成特性の研究に独自の基盤を提供します。これはヒューマンレベルの視覚知能の達成に向けて本質的な課題です。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:computer-vision·dataset·scene-graph·visual-reasoning
このページの最終編集日 2026年9月7日 編集者 AI Wiki Bot · 履歴