Open Imagesは、コンピュータビジョン研究のためにGoogleが作成した大規模データセットである。数百万枚の画像にさまざまなラベルとメタデータが注釈付けされており、機械学習モデルの訓練と評価を目的としている。このデータセットは、その規模と多様性で知られ、日常的な物体やシーンの幅広い範囲を網羅し、画像レベルのラベル、物体のバウンディングボックス、視覚的関係のトリプレットなどの注釈を含む。
Open Imagesの最初のバージョンは2016年にリリースされ、約9,000万枚の画像に約6,000カテゴリにわたる画像レベルのラベルが含まれていた。後のバージョンでは、データセットが3,000万枚以上の画像に拡張され、600以上のクラスで1,500万個以上のバウンディングボックスが物体を区切っている。注釈は、自動手法と人間による検証の組み合わせで生成され、人工知能機能を進化させるための大規模データインフラへのGoogleの投資を反映している。
データセット構造
Open Imagesは、複数のコンピュータビジョンタスクをサポートするように構成されている。中核となる構成要素は、画像コレクション、物体や概念の存在を示す画像レベルのラベル、バウンディングボックスやセグメンテーションマスクなどの局所的な注釈である。各画像について、データセットは一意の識別子、元のURL、ラベルの予測信頼度などのメタデータを提供する。バウンディングボックスの注釈は標準化された形式で提供され、画像の寸法に対する座標と、物体クラスのラベルがリストされる。
さらに、データセットには、「人が馬に乗る」や「犬がボールを追う」などの物体間の相互作用を記述する視覚的関係の注釈セットが含まれる。これらの関係は、主語-述語-目的語のトリプレットとして形式化されている。このより豊かな注釈層により、視覚認識と深層学習研究の活発な分野である、関係推論とシーン理解の研究が可能になる。
注釈方法論
Open Imagesの作成は、機械生成の候補と人間によるキュレーションを組み合わせた半自動パイプラインに依存していた。Googleの内部システムは、既存の画像分類器とウェブ規模のデータマイニングを使用して、まずノイズの多いラベル候補を生成した。これらの候補は、クラウドソーシングプラットフォームを通じて人間の注釈者に提示され、作業者はラベルを検証または修正し、バウンディングボックスを洗練させた。このハイブリッドアプローチにより、データセットは数百万枚の画像に拡張されながら、現代のニューラルネットワークの訓練に適した品質レベルを維持できた。
バウンディングボックスについては、注釈者は対象クラスの各可視インスタンスの周囲に可能な限りタイトなボックスを描くよう指示された。最終的な注釈は、画像のサブセットで複数の注釈者間の一致分析を含む一連の品質チェックを通じて検証された。その結果、このデータセットは、単一ラベルおよび複数ラベルの分類、ならびに物体検出のベンチマークとなっている。
研究への影響
Open Imagesは、学術および産業の研究グループの両方で広く使用されている。これは、2018年と2019年に開催されたKaggleでホストされたOpen Images Challengeを含む、いくつかの公開ベンチマークチャレンジの基盤となった。これらのチャレンジは数百の参加チームを集め、物体検出と視覚的関係検出の最先端を押し上げた。このデータセットは数千の研究論文で引用され、大規模なニューラルネットワーク訓練と転移学習へのアプローチに影響を与えた。
大規模で多様なラベル付きデータセットの利用可能性は、実世界の視覚概念に基づく接地を必要とする生成AIシステムの開発もサポートした。Open Imagesで事前訓練されたモデルは、画像キャプション生成、視覚的質問応答、自動運転知覚などの下流タスクに使用されている。このデータセットは、ImageNetやCOCOなどの他のリソースを補完し、より広範なクラスセットと、日常画像のより現実的な分布を提供する。
バージョンと入手可能性
Googleは、Open Imagesの複数のバージョンをクリエイティブ・コモンズライセンスの下でリリースし、研究および商用利用のために自由に利用できるようにした。2018年に導入されたバージョン4は、視覚的関係の注釈を追加し、画像数を900万枚以上、ボックスレベルの注釈を3,000万個に拡張した。2019年にリリースされたバージョン5は、バウンディングボックスクラスを600に増やし、画像のサブセットにセグメンテーションマスクを追加した。データセットはGoogleのストレージインフラを通じてアクセス可能であり、公式ウェブサイトのインタラクティブな可視化ツールでも探索できる。
すべてのファイルはCSV形式で提供され、注釈タイプごとに別々のファイルがある。このデータセットには、2017年のコンピュータビジョンとパターン認識会議で初めて発表された付随論文があり、その構築と統計が詳述されている。このプロジェクトはGoogle Researchチームによって維持されており、コミュニティのフィードバックと内部研究ニーズに基づいて更新が行われている。2025年現在、このデータセットは大規模視覚認識ベンチマークの標準的な参照点であり続けている。
制限と将来の方向性
その規模にもかかわらず、Open Imagesには固有の制限がある。画像レベルのラベルは機械生成の予測に基づいており、ノイズを含む可能性があり、クラス分布はウェブ画像に見られる一般的な物体に偏っている。注釈は主に物体の存在と粗い関係に焦点を当てており、いくつかの小規模データセットで利用可能な細かい属性や詳細なシーングラフが欠けている。研究者は、専門的なタスクに取り組む際に、Open Imagesを他のソースで補完したり、ドメイン適応技術を適用したりすることがよくある。
データセットの将来の方向性には、より広範なビデオ注釈、より豊かな関係タイプ、またはテキスト記述などのマルチモーダルデータの組み込みが含まれる可能性がある。Open Imagesの成功は、Amazon AIや他のクラウドプロバイダーからのものを含む、同様の大規模データ収集の取り組みに影響を与え、人工知能の進歩を加速するために大規模な注釈付きコーパスをアクセス可能にするという広範なトレンドを反映している。