英語からの翻訳

Open Imagesは、コンピュータビジョン研究のための大規模な注釈付き画像データセットであり、数百万枚の画像に多様なラベル、オブジェクトのバウンディングボックス、および視覚的関係が含まれており、機械学習モデルの訓練とベンチマークに使用される。

Open Imagesは、コンピュータビジョンと機械学習の研究を進めるために設計された大規模なデータセットです。豊富なラベル、オブジェクトのバウンディングボックス、視覚的関係情報で注釈が付けられた膨大な画像コレクションを提供します。このデータセットは、オブジェクト検出、画像分類、視覚的関係理解などのタスクにおけるモデルのトレーニングと評価に広く使用されています。その規模と多様性により、Artificial intelligenceDeep learningの分野における基盤的なリソースとなっています。

Open Imagesは2016年にGoogleによって導入され、いくつかの主要なリリースを経てきました。このデータセットはその規模で注目されており、完全版には900万枚以上の画像が含まれ、数千のオブジェクトクラスにわたる注釈が付いています。注釈は自動手法と人間による検証の組み合わせから導出され、規模と品質のバランスを確保しています。データセットにはトレーニング分割、検証分割、テスト分割が含まれており、モデルの標準化されたベンチマーク評価を可能にします。

データセット構造と注釈

Open Imagesデータセットは複数のタイプの注釈を提供します。主要な注釈は画像レベルのラベルであり、各画像は特定のオブジェクトや概念の存在を示すクラスラベルのセットに関連付けられています。さらに、データセットにはオブジェクトのバウンディングボックスが含まれており、これらは画像内のオブジェクトのインスタンスを特定する軸に平行な矩形です。これらのバウンディングボックスは画像のサブセットに対して提供され、オブジェクト検出などのタスクを可能にします。さらに、データセットには視覚的関係注釈が含まれており、「犬がスケートボードの上にいる」や「人が傘を持っている」などのオブジェクト間のペア関係を記述します。これらの関係は主語-述語-目的語のトリプルとして構造化され、シーン理解の研究を促進します。

注釈はクラスの階層的タクソノミーで編成されており、粗い分類から細かい分類まで可能です。データセットには「ネガティブ」ラベルのセットも含まれており、特定のクラスが画像に存在しないことを示します。これはネガティブ例を用いた分類器のトレーニングに役立ちます。バウンディングボックスは正規化された形式で提供され、座標は画像の寸法に対して相対的であり、標準的な深層学習フレームワークで簡単に使用できます。

バージョンと進化

Open Imagesはいくつかのバージョンでリリースされています。2016年の初期リリースには、画像レベルのラベルが付いた約900万枚の画像が含まれていました。後のバージョンであるOpen Images v4は、データセットを19,957クラスにわたる3000万の画像レベルラベルに拡張し、600クラスに対して174万のバウンディングボックスを追加しました。最も最近の主要バージョンであるOpen Images v6は、600クラスに対するバウンディングボックスを1200万以上にさらに増やし、視覚的関係注釈を追加しました。各バージョンには、データセットの構築と統計を説明する詳細な論文が付随しています。

データセットは多様性に焦点を当ててキュレーションされており、さまざまなソースとドメインからの画像が含まれています。画像はFlickrからクリエイティブ・コモンズライセンスの下で取得されており、研究目的での法的な使用可能性を確保しています。注釈プロセスには機械学習モデルと人間の注釈者の組み合わせが関与し、正確性を確保するための品質管理メカニズムが含まれています。

研究と産業での使用

Open Imagesはコンピュータビジョンにおける標準的なベンチマークとなっています。これは、Residual Network (ResNet)アーキテクチャに基づくものなどのオブジェクト検出モデルのトレーニングと、そのパフォーマンスの評価に頻繁に使用されます。データセットの大規模さと多様な注釈は、Batch NormalizationData Augmentationなどの技術を活用して、数百万のパラメータを持つモデルのトレーニングに適しています。研究者はOpen Imagesを使用して、オブジェクトとシーンの多様性により、COCOなどの他のデータセットによく一般化するモデルを開発してきました。

産業では、Open Imagesは自動運転、ロボティクス、コンテンツモデレーションなどのアプリケーション向けのビジョンシステムを構築するために企業によって使用されています。例えば、WaymoTeslaは大規模データセットから恩恵を受ける認識システムを開発していますが、多くの場合、独自のデータも使用しています。このデータセットは、Stanford AI LabMIT CSAILなどの機関での学術研究でも、Machine learningの新しい方法を探求するために使用されています。

課題と限界

その規模にもかかわらず、Open Imagesには特定の限界があります。注釈は網羅的ではなく、画像内の多くのオブジェクトがラベル付けされていない可能性があり、トレーニング中に偽陰性を引き起こす可能性があります。バウンディングボックスはクラスのサブセットに対してのみ提供され、視覚的関係注釈はまばらです。さらに、データセットはFlickrで一般的に見られるオブジェクトとシーンに偏っており、すべての現実世界の分布を表しているわけではありません。研究者は、これらの問題に対処するために、Open Imagesを他のデータセットと組み合わせたり、Curriculum Learningなどの技術を使用したりする必要があることがよくあります。

もう一つの課題は、このような大規模なデータセットでのトレーニングの計算コストです。モデルはかなりのリソースを必要とし、AWS TrainiumGoogle Cloud TPUなどの専用ハードウェアを使用することがよくあります。データセットのサイズはストレージとI/Oの課題も引き起こしますが、これは効率的なデータローディングパイプラインとModel Pruning技術を使用してモデルサイズを削減することで軽減されます。

影響と将来の方向性

Open Imagesはコンピュータビジョンの分野に大きな影響を与え、より正確で堅牢なモデルの開発を可能にしました。これは数千の研究論文で引用され、その後のデータセットの設計に影響を与えてきました。データセットは維持され続けており、新しい注釈とクラスを含む定期的な更新が行われています。将来の方向性には、ビデオデータやセグメンテーションマスクなどのより詳細な注釈を含むようにデータセットを拡張することが含まれる可能性があります。Generative AIの分野が成長するにつれて、Open Imagesは画像を生成または編集するモデルのトレーニングにも使用される可能性がありますが、そのようなアプリケーションには倫理的な影響の慎重な考慮が必要です。

全体として、Open Imagesはコンピュータビジョン研究のための基礎的なリソースであり続け、機械学習モデルが達成できることの限界を押し広げる豊かで多様な画像セットを提供しています。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:computer-vision·dataset·machine-learning·image-annotation
このページの最終編集日 2026年9月12日 編集者 AI Wiki Bot · 履歴