ObjectNetは、実世界の分布シフト下での物体認識モデルの頑健性を評価するために2019年に導入されたベンチマークデータセットである。ImageNetのような標準的なデータセットは、しばしば標準的な視点とクリーンな背景を持つ画像を含むのに対し、ObjectNetは、日常的な環境で、異常な角度から、雑然とした背景で、回転した向きで撮影された物体の画像を意図的に含む。このデータセットは、313の物体カテゴリにわたる50,000枚の画像で構成され、それぞれが従来のデータセットで訓練されたモデルに挑戦するために特別に収集された。その主な目的は、モデルが訓練分布の統計的規則性を超えてどの程度一般化できるかを測定することであり、これはArtificial intelligenceシステムを制御されていない環境に展開するための重要な特性である。
ObjectNetの作成は、多くの最先端のDeep learningモデルが標準的なベンチマークで高い精度を達成する一方で、一見些細な点で異なる画像でテストされると劇的に失敗するという観察によって動機付けられた。このデータセットは、MITコンピュータ科学・人工知能研究所(CSAIL)のAndrei Barbuが率いるチームによって設計され、他の機関の共同研究者も参加した。画像はクラウドソーシングで収集され、物体クラス、視点、背景、回転に関する厳格な基準を満たすようにフィルタリングされた。各画像には、物体の回転、シーンの背景、カメラの視点を記述するメタデータが注釈付けられ、研究者が失敗モードを詳細に分析できるようにした。
設計と収集
ObjectNetの構築には、大規模なクラウドソーシングの取り組みが関与した。作業者は、各物体の角度、背景、回転を変えるという特定の指示に従って、自宅や他の自然な環境で物体を撮影するよう求められた。このプロセスにより、典型的な訓練セットに対して真に分布外である画像が生成された。なぜなら、それらは実世界のシーンの自然な変動を捉えているからである。データセットには313のカテゴリが含まれ、その多くはImageNetのクラスと重複するが、画像自体は完全に新しく、既存のデータセットから取得されたものではない。各画像のメタデータには、回転(画像平面内での物体の向き)、背景(キッチン、バスルーム、オフィスなどのシーンの種類)、視点(物体に対するカメラの角度)という3つの主要な属性が含まれる。この構造化された注釈により、異なるタイプの分布シフトにわたるモデルパフォーマンスの細かい評価が可能になる。
モデル評価への影響
ObjectNetがリリースされたとき、それは最先端モデルの重大な脆弱性を露呈させた。例えば、ImageNetで人間に近いパフォーマンスを達成したモデルは、ObjectNetでは精度が40パーセントポイント以上低下する可能性があった。この stark な対比は、多くのモデルが堅牢な視覚的特徴を学習するのではなく、背景の手がかりや典型的な物体のポーズなどのスプリアス相関に依存していることを浮き彫りにした。このデータセットは、ImageNet-CやImageNet-Aのような他の分布外データセットと並んで、頑健性研究の標準的なベンチマークとして急速に確立された。研究者は、データ拡張、ドメイン適応、アーキテクチャ変更などの技術を評価するためにObjectNetを使用し、モデルの一般化の改善につながった。このデータセットはまた、物体認識における形状、テクスチャ、文脈の役割を理解することへの関心を刺激し、モデルが形状よりもテクスチャを優先することが多いことを示す研究があり、ObjectNetの多様な条件がこのバイアスを露呈させるのに役立つ。
他のベンチマークとの関係
ObjectNetは、コンピュータビジョンのベンチマークの中で独自のニッチを占めている。既存の画像に人工的なノイズやぼかしを適用する合成劣化ベンチマークとは異なり、ObjectNetは完全に自然な写真で構成されており、実世界のパフォーマンスのより現実的なテストとなる。これは、検出とセグメンテーションに焦点を当てたCOCOやPascal VOCのようなベンチマークを補完し、分類のための制御された自然主義的な設定を提供する。回転と視点への強調は、3D物体理解とNeural network解釈可能性の研究にも関連している。データセットはImageNetと比較して比較的小さいため、訓練セットではなくテストセットとして使用されることが多いが、一部の研究では、頑健性を向上させるためにその一部で微調整することを探求している。
制限と批判
その貢献にもかかわらず、ObjectNetには制限がある。データセットの313のカテゴリは、より広い物体分類法のサブセットであり、いくつかの一般的なクラスが欠落している。画像のクラウドソーシングの性質は、背景と視点の分布がすべての実世界のシナリオを完全に表していない可能性があり、注釈プロセスには固有のノイズがある。さらに、ObjectNetは家庭環境で収集されたため、産業、屋外、極端な設定を過小評価する可能性がある。一部の研究者は、データセットの難しさは、より大きく多様なデータセットでの訓練によって部分的に緩和できると指摘しており、モデルが改善するにつれてObjectNetと標準ベンチマークの間のギャップが狭まっていることを示唆している。それでも、ObjectNetはモデルをストレステストし、ベンチマークパフォーマンスと実世界の信頼性の間のギャップを理解するための貴重なツールであり続けている。
遺産と継続的な使用
ObjectNetは、堅牢なビジョンシステムを構築するための継続的な取り組みにおける参照点となっている。これは、ドメイン一般化、敵対的頑健性、自己教師あり学習に関する論文で頻繁に引用されている。データセットのメタデータは、回転や背景などの特定の要因がモデルパフォーマンスに与える影響に関する研究も可能にし、より弾力性のあるアーキテクチャの設計に情報を提供する洞察を提供している。2020年代半ばの時点で、ObjectNetは学術研究やコンピュータビジョン製品を開発する業界チーム、特に新しい視点や雑然としたシーンに遭遇することが一般的な自動運転、ロボティクス、拡張現実などの分野で引き続き使用されている。その作成は、訓練分布を超えてモデルを評価することの重要性を浮き彫りにし、Machine learningコミュニティにおける頑健性と分布外一般化を第一級の関心事とする広範なシフトに貢献した。