Oxford-IIIT Petデータセットは、コンピュータビジョンにおける細粒度画像分類とセマンティックセグメンテーションのための広く使用されるベンチマークである。2012年にオックスフォード大学とインド情報技術大学ハイデラバード校(IIIT-H)の研究者によって公開され、37種類の猫と犬の品種からなる7,349枚の画像で構成されている。各画像には、種ラベル、品種ラベル、ピクセルレベルのトリマップセグメンテーションマスク、およびおおよその頭部バウンディングボックスが注釈付けされている。このデータセットは、視覚的に類似した品種の分類と、雑然とした背景からの動物のセグメンテーションに関する研究を促進するために設計された。
このデータセットは、変形可能部品モデルとセマンティックセグメンテーションアプローチを組み合わせたモデルを提案する論文とともに紹介された。元の出版物では、空間ピラミッドマッチングを用いたbag-of-wordsモデルによる分類精度59.2%、提案手法による平均交差オーバーユニオン(IoU)49.8%のセグメンテーション精度が報告された。これらの数値は現代のDeep learningモデルによってはるかに上回られているが、データセットは新しいアーキテクチャを評価するための標準として残っている。
データセット構造
画像は12種類の猫の品種と25種類の犬の品種に分けられ、各クラスあたり約200枚の画像がある。品種には、アビシニアン猫、ベンガル猫、ブリティッシュショートヘアなどの一般的なペットや、ビーグル、ジャーマンシェパード、パグなどの犬が含まれる。データセットはトレーニングセットとテストセットに分割され、分割は元のリリースで提供されている。トレーニングセットには3,680枚の画像が含まれ、テストセットには3,669枚の画像が含まれる。セグメンテーションマスクはトリマップであり、各ピクセルは前景、背景、または不確かな境界領域としてラベル付けされる。
研究への影響
Oxford-IIIT Petデータセットは、特にセマンティックセグメンテーションのためのU-Netやその他のニューラルネットワークアーキテクチャの評価において、数百の研究で使用されてきた。これはしばしばPASCAL VOCデータセットと組み合わせて転移学習ベンチマークに使用される。データセットの適度なサイズは、ImageNetのような大規模なデータセットとは異なり、ゼロからモデルを訓練するのに適している。また、Data Augmentation技術の研究にも使用されており、クラスあたりの画像数が限られているため、一般化を向上させるための拡張が奨励される。
一般的な評価プロトコル
分類の標準評価は平均クラス別精度を使用し、セグメンテーションは全クラスにわたる平均IoUで測定される。研究者は通常、画像を224x224ピクセルなどの固定解像度にリサイズし、トレーニング中にランダムなフリップとクロップを適用する。多くの公開結果では、現代の残差ネットワークとEncoder-Decoder Architectureモデルを使用して、分類精度95%以上、セグメンテーションIoU90%以上を報告している。データセットの公式ウェブサイトは元の注釈と公開結果のリストを提供しているが、2010年代半ば以降更新されていない。
制限と代替案
データセットには既知の制限があり、クラスあたりの画像数が比較的少ないことや、手入れの行き届いたスタジオ風の写真への偏りが含まれる。品種はすべて純血種であり、雑種ペットの多様性を反映していない。より困難なタスクのために、研究者はStanford DogsやiNaturalistチャレンジなどの大規模なデータセットに目を向けている。しかし、Oxford-IIIT Petデータセットは、そのコンパクトなサイズとクリーンな注釈により、セグメンテーションモデルのプロトタイピングのための便利な出発点として残っている。
遺産
データセットは、Omkar M. Parkhi、Andrea Vedaldi、Andrew Zisserman、およびC. V. Jawaharによって作成された。2012年に英国機械視覚会議(BMVC)で発表された付随論文は、何千回も引用されている。これは細粒度認識手法の開発に貢献し、弱教師付きセグメンテーションのためのトリマップマスクの使用を普及させるのに役立った。データセットは学術利用のために自由に利用可能であり、オックスフォード大学のVisual Geometry Groupウェブサイトでホストされている。