Oxford Flowersは、オックスフォード大学のVisual Geometry Groupで開発された、細粒度の視覚分類のためのベンチマーク画像データセットである。このデータセットには、英国で一般的に見られる102種類の花のカテゴリの8,189枚の画像が含まれている。各カテゴリは40〜258枚の画像で構成され、画像はスケール、ポーズ、照明条件が異なる。このデータセットは2008年にMaria-Elena NilsbackとAndrew Zissermanによって導入され、彼らはより小規模な前身として、17カテゴリのOxford Flower Datasetも提供した。
Oxford Flowersの主な目的は、細粒度の画像分類の研究を支援することであり、その目標は、単一の基本レベルカテゴリ内の視覚的に類似したサブカテゴリを区別することである。ImageNetなどの一般的な物体認識データセットとは異なり、Oxford Flowersは色、形状、テクスチャの微妙な違いに焦点を当てている。このデータセットには、各花のピクセルレベルのセグメンテーションマスクが含まれており、分類とセグメンテーションの両方のタスクの研究を可能にしている。画像はさまざまな写真サイトから取得されており、制御された条件下で撮影されたものではないため、現実味と難しさが加わっている。
データセット構造
データセットは、トレーニング、検証、テストの3つの事前定義されたパーティションに分割されている。トレーニングセットには1,020枚の画像(クラスあたり10枚)、検証セットには1,020枚の画像(クラスあたり10枚)、テストセットには6,149枚の画像(残り)が含まれる。この固定分割は、異なるモデル間の公平な比較のために一般的に使用される。各画像には1から102までのラベルが関連付けられており、セグメンテーションマスクはバイナリ画像として提供される。データセットには、ラベルのセットとクラス名をリストしたテキストファイルも含まれており、クラス名はブルーベル、カウスリップ、スノードロップなどの一般的な英国の野生の花に対応している。
研究への影響
Oxford Flowersは、リリース以来、コンピュータビジョンの標準的なベンチマークとなっている。これは、色ヒストグラムや形状記述子などの手作り特徴を用いた手法から、現代の機械学習モデルまで、幅広いアプローチの評価に使用されてきた。特に、パーツベースのモデルやアテンションメカニズムを含む細粒度認識技術の開発において重要な役割を果たしてきた。このデータセットは、データ拡張、転移学習、少数ショット学習の研究にも使用されており、クラスあたりのトレーニング例が限られていることが一般化の課題となっている。
注目すべき手法と結果
Oxford Flowersに関する初期の研究では、手作り特徴を用いたサポートベクターマシンを使用して、約60〜70%の分類精度を達成した。畳み込みニューラルネットワーク(CNN)の導入により、性能は大幅に向上した。例えば、微調整されたResNetモデルは、テストセットで95%以上の精度を達成できる。このデータセットは、アテンションメカニズムやトランスフォーマーベースのアーキテクチャのベンチマークにも使用されており、最先端のモデルはほぼ完璧な精度に達している。しかし、現代の基準と比較してデータセットのサイズが小さいため、主要なベンチマークではなく二次的なベンチマークとして使用されることが多く、研究者はCIFAR-100やImageNetなどのより大規模なデータセットと並行して結果を報告している。
拡張とバリエーション
元の102カテゴリのデータセットは、いくつかの拡張に影響を与えた。Oxford Flower Dataset(17カテゴリ)は、迅速なプロトタイピングに使用される小規模なバージョンである。さらに、このデータセットは、複数の多様なデータセットにわたってモデルを評価するVisual Decathlonチャレンジなどの大規模なベンチマークに組み込まれている。一部の研究者は、トレーニングセットの実効サイズを増やすために、合成バリアントを作成したり、データ拡張技術を適用したりしている。セグメンテーションマスクは、条件付き画像合成などの画像セグメンテーションや生成モデルの研究に使用されている。
制限事項
その人気にもかかわらず、Oxford Flowersには制限がある。画像は比較的低解像度(最大寸法が約500ピクセル)であり、現実世界の高解像度シナリオを反映していない可能性がある。データセットは英国の植物に偏っており、他の地理的領域への適用可能性が制限されている。さらに、固定されたトレイン/検証/テスト分割は便利である一方、検証セットでモデルを繰り返し調整すると過学習につながる可能性がある。2020年代半ばの時点で、このデータセットは現代の大規模ベンチマークと比較して比較的小さいと考えられており、その役割は主要な課題から、細粒度分類アルゴリズムの健全性チェックへと移行している。
関連項目
- コンピュータビジョン
- 画像分類
- 細粒度認識
- Visual Geometry Group