Cats vs. Dogsは、2013年にKaggleコンペティションのために導入されたよく知られたデータセットである。このデータセットは25,000枚のカラー画像で構成され、猫の写真12,500枚と犬の写真12,500枚に均等に分かれている。画像はさまざまなインターネット写真コレクションから取得され、解像度やアスペクト比は多様である。主なタスクは二値画像分類であり、与えられた画像に猫が含まれるか犬が含まれるかを判定することである。
このデータセットはすぐにMachine learningコミュニティにおける標準的なベンチマークとなり、特にDeep learningやNeural networkアーキテクチャに関するコースやチュートリアルで広く使用された。その適度なサイズと単純な二値ラベル付けは、データ前処理、Data Augmentation、転移学習、モデル評価といった基本的な概念を示すのに理想的である。畳み込みニューラルネットワーク(CNN)の構築を学ぶ実践者にとって、最初に扱う実世界データセットの一つとなることが多い。
コンペティションと歴史
Cats vs. Dogsコンペティションは2013年にKaggleで開催され、参加者が画像を自動分類するアルゴリズムを開発することを目的としていた。このコンペティションには数百のチームが参加し、画像認識タスクへの深層学習の利用を普及させる一因となった。当時、多くの優勝ソリューションは手作りの特徴量と伝統的な分類器を用いていたが、このデータセットは後にこの分野を支配することになる畳み込みニューラルネットワークの初期の試験場としても機能した。
コンペティション終了後も、このデータセットはKaggleで公開され続け、数え切れないほどの研究論文、大学のコース、オンラインチュートリアルでダウンロードされ使用されてきた。その長寿は、その単純さと、TensorFlowやPyTorchなどの一般的なライブラリを使用して簡単に読み込み・処理できることに一部起因している。
データセットの特徴
Cats vs. Dogsデータセットの各画像はJPEGファイルであり、ファイル名には「cat.0.jpg」や「dog.0.jpg」のようにラベルが示されている。画像のサイズはさまざまで、各辺が数百ピクセルから千ピクセルを超える範囲である。このばらつきは、ニューラルネットワークに入力する前にリサイズや正規化といった前処理ステップを必要とする。
データセットはバランスが取れており、各クラスに正確に12,500枚の画像があるため、評価指標が簡素化される。しかし、課題がないわけではない。一部の画像には複数の動物が含まれたり、遮蔽があったり、異常な姿勢があったりし、分類器を混乱させる可能性がある。さらに、画像は完全にキュレーションされているわけではないため、まれに誤ラベルの例もあるが、これらは稀である。
深層学習教育での利用
Cats vs. Dogsは、入門的な深層学習コースで教育ツールとして頻繁に使用される。単一のGPUで妥当な時間内にトレーニングできるほど小さい一方で、Batch Normalization、Dropout、Learning Rate Schedulingといった技術の利点を示すには十分な大きさである。多くのチュートリアルでは、ゼロから単純なCNNを構築する方法や、Residual Network (ResNet)アーキテクチャなどの事前学習モデルを用いた転移学習の使用方法を説明するためにこれを使用している。
このデータセットはまた、Data Augmentationの演習にも適しており、回転、反転、ズームなどの変換を適用してトレーニングセットの実効サイズを増やし、汎化を向上させる。画像が実世界の写真であるため、合成データセットよりも現実的な課題を提供し、学生が堅牢な前処理とモデルチューニングの重要性を理解するのに役立つ。
影響と遺産
教育以外にも、Cats vs. Dogsは新しいアルゴリズムのベンチマークや、さまざまな条件下での分類器の挙動の研究に使用されてきた。また、追加クラスやより困難なバリエーションを含む派生データセットにも影響を与えた。このデータセットの人気は、画像分類をArtificial intelligenceの進歩の標準的なテストベッドとして使用する広範な傾向に貢献した。
ImageNetのようなより大規模で複雑なデータセットが最先端の研究の標準となっている現在でも、Cats vs. Dogsは迅速な実験やコンピュータビジョンの基礎を教えるための貴重なリソースであり続けている。そのアクセシビリティと明確なラベル付けにより、今後も長年にわたって機械学習コミュニティの定番であり続けるだろう。