CIFAR-100-Cは、機械学習モデルの一般的な画像劣化に対する堅牢性を評価するために設計されたベンチマークデータセットです。これは、CIFAR-100テストセットに15種類の歪みを5段階の深刻度で適用して作成された、劣化版の画像で構成されています。このデータセットは、堅牢性研究において、モデルが予期しない入力摂動に対してどの程度うまく一般化するかを測定するために広く使用されており、標準的な精度指標を補完します。
元のCIFAR-100データセットには、100クラスにわたる60,000枚の32x32カラー画像が含まれており、50,000枚のトレーニング画像と10,000枚のテスト画像があります。CIFAR-100-Cは、10,000枚のテスト画像に各劣化タイプを各深刻度で適用し、結果として75,000枚の劣化画像(15劣化×5深刻度×10,000画像)を生成します。劣化は、ノイズ、ぼけ、天候効果、デジタルアーティファクトなどの現実世界の歪みをシミュレートします。
劣化タイプ
15の劣化タイプは、4つのカテゴリにグループ化されています:ノイズ(ガウシアン、ショット、インパルス)、ぼけ(デフォーカス、フロスト、ガラス、モーション、ズーム)、天候(雪、霜、霧、明るさ)、およびデジタル(コントラスト、弾性、ピクセル化、JPEG)。各劣化はアルゴリズム的に適用され、深刻度レベルは1(軽度)から5(重度)の範囲です。例えば、ガウシアンノイズはランダムなピクセル値を追加し、モーションブラーはカメラの動きをシミュレートします。データセットは標準化されたコードベースを使用して生成され、研究間での再現性を確保しています。
堅牢性評価における使用
CIFAR-100-Cは、ニューラルネットワークや他の機械学習モデルの堅牢性を測定するために一般的に使用されます。研究者は、すべての劣化と深刻度にわたる平均エラー率を報告し、これはしばしば平均劣化エラー(mCE)と呼ばれます。ランダムクロッピングやカラージッターなどのデータ拡張技術でトレーニングされたモデルは、通常、拡張なしでトレーニングされたモデルよりもCIFAR-100-Cで良好なパフォーマンスを示します。このベンチマークは、CIFAR-10-CやImageNet-Cと並んで、堅牢性コミュニティにおける標準的なツールとなっています。
他のベンチマークとの関係
CIFAR-100-Cは、2019年にHendrycksとDietterichによって導入された劣化ベンチマーク群の一部であり、これにはCIFAR-10-CやImageNet-Cも含まれます。これらのデータセットは同じ劣化タイプと深刻度レベルを共有しており、データセット間の比較を可能にします。このベンチマークは、敵対的堅牢性評価と併用されることが多いですが、悪意のある摂動ではなく自然な劣化に焦点を当てています。また、バッチ正規化やその他のアーキテクチャ選択が堅牢性に与える影響を研究するためにも使用されます。
制限と拡張
CIFAR-100-Cは広く使用されていますが、制限があります。劣化は合成的であり、現実世界の分布シフトを完全に捉えられない場合があります。一部の研究者は、ビデオのようなシーケンスのための時間的に相関した劣化を含むCIFAR-100-Pなどの拡張を提案しています。また、視覚タスクに適用される大規模言語モデルの堅牢性を評価するためにCIFAR-100-Cを使用する者もいますが、そのような応用はあまり一般的ではありません。このデータセットは、特に小規模モデルや迅速な実験において、堅牢性をベンチマークするための貴重なリソースであり続けています。