ImageNet Large Scale Visual Recognition Challenge(ILSVRC)は、ImageNetプロジェクトの一環として2010年から2017年まで開催された年次のソフトウェア競技会でした。この競技会は、厳選された1,000の重複しないオブジェクトクラス内で、オブジェクトとシーンを正確に分類および検出するアルゴリズムに課題を与えました。このチャレンジは、特に2012年に畳み込みニューラルネットワークが精度を劇的に向上させた後、コンピュータビジョンにおける深層学習革命を促進したと広く評価されています。
この競技会は、視覚オブジェクト認識研究用に設計された大規模な視覚データベースであるImageNetプロジェクトから発展しました。AI研究者のFei-Fei Liによって開始されたImageNetには、20,000以上のカテゴリにわたる1,400万以上の手動注釈付き画像が含まれ、少なくとも100万の画像にはバウンディングボックス注釈も提供されています。ILSVRCは、これらの画像とカテゴリのサブセットを使用して、コンピュータビジョンアルゴリズムを評価および比較するための標準化されたベンチマークを提供しました。
歴史
Fei-Fei Liは2006年にImageNetの構想を開始し、ほとんどの研究がモデルとアルゴリズムに焦点を当てていた時代に、AIアルゴリズムのトレーニングに利用可能なデータを拡大することを目指しました。2007年には、WordNetの作成者であるプリンストン大学教授のChristiane Fellbaumと出会い、WordNetの約22,000の名詞に基づいてImageNetを構築することにつながりました。Liはまた、平均的な人間が約30,000種類のオブジェクトを認識するという1987年の推定にも触発されました。
プリンストン大学の助教授として、Liはチームを編成し、画像分類にAmazon Mechanical Turkを使用しました。ラベリングは2008年7月から2010年4月まで行われ、167か国からの49,000人のワーカーが1億6,000万以上の候補画像をフィルタリングおよびラベリングしました。1,400万の画像のそれぞれは3回ラベリングされました。当初の計画では、40,000カテゴリにわたって各カテゴリあたり10,000画像を目指していましたが、これは実用的ではないことが判明しました。人間は1秒あたり最大2画像しか分類できず、推定19人年の労力が必要でした。
このデータベースは、2009年にフロリダで開催されたコンピュータビジョンおよびパターン認識会議(CVPR)で「ImageNet: A Preview of a Large-scale Hierarchical Dataset」というタイトルのポスターとして初めて発表されました。2009年には、Alex Bergがオブジェクトローカリゼーションをタスクとして追加することを提案し、PASCAL Visual Object Classesコンテストとのコラボレーションにつながりました。最初のILSVRCは2010年に開催され、1,000クラスとオブジェクトローカリゼーションを特徴とし、PASCAL VOCの20クラスと19,737画像と比較されました。
深層学習への重要性
2012年9月30日、AlexNetと呼ばれる畳み込みニューラルネットワーク(CNN)がImageNet 2012チャレンジでトップ5エラー15.3%を達成し、2位よりも10.8パーセントポイント以上低い結果を出しました。この成功は、トレーニング中にグラフィックスプロセッシングユニット(GPU)を使用することで実現可能になり、これは深層学習革命の重要な要素でした。The Economistによると、「突然、人々はAIコミュニティだけでなく、テクノロジー業界全体で注目し始めました」。
2015年には、AlexNetはマイクロソフトの100層以上の非常に深いCNNによって上回られ、テストセットで3.57%のエラーでImageNet 2015コンテストに勝利しました。Andrej Karpathyは2014年に、集中して取り組めば5.1%のエラー率に到達できると推定し、彼の研究室の約10人が少ない労力で約12〜13%に到達しました。最大限の努力で、人間は2.4%のエラーを達成できると推定されました。
このチャレンジの影響はコンピュータビジョンを超えて広がり、ニューラルネットワークアーキテクチャ、トレーニング技術、ハードウェアアクセラレーションの革新を促進しました。また、機械学習フレームワークの開発や、人工知能のより広い分野にも影響を与えました。
データセット
ImageNetはその注釈プロセスをクラウドソーシングしています。画像レベルの注釈は、画像内のオブジェクトクラスの存在または非存在を示し、オブジェクトレベルの注釈は、オブジェクトの可視部分の周囲にバウンディングボックスを提供します。ImageNetは、オブジェクトを分類するためにWordNetスキーマの変種を使用し、細かい分類のために120カテゴリの犬種が追加されています。
2012年には、ImageNetはMechanical Turkの世界最大の学術ユーザーであり、平均的なワーカーは1分あたり50画像を識別しました。完全なImageNetの当初の計画では、約50,000のsynsetにわたって約5,000万のクリーンで多様なフル解像度の画像が含まれる予定でしたが、これは達成されませんでした。
2010年4月30日時点での要約統計は以下の通りです:
- 非空のsynsetの総数:21,841
- 画像の総数:14,197,122
- バウンディングボックス注釈付きの画像数:1,034,908
- SIFT特徴を持つsynsetの数:1,000
- SIFT特徴を持つ画像の数:120万
カテゴリ
ImageNetのカテゴリはWordNetの概念からフィルタリングされました。複数の同義語(例:「kitty」と「young cat」)を含むことができる各概念は、「シノニムセット」または「synset」と呼ばれます。WordNet 3.0には100,000以上のsynsetが含まれ、そのほとんどは名詞(80,000以上)です。ImageNetはこれらを、視覚的に説明できる可算名詞である21,841のsynsetにフィルタリングしました。
WordNet 3.0の各synsetには「WordNet ID」(wnid)があり、品詞とオフセットの連結です。ImageNetは名詞のみを含むため、すべてのwnidは「n」で始まります。例えば、synset「dog, domestic dog, Canis familiaris」のwnidは「n02084071」です。カテゴリはレベル1(「哺乳類」など)からレベル9(「ジャーマンシェパード」など)までの9つのレベルに分類されます。
画像形式
画像は、複数の言語の同義語を使用して、オンライン画像検索エンジン(Google、Picsearch、MSN、Yahoo、Flickrなど)からスクレイピングされました。例えば、ジャーマンシェパードの場合、「German police dog」、「Alsatian」、「ovejero alemán」、「pastore tedesco」、「德国牧羊犬」などの用語を使用しました。
ImageNetは、さまざまな解像度のRGB形式の画像で構成されています。例えば、ImageNet 2012の「魚」カテゴリでは、解像度は4288 x 2848から75 x 56までさまざまです。機械学習では、これらは通常、標準の一定解像度に前処理され、ニューラルネットワークによるさらなる処理の前にホワイトニングされます。例えば、PyTorchでは、ImageNet画像はピクセル値を0から1の間に分割し、[0.485, 0.456, 0.406]を減算し、[0.229, 0.224, 0.225]で除算することで正規化されます。これらはImageNetの平均と標準偏差です。
ラベルと注釈
各画像には正確に1つのwnidがラベル付けされています。ImageNet-1KのDense SIFT特徴(生のSIFT記述子、量子化されたコードワード、座標)は、視覚的単語のバッグ用に設計されており、ダウンロード可能でした。オブジェクトのバウンディングボックスは、約3,000の人気のあるsynsetで利用可能であり、synsetあたり平均150画像でした。さらに、一部の画像には属性注釈がありますが、チャレンジは主に分類およびローカリゼーションタスクに焦点を当てていました。
ILSVRCは2017年に終了しましたが、その遺産はImageNetデータセットの形で存続しており、コンピュータビジョンモデルを評価するための標準ベンチマークとして残っています。この競技会の大規模で現実世界のデータと厳格な評価への重点は、分野の急速な進歩を促進し、生成AIや機械学習の他の分野におけるその後の発展に影響を与えました。