ImageNetは、WordNetの名詞階層に従って整理されたラベル付き画像の大規模データセットであり、また、それを基に開催される毎年恒例のImageNet Large Scale Visual Recognition Challenge(ILSVRC)の通称でもある。2006年からフェイフェイ・リーとプリンストン大学およびスタンフォード大学の同僚らによって作成され、2009年に初めて発表されたこのデータセットは、最終的に2万以上のカテゴリにわたる約1400万枚の画像にまで成長し、コンペティションで使用されるILSVRCサブセットは1000の物体クラスをカバーした。ImageNetは、深層学習手法をコンピュータビジョンで実用化するために必要なデータ規模を提供したと広く評価されており、その2012年のコンペティションは、この分野の現代的な復興を引き起こした瞬間として頻繁に引用されている。
歴史
フェイフェイ・リーは、視覚認識の進歩がアルゴリズムよりも、十分に大規模で多様かつ適切にラベル付けされたデータセットの欠如によって制限されているという確信から、ImageNetプロジェクトを開始した。WordNetの語彙データベースを基に、チームはすべての名詞シノセットの画像を収集することを目指し、ウェブ画像検索で候補を集め、Amazon Mechanical Turkを通じたクラウドソーシングでラベルを検証した。完全なデータセットは2009年のIEEEコンピュータビジョン・パターン認識会議で発表され、翌年にはILSVRCコンペティションが開始され、研究チームが約120万枚のトレーニング画像からなる保持されたサブセット上で分類および検出タスクを競い合った。
2012年のブレークスルー
2012年のILSVRCは、このデータセットで最もよく知られた瞬間である。アレックス・クリジェフスキー、イリヤ・サツケバー、ジェフリー・ヒントンによって提出され、後にAlexNetと名付けられた畳み込みニューラルネットワークは、コンペティションのトップ5エラー率を約26パーセントから約15パーセントに削減し、これはそれまでの年次改善をはるかに上回る差であった。この結果は、GPUハードウェアを使用してImageNetのラベル付きデータ規模で深層ネットワークをトレーニングすることに依存しており、詳細はILSVRC 2012イベントの記事で説明されている。この勝利は、手設計の特徴量や他の機械学習手法を好んでいたコンピュータビジョンコミュニティの多くに、大規模なラベル付きデータセットでトレーニングされた深層ニューラルネットワークが従来のアプローチを大幅に上回る性能を発揮できることを確信させた。
遺産と影響
2012年以降、ILSVRCの優勝者はほぼ毎年深層ネットワークであり、VGG、GoogLeNet、ResNetなどのアーキテクチャが、2015年までにトップ5エラー率を5パーセント未満にまで段階的に引き下げ、これは同じタスクにおける人間のアノテーターに通常帰属されるエラー率を下回るものであった。ImageNetの事前トレーニングも標準的な技術となり、ImageNetで分類用にトレーニングされたモデルは、他の視覚タスクのための特徴抽出器や微調整の出発点として再利用され、これは転移学習の初期の大規模な例となった。このデータセットの共通のベンチマークとしての役割は、一貫した条件下でアーキテクチャを比較することを可能にし、その慣行は後の言語および推論モデルのベンチマークにも受け継がれた。コンペティション自体は2017年まで開催され、その後、主催者はエラー率がアノテーション自体のノイズの実用的な限界に近く飽和したと判断した。
批判
ImageNetはまた、大規模なウェブスクレイピングによるトレーニングデータに固有の問題の例としても scrutinized されている。研究者らは、完全な1400万枚の画像セット内の一部の非物体カテゴリ、特にWordNetから継承された「人物」ブランチに、攻撃的または不適切なラベルが含まれていることを発見し、ImageNetチームは2019年にそのブランチの大部分を削除またはぼかすことを余儀なくされた。この出来事は、アルゴリズムバイアスと、インターネット規模のデータセットを責任を持ってキュレーションすることの難しさに関する議論で頻繁に引用されるケーススタディとなり、後の生成モデルの事前トレーニングに使用されるテキストおよび画像コーパスに関する同様の議論を予兆するものとなった。