2012年のImageNet大規模視覚認識チャレンジ(ILSVRC)は、ImageNetデータセットに基づく年次のコンピュータビジョンコンペティションであり、トロント大学のAlex Krizhevsky、Ilya Sutskever、Geoffrey Hintonによって開発された深い畳み込みニューラルネットワークであるAlexNetによって制覇された。この結果は、現代の深層学習時代を切り開いた単一の出来事として広く認識されている。
コンペティション
ILSVRCは2010年から毎年開催され、参加者にImageNetの約120万枚のラベル付き学習写真を1,000の物体カテゴリに分類することを課し、画像認識の進歩における標準的なベンチマークとなっていた。2010年と2011年のエントリーは、主に手作業で設計された特徴抽出法と古典的な機械学習分類器に依存しており、年ごとの誤差率の改善は漸進的で、一般的には数パーセントポイント程度だった。
AlexNetの結果
Alex Krizhevskyのエントリーは、彼のチームが2つの消費者向けGPUを使用して約1週間かけて訓練したもので、トップ5誤差率15.3%を達成し、2位のエントリーの26.2%を大幅に上回る、ほぼ10パーセントポイントの差を生み出した。この結果は、深層ニューラルネットワークの手法を使用していなかったコンピュータビジョン研究コミュニティに衝撃を与えた。AlexNetのアーキテクチャは、複数の畳み込み層、ReLU活性化関数、ドロップアウト正則化、データ拡張を組み合わせたもので、これらの手法は個別には知られていたが、この規模で組み合わせてGPUハードウェア上で成功裏に訓練されたことはなく、NVIDIAのCUDAプラットフォームによって部分的に実現可能となった。
余波と影響
AlexNetが競合手法に対して示した差の規模は、約2年以内にAI研究の軌道を変えた。コンピュータビジョン研究はほぼ完全にニューラルネットワークの手法へと移行し、大規模なラベル付きデータセット、GPU計算、深いアーキテクチャの組み合わせが、その後の自然言語処理や他の分野での進歩が従うテンプレートとなった。その後のILSVRCの勝者も、深さを増す深層畳み込みネットワークを使用し続け、2015年までにベンチマークの誤差率は推定される人間の性能を下回り、コンペティションの主催者は分類トラックを事実上解決済みとして終了させた。2012年の結果は、元のBackpropagation研究や後のTransformer論文と並んで、2020年代の大規模言語モデルを生み出した深層学習ブームに最も貢献した数少ない技術的成果の一つとして一般的に引用されており、2024年のノーベル賞の何年も前に、Hintonの分野の中心人物としての評判を確固たるものにした。