AlexNetは、画像分類のための畳み込みニューラルネットワークアーキテクチャであり、2012年にトロント大学のAlex Krizhevsky、Ilya Sutskever、Geoffrey Hintonによって開発された。1,000の物体カテゴリに画像を分類し、視覚認識における深層畳み込みネットワークの最初の大規模な実証として広く認識されている。ImageNet Large Scale Visual Recognition Challenge(ILSVRC)2012での決定的な勝利は、機械学習における転換点となり、人工知能の研究と産業全体での深層学習の急速な採用を促進した。
このモデルは6,000万のパラメータと65万のニューロンを含む。そのアーキテクチャは8層で構成されている:5つの畳み込み層(一部は最大プーリングを伴う)と3つの全結合層である。ネットワークは非飽和のReLU活性化関数を使用し、従来のtanhやシグモイド活性化よりもトレーニング速度を向上させた。メモリ制約のため、ネットワークは2つのGPUに分割され、各コピーがニューロンの半分を処理した。最終的な全結合層は両方のGPUからの出力を結合した。
アーキテクチャ
AlexNetの構造は次のように要約できる:(CONV → RN → MP)2 → (CONV3 → MP) → (FC → DO)2 → Linear → softmax。ここで、CONVはReLU活性化を伴う畳み込み層、RNは局所応答正規化、MPは最大プーリング、FCはReLUを伴う全結合層、Linearは活性化のない全結合層、DOはドロップアウトを示す。特に、畳み込み層3、4、5は、プーリングや正規化を間に挟まずに順次接続された。
ネットワークは、過学習を減らすために局所応答正規化と、ドロップ確率0.5のドロップアウト正則化を使用した。すべての重みは、平均0、標準偏差0.01のガウス分布で初期化された。畳み込み層2、4、5とすべての全結合層のバイアスは、dying ReLU問題を避けるために1に初期化された。
トレーニング
モデルは、120万枚の画像を含むImageNetトレーニングセットでトレーニングされた。トレーニングは、2つのNvidia GTX 580 GPU(各3GB)を使用して5〜6日間で90エポック実行され、float32での理論性能は1.581 TFLOPSであった。各フォワードパスには約1.43 GFLOPsが必要であった。JPEG形式で保存されたデータセット画像は、ディスク上で27GBを占めた;ネットワークはトレーニング中に各GPUで2GBのRAMと約5GBのシステムRAMを使用した。GPUがトレーニングを処理し、CPUが画像読み込みとデータ拡張を実行した。
トレーニングでは、バッチサイズ128、モメンタム0.9、重み減衰0.0005のモメンタム勾配降下法を使用した。学習率は10⁻²で開始し、検証エラーが横ばいになるたびに手動で10分の1に減らされ、10⁻⁵で終了した。2つの形式のデータ拡張がCPU上でオンザフライで適用され、実質的に無料であった:まず、画像は短辺が256ピクセルになるようにスケーリングされ、次に中央の256×256クロップが取得されて正規化された;次に、256×256クロップからランダムな224×224パッチ(およびその水平反転)が抽出され、トレーニングセットのサイズが2048倍に増加した。さらに、各画像のRGB値は、ピクセル色分布の主成分に沿ってランダムにシフトされた。
ImageNetコンペティション
SuperVisionという名前のチームは、2012年9月30日にILSVRC-2012コンペティションに7つのAlexNetのアンサンブルを提出した。5つのネットワークは標準アーキテクチャを使用し、2つの変種は追加の畳み込み層を持ち、より大きなImageNet Fall 2011リリース(1500万画像、22,000カテゴリ)で事前トレーニングされ、その後ILSVRC-2012トレーニングセットで微調整された。最終的な予測は、7つのネットワークすべてからの確率の平均であった。アンサンブルは15.3%のtop-5エラー率を達成し、2位より10.8パーセントポイント以上優れており、コンピュータビジョンコミュニティを驚かせる劇的な改善であった。
影響と遺産
AlexNetの成功は、大規模な視覚認識における深層畳み込みネットワークの力を実証し、ResNetやU-Netなどの後続のアーキテクチャに直接影響を与えた。また、深層ネットワークのトレーニングにGPUを使用することを普及させ、これは分野の標準となった。この論文の深さへの強調と、ReLU、ドロップアウト、データ拡張の有効性は、現代の深層学習の実践を形成した。AlexNetはしばしば深層学習革命の触媒として引用され、生成AIの進歩や、大規模言語モデルとトランスフォーマーの開発につながった。その影響は学界を超えて広がり、OpenAI、Google DeepMind、Anthropicなどの企業でのAI研究への投資を促進した。