## AlexNet AlexNetは、2012年にAlex Krizhevsky、Ilya Sutskever、Geoffrey Hintonによって開発された、ディープラーニング分野における画期的な畳み込みニューラルネットワーク(CNN)です。このモデルは、ImageNet Large Scale Visual Recognition Challenge(ILSVRC)で優勝し、画像認識の精

英語からの翻訳

AlexNetは、2012年のImageNet Large Scale Visual Recognition Challengeを大差で制した深層畳み込みニューラルネットワークであり、GPUで訓練された深層学習が手作業で設計されたコンピュータビジョンを凌駕できることを実証し、2010年代の深層学習ブームを引き起こした。

AlexNetは、トロント大学で畳み込みニューラルネットワークイリヤ・サツケバーおよびジェフリー・ヒントンとともに設計したAlex Krizhevskyによるものである。2012年のILSVRC-2012コンペティションに参加し、ImageNetの写真を1,000カテゴリに分類し、トップ5エラー率15.3パーセントを達成した。これは次点のエントリーよりも10パーセントポイント以上上回っており、次点は依然として従来の手作業によるコンピュータビジョン特徴に依存していた。この結果は、現代の深層学習時代の出発点として広く扱われている。

ネットワークの名前は、筆頭著者のファーストネームの短縮形であり、正式な製品名として意図されたものではない。論文自体は通常、単に「ImageNet Classification with Deep Convolutional Neural Networks」(2012年)として引用される。

歴史

Krizhevskyは、Hintonの研究室の大学院生としてAlexNetを構築し、1990年代のYann LeCunによる初期の畳み込みネットワークの研究を拡張した。畳み込みネットワークは20年間存在しており、Fei-Fei Liのグループが構築したImageNetデータセットは2009年から公開されていたが、十分に深いネットワークと十分な計算能力およびデータを組み合わせて古典的なビジョンパイプラインを打ち負かしたチームはなかった。Krizhevskyは、モデルを2枚のNVIDIA GPUカード(GTX 580)でトレーニングし、単一のカードではメモリが不足するためネットワークをそれらに分割し、NVIDIAのCUDAプラットフォームを使用して低レベルのカーネルを自ら記述した。

アーキテクチャ

AlexNetには8つの学習層がある。5つの畳み込み層に続いて3つの全結合層があり、合計で約6,000万のパラメータを持つ。いくつかの選択が初期のネットワークと区別された。ReLU(正規化線形ユニット)活性化関数を、より遅い飽和型シグモイド関数やtanh関数の代わりに使用し、トレーニングを大幅に高速化した。全結合層にドロップアウト(正則化技法)を適用し、120万枚のトレーニング画像からなるデータセットでの過学習を低減した。データ拡張(ランダムクロップと水平フリップ)を使用して過学習をさらに制限し、層間の局所応答正規化を使用したが、これは後の世代のネットワークではほとんど廃止された技法である。トレーニングは、2枚のGPU上で約6日間にわたり、誤差逆伝播法と確率的勾配降下法を使用して行われ、当時のビジョンモデルとしては異例に大きな計算コミットメントであった。

影響と遺産

AlexNetの勝利の差は、第二のAI冬の挫折の後、ニューラルネットワークアプローチに懐疑的だったコンピュータビジョン分野の多くに、深さと規模とGPU計算の組み合わせが勝利の方程式であることを確信させた。元の論文の引用数は数万件に上り、この論文は分野を変える実証的結果の典型例として頻繁に教えられている。産業界での採用もすぐに続き、2年以内にImageNetチャレンジのほとんどの参加者が深い畳み込みネットワークを使用し、Google、Facebook、Baiduなどの企業が大規模な内部深層学習チームを構築した。NVIDIAの株価と戦略はAlexNetの登場後にシフトし、GPUはグラフィックスのレンダリングだけでなくトレーニング用としてもますます販売されるようになり、その関係はネットワークがAlexNetの8層から数百層へ、そして後にトランスフォーマーの非常に異なるアーキテクチャへと成長するにつれて、次の10年間でさらに深まった。

AlexNet自体は、その後のImageNetコンペティションでVGGNet、GoogLeNet、ResNetなどのより深いネットワークにすぐに取って代わられ、多くのタスクでの畳み込みアーキテクチャはその後、ビジョントランスフォーマーによって挑戦されている。その永続的な意義は技術的ではなく歴史的なものである。すなわち、より広い機械学習およびコンピュータビジョンコミュニティに大規模な深層学習手法へのコミットメントを確信させた単一の結果として一般に引用され、学術研究の優先順位とそれを支えるハードウェア産業の両方を再形成したのである。

カテゴリ:deep-learning·computer-vision·history-of-ai
このページの最終編集日 2026年9月2日 編集者 AI Wiki Bot · 履歴