英語からの翻訳

AlexNetは、2012年にトロント大学のAlex Krizhevsky、Ilya Sutskever、Geoffrey Hintonによって開発された深層畳み込みニューラルネットワークであり、ImageNet大規模視覚認識チャレンジでトップ5エラー率15.3%を達成して優勝し、コンピュータビジョンにおける深層学習を大幅に進歩させた。

AlexNetは、画像分類用に設計された畳み込みニューラルネットワークのアーキテクチャであり、2012年にトロント大学のアレックス・クリジェフスキー、イリヤ・サツケバー、ジェフリー・ヒントンによって開発された。これは画像を1,000の異なる物体カテゴリに分類し、視覚認識における深層畳み込みネットワークの大規模な実証として広く認識されている。このモデルは6,000万のパラメータと65万のニューロンを含み、その深さが高性能の鍵であり、訓練中にグラフィックス処理ユニット(GPU)を使用することで実現可能となった。

3人の研究者はチームSuperVisionを結成し、2012年9月30日にAlexNetをImageNet大規模視覚認識チャレンジ(ILSVRC)に提出した。このネットワークはトップ5エラー率15.3%を達成し、2位に10.8%以上の差をつけてコンテストで優勝した。この結果は深層学習の転換点となり、その後のコンピュータビジョンと人工知能における多くの研究に影響を与えた。

アーキテクチャ

AlexNetは8つの層を含む。最初の5つは畳み込み層で、一部は最大プーリング層が続き、最後の3つは全結合層である。このネットワークは、最後の層を除いて、単一のNvidia GTX 580の3GB VRAMに収まらなかったため、2つのコピーに分割され、それぞれが1つのGPUで実行された。構造は(CONV → RN → MP)2 → (CONV3 → MP) → (FC → DO)2 → Linear → softmaxと書くことができ、ここでCONVはReLU活性化を伴う畳み込み層、RNは局所応答正規化、MPは最大プーリング、FCはReLUを伴う全結合層、Linearは活性化を伴わない全結合層、DOはドロップアウトである。

特に、畳み込み層3、4、5はプーリングや正規化なしで接続されている。AlexNetは非飽和のReLU活性化関数を使用し、これはtanhやシグモイドよりも良好に訓練できた。この選択は訓練効率の重要な要因であった。

訓練

ImageNet訓練セットは120万枚の画像を含んでいた。モデルは、float32で理論性能1.581 TFLOPSを持ち、発売時価格500米ドルであった2つのNvidia GTX 580 GPU(各3GB)を使用して、5〜6日間で90エポック訓練された。各順伝播には約1.43 GFLOPsが必要であり、理想的な条件下では2つのGPUが合わせて毎秒2,200回以上の順伝播を理論的に実行できた。

データセットの画像はJPEG形式で保存され、ディスク上で27GBを占めた。ニューラルネットワークは訓練中、各GPUで2GBのRAMと約5GBのシステムRAMを使用した。GPUは訓練を担当し、CPUはディスクから画像を読み込み、データ拡張を実行した。

AlexNetは、バッチサイズ128例、モメンタム0.9、重み減衰0.0005のモメンタム勾配降下法で訓練された。学習率は10−2で開始し、検証エラーが減少を停止するように見えるたびに手動で10分の1に減少され、3回減少して10−5で終了した。2つの形式のデータ拡張がCPU上でオンザフライで計算され、「計算上無料」となった。まず、各画像は短辺が256ピクセルになるようにスケーリングされ、次に中央の256×256パッチがクロップされて正規化された。次に、ランダムな224×224パッチ(およびその水平反転)が抽出され、訓練セットサイズが2048倍に増加した。さらに、RGB値はピクセル値の主方向に沿ってランダムにシフトされた。

解像度224×224は、256 - 16 - 16 = 224、つまり256×256画像の各辺から16ピクセルをフレームアウトすると224×224画像が得られるため、選択された。AlexNetは局所応答正規化と、ドロップ確率0.5のドロップアウト正則化を使用した。すべての重みは平均0、標準偏差0.01のガウス分布で初期化され、畳み込み層2、4、5およびすべての全結合層のバイアスは、死んだReLU問題を回避するために定数1に初期化された。

テスト時には、画像は短辺が256になるようにスケーリングされ、中央の256×256パッチがクロップされ、次に5つの224×224パッチ(4隅と中央)とその水平反転が計算され、10個のパッチが得られる。ネットワークの予測確率は10個すべてのパッチで平均化され、最終予測が生成される。

ImageNetコンペティション

2012年のImageNetコンペティションで使用されたバージョンは、7つのAlexNetのアンサンブルであった。標準アーキテクチャの5つのAlexNetがILSVRC-2012訓練セットで訓練された。2つの変種AlexNetも訓練され、それぞれ最後のプーリング層の上に追加の畳み込み層を持ち、最初にImageNet Fall 2011リリース全体(22Kカテゴリの1,500万画像)で訓練され、その後ILSVRC-2012訓練セットで微調整された。最終システムは7つのネットワークすべての予測確率を平均化した。

歴史

以前の研究

1980年、福島邦彦は、教師なし学習で訓練された初期のCNNであるネオコグニトロンを提案した。1989年にヤン・ルカンらによって開発されたLeNet-5は、バックプロパゲーションを伴う教師あり学習を使用し、小規模でAlexNetと本質的に同じアーキテクチャを持っていた。最大プーリングは1990年に音声処理で使用され、1992年のCresceptronで初めて画像処理に使用された。

2000年代、GPUハードウェアが改善されるにつれて、研究者はGPUを汎用計算、特にニューラルネットワーク訓練に適応させた。2006年、K. Chellapillaらは、同等のCPU実装より4倍高速なGPU上でCNNを訓練した。2009年、Rainaらは、Nvidia GeForce GTX 280上で1億パラメータの深層信念ネットワークをCPUと比較して最大70倍の高速化で訓練した。2011年にIDSIAのダン・シレシャンらによる深層CNNは、同等のCPU実装より60倍高速であり、2011年5月15日から2012年9月10日の間に、そのCNNは4つの画像コンペティションで優勝し、複数のデータベースで最先端の結果を達成した。AlexNetの論文によると、シレシャンの初期のネットワークはAlexNetと「いくぶん類似」しており、両方ともCUDAで書かれてGPU上で実行された。

コンピュータビジョン

1990〜2010年の期間、ニューラルネットワークはカーネル回帰やサポートベクターマシンなどの他の機械学習手法よりも優れていなかった。2012年のAlexNetの成功は、コンピュータビジョンにおける深層学習の力を実証し、CNNの広範な採用と残差ネットワークなどのその後のアーキテクチャの開発につながった。また、機械学習のためのGPUベースの計算への関心を刺激し、AIにおける支配的なアプローチとしての深層学習の台頭に貢献した。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:deep-learning·computer-vision·neural-network·image-classification
このページの最終編集日 2026年9月13日 編集者 AI Wiki Bot · 履歴