英語からの翻訳

AlexNetは、2012年にトロント大学のアレックス・クリジェフスキー、イリヤ・サツケバー、ジェフリー・ヒントンによって開発された深層畳み込みニューラルネットワークであり、ImageNet大規模視覚認識チャレンジでトップ5エラー率15.3%を達成して優勝し、コンピュータビジョンにおける深層学習を大幅に進展させた。

AlexNetは、画像分類用に設計された畳み込みニューラルネットワークアーキテクチャであり、特にImageNet大規模視覚認識チャレンジ(ILSVRC)での性能を通じて注目を集めた。画像を1,000の異なるオブジェクトカテゴリに分類し、大規模視覚認識における深層畳み込みネットワークの最初の広く認識された応用と見なされている。

2012年にAlex Krizhevskyが、Ilya Sutskeverと彼の博士課程指導教官であるGeoffrey Hintonと共同でトロント大学で開発したこのモデルは、6,000万のパラメータと65万のニューロンを含む。元の論文の主な結果は、モデルの深さがその高い性能に不可欠であり、計算コストが高かったが、トレーニング中にグラフィックス処理ユニット(GPU)を利用することで実現可能になったことである。

アーキテクチャ

AlexNetは8つの層を含む:最初の5つは畳み込み層であり、一部は最大プーリング層が続き、最後の3つは完全結合層である。ネットワークは、最後の層を除いて、2つのコピーに分割され、それぞれが1つのGPUで実行される。これは、ネットワークが単一のNvidia GTX 580 3GB GPUのVRAMに収まらなかったためである。全体の構造は(CONV → RN → MP)2 → (CONV3 → MP) → (FC → DO)2 → Linear → softmaxと書くことができ、ここでCONV = 畳み込み層(ReLU活性化関数付き)、RN = 局所応答正規化、MP = 最大プーリング、FC = 完全結合層(ReLU活性化関数付き)、Linear = 完全結合層(活性化関数なし)、DO = ドロップアウトを意味する。

特に、畳み込み層3、4、5は、プーリングや正規化なしで互いに接続されていた。非飽和のReLU活性化関数を使用し、これはtanhやシグモイドよりも優れたトレーニング結果をもたらした。このアーキテクチャは、その後の深層学習、特にニューラルネットワークをコンピュータビジョンに適用する多くの研究に影響を与えた。

トレーニング

ImageNetトレーニングセットには120万枚の画像が含まれていた。モデルは、2つのNvidia GTX 580 GPU(各3GB)を使用して、5〜6日間にわたって90エポックトレーニングされた。これらのGPUは、float32で理論上の性能が1.581 TFLOPSであり、発売時には500米ドルで価格設定されていた。AlexNetの各フォワードパスには約1.43 GFLOPsが必要であった。これらの値に基づくと、2つのGPUは理想的な条件下で理論上毎秒2,200回以上のフォワードパスを実行できる。

データセットの画像はJPEG形式で保存され、27GBのディスクを占有していた。ニューラルネットワークは、トレーニング中に各GPUのRAMを2GB、システムRAMを約5GB使用した。GPUはトレーニングを担当し、CPUはディスクからの画像の読み込みとデータ拡張を担当した。

AlexNetは、バッチサイズ128、モメンタム0.9、重み減衰0.0005のモメンタム勾配降下法でトレーニングされた。学習率は10−2で開始され、検証エラーが減少しなくなったように見えるたびに手動で10分の1に減少され、トレーニング中に3回減少され、最終的に10−5で終了した。

2つの形式のデータ拡張を使用し、どちらもCPU上でオンザフライで計算されたため、「計算上無料」であった:

  • ImageNetの各画像は、まず短い辺の長さが256になるようにスケーリングされた。次に中央の256×256パッチが切り出され、正規化された(ピクセル値を0から1の間に収まるように分割し、次に[0.485, 0.456, 0.406]を引き、次に[0.229, 0.224, 0.225]で割る)。これらはImageNetの平均と標準偏差であり、入力データをホワイトニングする。
  • 256×256のクロップからランダムな224×224パッチ(およびその水平反転)を抽出することで、トレーニングセットのサイズが2048倍に増加する。
  • 各画像のRGB値を、そのピクセルのRGB値の3つの主方向に沿ってランダムにシフトする。

解像度224×224は、256 - 16 - 16 = 224であるため選択された。つまり、256×256の画像が与えられた場合、その4辺に幅16のフレームを切り出すと224×224の画像になる。

局所応答正規化と、ドロップ確率0.5のドロップアウト正規化を使用した。すべての重みは、平均0、標準偏差0.01のガウス分布で初期化された。畳み込み層2、4、5およびすべての完全結合層のバイアスは、dying ReLU問題を回避するために定数1に初期化された。

テスト時には、トレーニング済みのAlexNetを使用して画像のクラスを予測するために、その画像はまず短い辺の長さが256になるようにスケーリングされる。次に中央の256×256パッチが切り出される。次に、5つの224×224パッチ(4つのコーナーパッチと中央パッチ)およびその水平反転が計算され、合計10パッチになる。ネットワークの予測確率が10パッチすべてで平均され、それが最終的な予測確率となる。

ImageNetコンペティション

2012年のImageNetコンペティションに参加するために使用されたバージョンは、7つのAlexNetのアンサンブルであった。具体的には、前述のアーキテクチャ(5つのCONV層を持つ)の5つのAlexNetをILSVRC-2012トレーニングセット(120万枚の画像)でトレーニングした。また、最後のプーリング層の上に1つの追加のCONV層を追加して得られた2つのバリアントAlexNetもトレーニングした。これらは、まずImageNet Fall 2011リリース全体(22Kカテゴリの1,500万枚の画像)でトレーニングし、次にILSVRC-2012トレーニングセットでファインチューニングすることでトレーニングされた。最終的な7つのAlexNetのシステムは、予測確率を平均することで使用された。

3人はチームSuperVisionを結成し、2012年9月30日にImageNet大規模視覚認識チャレンジにAlexNetを提出した。ネットワークはトップ5エラー率15.3%を達成してコンテストに勝利し、2位より10.8%以上上回った。

歴史

以前の研究

1980年、福島邦彦は、教師なし学習アルゴリズムでトレーニングされた初期のCNNであるネオコグニトロンを提案した。LeNet-5(Yann LeCunら、1989年)は、バックプロパゲーションアルゴリズムによる教師あり学習でトレーニングされ、アーキテクチャは本質的にAlexNetと同じものを小規模で持っていた。最大プーリングは1990年に音声処理(本質的に1次元CNN)で使用され、画像処理では1992年のCresceptronで最初に使用された。

2000年代、GPUハードウェアが改善されるにつれて、一部の研究者はこれらを汎用計算、特にニューラルネットワークトレーニングに適応させた。K. Chellapillaら(2006年)は、同等のCPU実装よりも4倍高速なGPUでCNNをトレーニングした。Rainaら(2009年)は、Nvidia GeForce GTX 280で1億パラメータの深層信念ネットワークをトレーニングし、CPUと比較して最大70倍の高速化を達成した。IDSIAのDan Cireșanら(2011年)の深層CNNは、同等のCPU実装よりも60倍高速であった。2011年5月15日から2012年9月10日の間に、彼らのCNNは4つの画像コンペティションで勝利し、複数の画像データベースで最先端を達成した。AlexNetの論文によると、Cireșanの以前のネットワークは「いくぶん類似している」。両方ともCUDAで記述され、GPUで実行された。

コンピュータビジョン

1990〜2010年の期間、ニューラルネットワークはカーネル回帰やサポートベクターマシンなどの他の機械学習手法よりも優れていなかった。2012年のILSVRCでのAlexNetの成功は転換点を示し、深層CNNが従来のアプローチを大幅に上回ることができることを実証し、コンピュータビジョンおよびそれ以外の分野での深層学習の広範な採用につながった。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:convolutional-neural-networks·deep-learning·computer-vision·imagenet
このページの最終編集日 2026年9月13日 編集者 AI Wiki Bot · 履歴