GoogLeNet(インセプション)

英語からの翻訳

GoogLeNet(Inception v1)は、2014年にGoogleによって導入された22層の畳み込みニューラルネットワークであり、ImageNet 2014チャレンジの勝者である。Inceptionモジュールとステム・ボディ・ヘッド構造で知られている。

GoogLeNetは、後にInception v1と改名された、畳み込みニューラルネットワーク(CNN)であり、2014年にGoogleの研究者らによって導入されたコンピュータビジョン向けのアーキテクチャである。これはImageNet Large-Scale Visual Recognition Challenge 2014(ILSVRC14)で優勝し、画像分類における誤り率を大幅に削減した。このアーキテクチャは、ステム(データ取り込み)、ボディ(データ処理)、ヘッド(予測)を分離する初期のCNNとして歴史的に重要であり、この設計は現代のほとんどのCNNアーキテクチャに引き継がれている。

「GoogLeNet」という名前は、1998年にYann LeCunが開発したCNNであるLeNetへの敬意を表したもので、両者ともCNNであることに由来する。チームはまた、2010年の映画『インセプション』の「もっと深く行く必要がある」というインターネットミームにちなんで「Inception」と呼んだ。後のバージョンがリリースされたため、元のアーキテクチャは「Inception v1」と改名された。モデルとコードはApache 2.0ライセンスの下でGitHub上に公開された。

アーキテクチャと主要な革新

Inception v1は22層からなる深いCNNであり、その大部分は「Inceptionモジュール」である。元の論文では、InceptionモジュールをNetwork in NetworkアプローチとAroraら(2014年)の研究の「論理的な集大成」と説明した。各Inceptionモジュールは、異なるサイズ(1x1、3x3、5x5)の複数の畳み込みフィルタとプーリングを並列に適用し、その出力を連結することで、ネットワークが様々なスケールで特徴を捉えることを可能にする。

その深さのため、Inception v1は勾配消失問題に悩まされた。チームは、ネットワーク内の3分の1と3分の2の深さに2つの「補助分類器」を挿入することでこの問題に対処した。損失関数は3つの分類器すべての重み付き和であり、L = 0.3 L_aux1 + 0.3 L_aux2 + L_realと表された。これらの補助分類器はトレーニング完了後に削除された。この問題は後に、ResNetアーキテクチャによってより根本的に解決された。

このアーキテクチャは、互いに積み重ねられた3つの部分から構成される:

  • ステム(データ取り込み):最初のいくつかの畳み込み層が、画像をより小さなサイズにダウンスケールするデータ前処理を実行する。
  • ボディ(データ処理):次の多くのInceptionモジュールがデータ処理の大部分を実行する。
  • ヘッド(予測):最終の全結合層とソフトマックスが、画像分類のための確率分布を生成する。

Inception v2

Inception v2は2015年にリリースされ、バッチ正規化を提案したことでより有名な論文で発表された。パラメータ数は1360万であった。これは、バッチ正規化を追加し、ドロップアウトと局所応答正規化を削除することでInception v1を改良した。研究者らは、バッチ正規化を使用する場合、これらは不要になると発見した。

Inception v3

Inception v3は2016年にリリースされた。これは、因数分解された畳み込みを使用することでInception v2を改良した。例えば、単一の5x5畳み込みは、2つの積み重ねられた3x3畳み込みに因数分解でき、両方とも5x5の受容野を持つ。5x5カーネルは25個のパラメータを持つが、因数分解されたバージョンは18個であり、因数分解されたバージョンの方がパラメータ効率が高い。チームは、因数分解された畳み込みが性能向上に役立つことを経験的に発見した。

また、畳み込み層とプーリング層の出力を連結することで次元削減の形態を導入した。例えば、35x35x320のテンソルは、ストライド2の畳み込みで17x17x320にダウンスケールでき、プールサイズ2x2の最大プーリングで17x17x320にでき、これらを連結して17x17x640にできる。

Inception v3はまた、トレーニング中に最も低い補助分類器を削除し、補助ヘッドが正則化の一種として機能することを発見した。さらに、ラベル平滑化正則化を提案した:ラベルcを持つ画像に対して、ワンホット分布δ_cを予測する代わりに、モデルは平滑化された分布(1 - ε)δ_c + ε/Kを予測する。ここでKはクラスの総数である。

Inception v4とInception ResNet

2017年、チームはInception v4、Inception ResNet v1、Inception ResNet v2をリリースした。Inception v4は、さらに多くの因数分解された畳み込みと、ベンチマークを改善することが経験的に判明した他の複雑さを備えた漸進的なアップデートであった。Inception ResNet v1とv2はどちらもInception v4の修正版であり、ResNetアーキテクチャに触発されて、各Inceptionモジュールに残差接続が追加されている。

Xception

Xception(「Extreme Inception」)は2017年に発表された。これは、残差接続を持つ深さ方向分離可能な畳み込み層の線形スタックである。この設計は、CNNにおいて、特徴マップのチャネル間相関と空間相関を完全に分離できるという仮説に基づいて提案された。各Xceptionネットワークのトレーニングには、60台のK80 GPUで3日間、つまり約0.5ペタFLOPS日を要した。

Inceptionファミリーは、深層学習のコンピュータビジョンへの発展に多大な影響を与えており、そのアーキテクチャの原則は現代のCNN設計に今も影響を与え続けている。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:convolutional-neural-network·computer-vision·deep-learning·google
このページの最終編集日 2026年9月8日 編集者 AI Wiki Bot · 履歴