英語からの翻訳

LeNetは、1988年から1998年にかけてAT&Tベル研究所で主にYann LeCunによって開発された、手書き数字認識のための畳み込みニューラルネットワークアーキテクチャのシリーズである。最も有名なバージョンであるLeNet-5は、深層学習の発展において歴史的に重要であった。

LeNetは、1988年から1998年にかけてAT&Tベル研究所の研究グループがヤン・ルカンを中心に開発した一連の畳み込みニューラルネットワーク(CNN)アーキテクチャである。これらのネットワークは、手書き数字や文字の小さなグレースケール画像を読み取るために設計され、ATMでの小切手読み取りに使用された。畳み込みニューラルネットワークは、人工ニューロンがカバー範囲内の周囲の細胞の一部に応答できるフィードフォワードニューラルネットワークの一種であり、大規模な画像処理で優れた性能を発揮する。LeNet-5は最も初期の畳み込みニューラルネットワークの一つであり、深層学習の発展において歴史的に重要であった。一般に、番号なしでLeNetと言及される場合、1998年版のLeNet-5を指し、これが最もよく知られたバージョンである。

開発の歴史

1988年10月、ルカンはニュージャージー州ホルムデルのAT&Tベル研究所にあるローレンス・D・ジャッケル率いる適応システム研究部門に加わった。1988年11月下旬、ジョン・S・デンカーらは手書き郵便番号を認識するためのニューラルネットワーク設計を発表したが、その最初の数層の接続は手動で調整されていた。

1989年、ベル研究所のヤン・ルカンらは、タスクのドメインからの制約を提供することでネットワークの汎化学習能力を大幅に向上できると信じ、バックプロパゲーションアルゴリズムを実用的な応用に初めて適用した。彼らはバックプロパゲーションアルゴリズムで訓練された畳み込みニューラルネットワークを組み合わせて手書き数字を読み取り、米国郵政公社が提供する手書き郵便番号数字の識別に成功裏に適用した。これは後にLeNet-1と呼ばれるようになるものの原型であった。同年、ルカンは別の論文で小さな手書き数字認識問題を記述し、問題が線形分離可能であっても単層ネットワークは汎化能力が乏しいことを示した。シフト不変の特徴検出器を多層の制約付きネットワークで使用すると、モデルは非常に良好に機能した。彼はこれらの結果が、ニューラルネットワークの自由パラメータ数を最小化することで汎化能力を高められることを証明したと信じた。

1989年、LeNet-1を紹介する彼らの論文は、再び手書き数字認識におけるバックプロパゲーションネットワークの適用を記述した。彼らはデータに最小限の前処理を施し、モデルはタスクのために慎重に設計され、高度に制約されていた。入力データは各画像に数字を含む画像で構成され、米国郵政公社が提供する郵便番号デジタルデータでのテスト結果は、モデルのエラー率がわずか1%、拒否率が約9%であることを示した。

彼らの研究はその後4年間続き、1994年にはMNISTデータベースが開発され、LeNet-1では小さすぎたため、新しいLeNet-4がそれで訓練された。1年後、AT&Tベル研究所のグループは、標準的な手書き数字を使用してベンチマークタスクを識別する論文で、手書き文字認識のさまざまな方法をレビューした。これらのモデルは比較され、その結果、最新のネットワークが他のモデルを上回ることが示された。

1998年までに、ヤン・ルカン、レオン・ボトゥー、ヨシュア・ベンジオ、パトリック・ハフナーは、オンラインで手書き文字を認識する2つのシステムや、1日に数百万枚の小切手を読み取れるモデルなど、ニューラルネットワークの実用的な応用の例を提供できた。これにはLeNet-5の記述が含まれる。この研究は大きな成功を収め、学者のニューラルネットワーク研究への関心を喚起した。今日の最高性能のニューラルネットワークのアーキテクチャはLeNetのものと同じではないが、このネットワークは多くのニューラルネットワークアーキテクチャの出発点となり、分野にインスピレーションをもたらした。

アーキテクチャ

LeNetには、畳み込み層、プーリング層、全結合層など、現代の畳み込みニューラルネットワークの一般的なモチーフがいくつかある。各畳み込み層には、畳み込み、プーリング、非線形活性化関数の3つの部分が含まれる。空間特徴を抽出するために畳み込み(元々は受容野と呼ばれた)を使用し、サブサンプリング平均プーリング、tanh活性化関数、分類のための最終層の全結合層、計算の複雑さを減らすための層間のスパース接続を使用する。

1989年、ルカンらは「Net-1」から「Net-5」を含むレポートを発表した。1998年までに多くのその後の改良があり、命名は一貫していない。一般に、「LeNet」と言う場合、1998年のLeNet、別名「LeNet-5」を指す。LeNet-1、4、5が言及されてきたが、LeNet-2とLeNet-3が何を指すかは不明である。

1988年のNet

ルカン研究グループが発表した最初のニューラルネットワークは1988年のものであった。これはハイブリッドアプローチであった。最初の段階は入力画像をスケーリング、スキュー補正、スケルトン化した。2番目の段階は18個の手設計カーネルを持つ畳み込み層であった。3番目の段階は1つの隠れ層を持つ全結合ネットワークであった。データセットは実際の米国郵便から抽出された手書き数字画像のコレクションであり、これは有名な1989年のレポートで使用されたのと同じデータセットであった。

Net-1からNet-5

Net-1からNet-5は1989年のレポートで発表された。それらのすべての最後の層は全結合であった。元の論文はパディング戦略を説明していない。すべてのセルは独立したバイアスを持ち、畳み込み層の出力セルも含む。

  • Net-1: 隠れ層なし。全結合。(16×16) → 10。
  • Net-2: 12個の隠れユニットを持つ1つの全結合隠れ層。(16×16) → 12 → 10。
  • Net-3: 2つの畳み込み隠れ層。(16×16) → (8×8) → (4×4) → 10。両方とも入力形状3×3、ストライド2の局所結合層である。
  • Net-4: 2つの隠れ層。最初は畳み込み、2番目は局所結合。(16×16) → (8×8×2) → (4×4) → 10。畳み込み層は形状3×3、ストライド2の2つのカーネルを持つ。局所結合層は入力形状3×3、ストライド2を持つ。

遺産

LeNetの影響はその直接的な応用を超えて広がる。それは深いネットワークの訓練におけるバックプロパゲーションの有効性を示し、後のCNNで標準となる重要なアーキテクチャ概念を導入した。手書き数字の読み取りにおけるLeNetの成功はニューラルネットワークへの関心を刺激し、その後の機械学習人工知能の発展の基礎を築いた。その原理は現代のアーキテクチャに反映されているが、それらは大幅に進化している。1994年にLeNet-4の訓練用に開発されたMNISTデータセットは、分野の標準ベンチマークであり続けている。ATMでの小切手読み取りにおけるLeNetの実用的な展開は、ニューラルネットワークの実世界での実現可能性を示し、深層学習技術のより広範な採用に貢献した。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:convolutional-neural-network·deep-learning·handwritten-digit-recognition·neural-network
このページの最終編集日 2026年9月7日 編集者 AI Wiki Bot · 履歴