1986年、デイビッド・ラメルハート、ジェフリー・ヒントン、ロナルド・ウィリアムズは、ニューラルネットワークにおける勾配を効率的に計算するアルゴリズムであるバックプロパゲーションを広めた画期的な論文を発表した。バックプロパゲーションは、微分の連鎖律を適用して、損失関数のネットワークの重みに対する勾配を計算し、出力層から入力層へと導関数を逆方向に伝播させる。この方法は冗長な計算を回避し、多層ネットワークの訓練を実用的にする。この用語は厳密には勾配計算を指すが、確率的勾配降下法やAdamなどのオプティマイザによるパラメータ更新を含む学習プロセス全体を大まかに指すことも多い。1986年の論文は初期のアイデアを統合し、アルゴリズムの有効性を実証して、機械学習における広範な採用を促し、現代の深層学習と人工知能アプリケーションの基盤を築いた。
歴史的背景
バックプロパゲーションは、1986年以前に複数の発見があり、複雑な歴史を持つ。1960年代から1970年代の初期の研究には、1970年に逆モード自動微分を導入したセッポ・リンナイマーや、1974年の博士論文でこのアルゴリズムを記述したポール・ウェルボスなどの研究者による貢献が含まれる。しかし、これらの取り組みは比較的知られていなかった。1986年、ラメルハート、ヒントン、ウィリアムズは、ジャーナル『ネイチャー』に「誤差逆伝播による表現の学習」を発表し、アルゴリズムを明確に提示し、XOR関数の学習などの問題でその力を実証した。この出版物は、同じく1986年の書籍『並列分散処理』とともに、バックプロパゲーションをニューラルネットワーク研究の最前線に押し上げた。この論文の影響は、そのアクセシビリティとコネクショニストモデルへの関心の高まりによって増幅され、1980年代後半の研究の急増につながった。
技術的基礎
バックプロパゲーションは、フィードフォワードネットワーク内の各重みに対する損失関数の勾配を計算する。入力と出力のペア \((x_i, y_i)\) に対して、ネットワークは重み付き和と活性化関数の層を通じて予測 \(g(x_i)\) を生成する。損失 \(C(y_i, g(x_i))\) は、予測とターゲットの間の誤差を測定する。このアルゴリズムは、連鎖律を適用して出力層から逆方向に作業し、各重みに対する損失の偏導関数を計算する。これには、活性化関数と損失関数の導関数の評価が必要であり、これらは微分可能でなければならない。一般的な選択肢には、隠れ層のシグモイドまたはReLU活性化関数、損失にはクロスエントロピーまたは二乗誤差が含まれる。勾配は、通常は勾配降下法を使用して、損失を減らすために重みを調整する方向を示す。1986年の論文は、バックプロパゲーションが隠れ層の内部表現を学習でき、以前は扱いにくかった問題をネットワークが解決できるようにすることを強調した。
影響と遺産
1986年の論文はニューラルネットワーク分野の触媒となったが、当時のハードウェアでの訓練の遅さや深いネットワークの訓練の難しさなどの制限により、1990年代には関心が衰えた。しかし、このアルゴリズムは基礎的なものであり続けた。2010年代には、計算能力、大規模データセット、バッチ正規化や残差ネットワークなどの技術の進歩が深層学習を復活させ、バックプロパゲーションが中核的な訓練メカニズムとなった。今日、バックプロパゲーションは、OpenAI、Anthropic、Google DeepMindによって開発された大規模言語モデルや、トランスフォーマー、生成AIツールを含む、事実上すべての現代のAIシステムを支えている。このアルゴリズムの効率性と汎用性は、この分野の標準となり、すべての機械学習コースで教えられ、すべての主要なフレームワークに実装されている。
関連する発展
バックプロパゲーションの成功は、多くの拡張と変種を促進した。研究者は、AdamやSGD変種などの改良された最適化アルゴリズムや、ドロップアウトや重み初期化戦略などの正則化技術を開発した。バックプロパゲーションが体現する逆モード自動微分の概念は、現在ではニューラルネットワークを超えて科学計算で広く使用されている。ヒントンが働いていたトロント大学やスタンフォードAIラボなどの機関は、深層学習研究の拠点となった。1986年の論文は転換点として頻繁に引用され、その著者たちは、深層学習への貢献により、2018年のチューリング賞をヒントンがヨシュア・ベンジオとヤン・ルカンとともに受賞するなど、数多くの栄誉を受けた。その古さにもかかわらず、バックプロパゲーションは支配的な訓練方法であり続けているが、カリキュラム学習や生物学的に着想を得たアプローチなどの代替案を探る研究が進行中である。