フィードフォワードは、ニューラルネットワークにおける基本的なアーキテクチャパターンであり、情報が厳密に一方向、すなわち入力層から隠れ層を経て出力層へと流れ、ループやフィードバック接続が存在しないことを特徴とする。この設計は、情報が循環できるリカレントアーキテクチャとは対照的であり、機械学習システムの大部分、特に深層学習モデルや大規模言語モデルの基盤となっている。
この用語は、制御理論と初期の人工知能研究に由来し、フィードフォワードシステムは以前の出力に依存せず、入力から直接出力を計算する。ニューラルネットワークの文脈では、各層の活性化が前の層の活性化のみから計算され、単純で合成可能な構造を生み出し、バックプロパゲーションを用いて効率的に訓練できる。
歴史的発展
フィードフォワードネットワークの概念は、1958年にフランク・ローゼンブラットが導入したパーセプトロンに遡り、これは単層のフィードフォワードモデルであった。1969年、マービン・ミンスキーとシーモア・パパートの著書『パーセプトロン』は単層フィードフォワードネットワークの限界を指摘し、研究を停滞させた。1980年代にバックプロパゲーションが普及し、多層フィードフォワードネットワーク(多層パーセプトロンとも呼ばれる)の訓練が可能となり、この分野は復活した。初期の主要な貢献者には、バーナード・ウィドローやバークレーAI研究の関連者がおり、適応フィルタリングや学習アルゴリズムを進歩させた。
2010年代までに、フィードフォワードアーキテクチャは現代AIの基盤となった。2017年の論文「Attention Is All You Need」でヤコブ・ウシュコレイト、ルカシュ・カイザー、ニキ・パルマーらによって導入されたTransformerアーキテクチャは、アテンションメカニズムと交互に配置されたフィードフォワード層に大きく依存している。この設計は、OpenAI、Anthropic、Google DeepMindが開発したシステムの基盤となっている。
主要な構成要素
典型的なフィードフォワードネットワークは、入力層、1つ以上の隠れ層、出力層で構成される。各層は線形変換とそれに続く非線形活性化関数を適用する。一般的な活性化関数には、ReLU(正規化線形ユニット)、シグモイド、tanhがある。重みとバイアスは、Adamや確率的勾配降下法の変種などの最適化アルゴリズムを通じて学習される。
現代のアーキテクチャでは、フィードフォワード層はしばしば拡張・縮小される。例えば、Transformerでは、各ブロックにフィードフォワードネットワークが含まれ、まず表現をより高次元(多くの場合、モデル幅の4倍)に射影し、その後元の次元に戻す。この設計は、位置ごとのフィードフォワードネットワークと呼ばれることもあり、各トークンを独立に処理する。
現代アーキテクチャにおける役割
フィードフォワード層は、エンコーダー・デコーダーモデルや系列変換システムにおいて不可欠である。Transformerでは、エンコーダーとデコーダーの両方のスタックにフィードフォワードサブレイヤーが含まれる。これらの層は、マルチヘッドアテンションメカニズムによって生成された表現を変換し、モデルが複雑な特徴間の相互作用を学習できるようにする役割を担う。
2015年に導入された残差ネットワーク(ResNet)は、スキップ接続を組み込むことで、深いフィードフォワードスタックを通じて勾配がより容易に流れるようにし、数百層のネットワークを可能にした。この革新は、現代の生成AIシステムの規模にモデルを拡張する上で重要であった。バッチ正規化や層正規化などの技術は、深いフィードフォワードネットワークの訓練をさらに安定させる。
訓練と最適化
フィードフォワードネットワークの訓練は、損失関数の全重みに対する勾配を計算するバックプロパゲーションに依存する。主要な実践には、重み初期化戦略、学習率スケジュール、勾配爆発を防ぐための勾配クリッピングが含まれる。ドロップアウトやデータ拡張などの正則化手法は、過学習を防ぐのに役立つ。
損失関数はタスクによって異なる。分類にはクロスエントロピー損失、回帰には平均二乗誤差、生成モデルには特殊な損失が使用される。推論では、ビームサーチや、トップkサンプリングやトップpサンプリングなどのサンプリング手法を含む復号戦略がしばしば用いられ、温度スケーリングでランダム性を制御する。
応用と変種
フィードフォワードネットワークはさまざまな領域で使用されている。コンピュータビジョンでは、畳み込みニューラルネットワーク(CNN)は本質的にフィードフォワードであり、画像セグメンテーション用のU-Net(U-Net)などのアーキテクチャがある。自然言語処理では、フィードフォワード層は、GPTやClaudeなどの大規模言語モデルで使用されるTransformerに不可欠である。NVIDIAなどの企業のハードウェアアクセラレータ(提供リストにはないが、AMD、Intel、Qualcommも関連チップを製造していることに注意)は、フィードフォワード計算の中心である行列乗算に最適化されている。
変種には、エンコーダーとデコーダーのフィードフォワード経路を接続するクロスアテンションメカニズムや、順序情報を提供する位置エンコーディングが含まれる。RLAIF(AIフィードバックからの強化学習)やカリキュラム学習などの高度な訓練手法は、モデルの動作をさらに洗練させる。フィードフォワードネットワークは、GroqやSambaNovaなどの特殊なハードウェア設計にも登場し、低遅延推論を最適化している。
限界と将来の方向性
その成功にもかかわらず、フィードフォワードネットワークには限界がある。過去の入力に対する固有の記憶がなく、外部メカニズムなしでは系列データに適さない。また、計算集約的であり、大量のエネルギーと専用ハードウェアを必要とする場合がある。研究は、入力ごとにフィードフォワードパラメータのサブセットのみを活性化する混合専門家層など、より効率的なアーキテクチャや、その理論的特性の理解に向けて続けられている。
2020年代半ば現在、フィードフォワードはAIの支配的なパラダイムであり続けており、スタンフォードAIラボやMIT CSAILなどの学術機関、および産業研究所からの継続的な革新がある。フィードフォワード設計の単純さとスケーラビリティは、研究と実運用システムの両方での継続的な関連性を保証している。