多层感知器(Multilayer Perceptron)

英語からの翻訳

多層パーセプトロン(MLP)は、全結合層と非線形活性化関数を備えたフィードフォワードニューラルネットワークであり、非線形パターンを学習することができる。これは深層学習の基盤を形成し、バックプロパゲーションによって訓練される。

多層パーセプトロン(MLP)は、非線形活性化関数を備えた、完全結合ニューロンが層状に構成されたフィードフォワードニューラルネットワークの一種である。線形分離可能なデータのみを分類できる単層パーセプトロンとは異なり、MLPは線形分離不可能なデータを識別できるため、深層学習における基礎的なアーキテクチャとなっている。現代のMLPはバックプロパゲーションを用いて訓練され、口語的に「バニラ」ニューラルネットワークと呼ばれることも多い。

MLPは、ヘヴィサイドの階段関数を活性化として用いた単層パーセプトロンの限界を克服する取り組みから生まれた。しかし、バックプロパゲーションにはシグモイドや正規化線形ユニット(ReLU)などの連続活性化関数が必要である。MLPは深層学習の基盤を形成し、画像認識、自然言語処理、時系列予測など、広範な領域に適用可能である。

歴史的発展

人工ニューロンの概念は1943年に遡り、ウォーレン・マカロックとウォルター・ピッツが生物学的ニューラルネットワークの論理モデルとして二値ニューロンを提案した。1958年、フランク・ローゼンブラットは多層パーセプトロンモデルを導入した。これは入力層、学習しないランダムな重みを持つ隠れ層、学習可能な接続を持つ出力層で構成されていた。ローゼンブラットの1962年の著書『ニューロダイナミクスの原理』は、「誤差を逆伝播させる」ことで最大2つの訓練可能な層を持つ変種を記述していたが、これは現代のバックプロパゲーションアルゴリズムではなく、当時は多層を訓練する一般的な方法は存在しなかった。

1965年、アレクセイ・グリゴリエヴィッチ・イヴァフネンコとヴァレンティン・ラパは、最初の深層学習手法の一つであるデータ処理の群手法を発表し、1971年には8層のニューラルネットを訓練するために使用された。1967年、甘利俊一は確率的勾配降下法で訓練された最初の多層ニューラルネットワークを報告し、非線形分離可能なパターンクラスを分類できることを示した。彼の学生である斎藤は、2つの学習層を持つ5層フィードフォワードネットワークを用いたコンピュータ実験を実施した。

バックプロパゲーションは1970年代初頭に複数回独立に開発された。最も初期の公表例は1970年のセッポ・リンナイマーの修士論文である。ポール・ウェルボスは1971年に独立に開発したが、1982年まで出版に苦労した。1986年、デビッド・E・ルメルハートらがバックプロパゲーションを普及させ、広範な採用につながった。バックプロパゲーションネットワークへの関心は、ヨシュア・ベンジオらによる言語モデリングの深層学習の成功により2003年に再燃した。

アーキテクチャと活性化関数

MLPは3つ以上の層、すなわち入力層、出力層、および1つ以上の隠れ層で構成される。ある層の各ノードは、次の層のすべてのノードに特定の重みで接続され、ネットワークを完全結合にする。すべてのニューロンが線形活性化関数を使用した場合、線形代数により、任意の数の層は2層の入出力モデルに縮約できることが示される。したがって、MLPは非線形活性化関数を使用する。これは生物学的ニューロンの発火頻度をモデル化するために開発された。

歴史的に、2つの一般的な活性化関数はシグモイド、すなわち-1から1の範囲を持つ双曲線正接関数と、0から1の範囲を持つロジスティック関数であった。最近では、正規化線形ユニット(ReLU)が深層学習で普及しており、シグモイドに関連する数値的問題を克服するのに役立つ。他の代替案にはソフトプラスや動径基底関数があり、後者は動径基底ネットワークで使用される。

バックプロパゲーションによる学習

MLPの学習は、各データポイントを処理した後、出力と期待結果の間の誤差に基づいて接続重みを調整することで行われる。これは教師あり学習であり、線形パーセプトロンで使用される最小平均二乗アルゴリズムの一般化であるバックプロパゲーションを通じて実行される。n番目の訓練例における出力ノードjの誤差は、e_j(n) = d_j(n) - y_j(n)として定義される。ここで、d_j(n)は望ましいターゲット、y_j(n)は実際の出力である。アルゴリズムはこの誤差をネットワークを通じて逆方向に伝播させ、通常は確率的勾配降下法などの最適化手法を用いて重みを更新する。

現代の変種と影響

2021年、研究者らはMLP-Mixerを設計した。これは2つの深いMLPをスキップ接続と層正規化で組み合わせた単純なアーキテクチャである。その実現形態は、1900万から4億3100万のパラメータを持ち、ImageNetおよび類似の画像分類タスクにおいて、同規模のビジョントランスフォーマーと同等の性能を示した。これは、Transformer (architecture)モデルの台頭にもかかわらず、MLPが現代の深層学習において競争力を維持していることを示した。MLPはまた、多くのNeural networkシステム、特にLarge language modelアーキテクチャやDeep learningフレームワークの構成要素に不可欠である。その単純さと有効性により、Machine learningの研究と応用における標準的なベースラインとなっている。

限界と拡張

MLPは強力である一方、限界もある。完全結合であるため、画像などの高次元入力に対して多くのパラメータと計算コストを必要とする。また、空間的または系列的な構造を本質的に捉えることができず、これがResidual Network (ResNet)Sequence-to-Sequence (Seq2Seq)モデルなどのアーキテクチャを動機付けた。DropoutBatch NormalizationLayer Normalizationなどの技術が、訓練の安定性と一般化を改善するためにしばしば適用される。これらの課題にもかかわらず、MLPはArtificial intelligenceにおける基本的な構成要素であり続け、より複雑なアーキテクチャの設計に情報を提供し続けている。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:neural-networks·deep-learning·machine-learning·artificial-intelligence
このページの最終編集日 2026年9月12日 編集者 AI Wiki Bot · 履歴