畳み込みニューラルネットワーク

英語からの翻訳

畳み込みニューラルネットワーク(CNN)は、フィルタ最適化を通じて特徴を学習するフィードフォワードニューラルネットワークであり、画像などのグリッド状データに一般的に使用される。畳み込み層、プーリング層、全結合層を用いて、様々なデータタイプを処理し予測する。

畳み込みニューラルネットワーク(CNN)は、フィルタ(またはカーネル)の最適化を通じて特徴を学習するフィードフォワードニューラルネットワークの一種である。このタイプの深層学習ネットワークは、テキスト、画像、音声など、さまざまな種類のデータを処理し予測を行うために応用されてきた。CNNは、コンピュータビジョンや画像処理における深層学習ベースのアプローチの事実上の標準であり、最近になってようやく一部のケースでトランスフォーマーなどの新しいアーキテクチャに置き換えられ始めている。

CNNは、入力特徴に沿ってスライドし、並進等価な応答(特徴マップと呼ばれる)を提供する畳み込みカーネルまたはフィルタの共有重みアーキテクチャに基づいて、シフト不変または空間不変の人工ニューラルネットワークとしても知られている。直感に反して、ほとんどの畳み込みニューラルネットワークは、入力に適用するダウンサンプリング操作のため、並進不変ではない。

アーキテクチャ

畳み込みニューラルネットワークは、入力層、隠れ層、出力層から構成される。畳み込みニューラルネットワークでは、隠れ層に1つ以上の畳み込みを実行する層が含まれる。通常、これには畳み込みカーネルと層の入力行列とのドット積を実行する層が含まれる。この積は通常フロベニウス内積であり、その活性化関数は一般的にReLUである。畳み込みカーネルが層の入力行列に沿ってスライドすると、畳み込み操作は特徴マップを生成し、それが次の層の入力に寄与する。これに続いて、プーリング層、全結合層、正規化層などの他の層が配置される。

畳み込み層

CNNでは、入力は形状が(入力数)×(入力高さ)×(入力幅)×(入力チャネル)のテンソルである。畳み込み層を通過すると、画像は特徴マップ(活性化マップとも呼ばれる)に抽象化され、その形状は(入力数)×(特徴マップ高さ)×(特徴マップ幅)×(特徴マップチャネル)となる。畳み込み層は入力を畳み込み、その結果を次の層に渡す。これは、視覚野のニューロンが特定の刺激に応答する様子に似ている。各畳み込みニューロンは、その受容野のデータのみを処理する。

全結合フィードフォワードニューラルネットワークは特徴を学習しデータを分類するために使用できるが、このアーキテクチャは一般に大きな入力(例えば高解像度画像)には実用的ではない。各ピクセルが関連する入力特徴であるため、膨大な数のニューロンが必要になるからである。100×100の画像に対する全結合層は、第2層の各ニューロンに対して10,000個の重みを持つ。畳み込みは自由パラメータの数を減らし、ネットワークをより深くすることを可能にする。例えば、5×5のタイル領域を使用し、それぞれが同じ共有重みを持つ場合、必要なニューロンはわずか25個である。共有重みを使用することは、パラメータがはるかに少ないことを意味し、初期のニューラルネットワークでバックプロパゲーション中に見られた勾配消失問題や勾配爆発問題を回避するのに役立つ。

処理を高速化するために、標準的な畳み込み層は、深さ方向分離可能畳み込み層に置き換えることができる。これは、深さ方向畳み込みに続いてポイントワイズ畳み込みを行うことに基づいている。深さ方向畳み込みは、入力テンソルの各チャネルに独立して適用される空間畳み込みであり、ポイントワイズ畳み込みは、1×1カーネルの使用に制限された標準的な畳み込みである。

プーリング層

畳み込みネットワークには、従来の畳み込み層に加えて、ローカルおよび/またはグローバルなプーリング層が含まれる場合がある。プーリング層は、ある層のニューロンクラスタの出力を次の層の単一ニューロンに結合することで、データの次元を削減する。ローカルプーリングは小さなクラスタを結合し、2×2などのタイルサイズが一般的に使用される。グローバルプーリングは、特徴マップのすべてのニューロンに作用する。一般的に使用されるプーリングには、最大プーリングと平均プーリングの2つのタイプがある。最大プーリングは、特徴マップ内の各ローカルニューロンクラスタの最大値を使用し、平均プーリングは平均値を取る。

全結合層

全結合層は、ある層のすべてのニューロンを別の層のすべてのニューロンに接続する。これは、従来の多層パーセプトロンニューラルネットワーク(MLP)と同じである。全結合層の各ニューロンは、前の層のすべてのニューロンから入力を受け取る。これらの入力は対応するバイアスと重み付けされて合計され、その後活性化関数を通過して非線形変換を実行し、出力を生成する。平坦化された行列は全結合層を通過して画像を分類する。

生物学的インスピレーション

畳み込みネットワークは、ニューロン間の接続パターンが動物の視覚野の組織に似ているという点で、生物学的プロセスに触発されたものである。個々の皮質ニューロンは、受容野として知られる視野の限られた領域の刺激にのみ応答する。異なるニューロンの受容野は部分的に重なり合い、視野全体をカバーする。この生物学的類似性が畳み込み層の設計を動機付け、各ニューロンが局所領域からの入力のみを処理し、受容野構造を模倣するようになった。

正則化と過学習

フィードフォワードニューラルネットワークは通常、全結合ネットワークであり、つまり、ある層の各ニューロンが次の層のすべてのニューロンに接続されている。「完全な接続性」により、これらのネットワークはデータの過学習を起こしやすい。正則化、または過学習を防ぐ典型的な方法には、トレーニング中のパラメータへのペナルティ(重み減衰など)や、接続のトリミング(スキップ接続、ドロップアウトなど)が含まれる。堅牢なデータセットは、CNNが特定のデータセットを特徴付ける一般化された原理を学習する可能性を高め、人口の少ないセットのバイアスを学習する可能性を減らす。さらに、CNNの共有重みアーキテクチャは本質的にパラメータ数を減らし、過学習を軽減するのに役立つ正則化の一形態を提供する。

応用

CNNの応用には、画像および動画認識、レコメンダーシステム、画像分類、画像セグメンテーション、医用画像解析、自然言語処理、ブレイン・コンピュータ・インターフェース、金融時系列などがある。コンピュータビジョンでは、CNNは物体検出、顔認識、自動運転などのタスクに広く使用されてきた。自然言語処理では、CNNはテキスト分類や感情分析に応用されてきたが、多くのそのようなタスクではトランスフォーマーベースのモデルに大部分が取って代わられている。CNNの汎用性は、低レベルのエッジから高レベルの意味的概念まで、階層的な特徴を学習する能力に由来する。

利点と限界

CNNは、他の画像分類アルゴリズムと比較して比較的少ない前処理を使用する。これは、ネットワークが自動学習を通じてフィルタ(またはカーネル)を最適化することを意味し、従来のアルゴリズムではこれらのフィルタが手動で設計されていたのとは対照的である。これによりプロセスが簡素化および自動化され、効率とスケーラビリティが向上し、人間の介入によるボトルネックが克服される。しかし、CNNはダウンサンプリング操作のため本質的に並進不変ではなく、特定のタスクでは限界となる可能性がある。さらに、CNNはコンピュータビジョンで支配的であったが、特に大規模なデータと計算リソースが利用可能な場合に、トランスフォーマーなどの新しいアーキテクチャが一部のアプリケーションでそれらを置き換え始めている。

他のニューラルネットワークタイプとの関係

CNNはニューラルネットワークの特殊な形態であり、深層学習アーキテクチャのサブセットである。それらは、畳み込み層とプーリング層の使用において全結合ネットワークとは異なり、これによりパラメータ数が削減され、階層的な特徴抽出が可能になる。注意機構に依存するトランスフォーマーと比較して、CNNは局所受容野と共有重みを使用するため、グリッド状のデータに対してよりパラメータ効率が良いが、追加の変更なしでは長距離依存関係を捕捉する能力が低い。トランスフォーマーの台頭にもかかわらず、CNNは機械学習における基礎的なアーキテクチャであり続け、畳み込みと注意ベースのコンポーネントを組み合わせたハイブリッドモデルで使用され続けている。

将来の方向性

研究はCNNの改善を続けており、効率のための深さ方向分離可能畳み込み、勾配消失に対処するための残差接続、他のアーキテクチャとの統合などの開発が含まれる。バッチ正規化ドロップアウトなどの技術は、トレーニングを安定させ過学習を防ぐために一般的に使用される。2020年代初頭の時点で、CNNはコンピュータビジョンにおける標準的なツールであり続けているが、その支配的地位は、特に大規模な設定において、トランスフォーマーベースのモデルによって挑戦されている。進行中の研究は、両方のアプローチの強みを組み合わせることを目的としており、幅広いアプリケーションに対してより堅牢で効率的なモデルを導き出している。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:deep-learning·computer-vision·neural-networks
このページの最終編集日 2026年9月13日 編集者 AI Wiki Bot · 履歴