パラメトリックモデルは、固定された有限数のパラメータによって特徴づけられる統計的および機械学習モデルのクラスである。これは、モデルの複雑さがトレーニング前に決定され、トレーニングデータの量に関係なく変化しないことを意味する。パラメータはデータから学習され、トレーニングが完了すると、モデルは元のデータセットを保持することなく予測を行うことができる。これは、パラメータの数がトレーニングデータのサイズに応じて増加し得るノンパラメトリックモデルとは対照的である。
この概念は機械学習の基礎であり、パラメトリックアプローチとノンパラメトリックアプローチの選択は、モデルの柔軟性、計算要件、および汎化に影響を与える。パラメトリックモデルは、線形関係などの特定の関数形式を仮定するため、トレーニングと解釈が簡単であるが、複雑なパターンに対しては柔軟性が低くなる可能性がある。
歴史的背景
パラメトリック手法とノンパラメトリック手法の区別は、古典的な統計学にルーツを持つ。アラン・パーリス(コンピュータサイエンスでよりよく知られているが)などの統計学者による初期の研究は、モデルベースの推論の基礎を築いた。1960年代から1970年代にかけて、計算統計学の台頭により、線形回帰やロジスティック回帰などのパラメトリックモデルが普及した。「パラメトリック」という用語は1980年代までに教科書で標準となり、クリストファー・ビショップの後のパターン認識に関する研究が、機械学習におけるその使用を確固たるものにした。
種類と例
一般的なパラメトリックモデルには、線形回帰、ロジスティック回帰、線形判別分析が含まれる。深層学習では、固定された数の重みとバイアスを持つニューラルネットワークなど、多くのアーキテクチャがパラメトリックである。例えば、トランスフォーマーモデルは、そのアーキテクチャ(層のサイズ、アテンションヘッドなど)に基づいて所定のパラメータ数を持つ。OpenAIやAnthropicからの大規模言語モデルはパラメトリックであり、設計時に数十億のパラメータが固定されている。
k近傍法や決定木などのノンパラメトリックモデルは、固定されたパラメータ数を持たず、トレーニングデータを保存するか、複雑さが増加する。しかし、ガウス過程のように、ノンパラメトリックでありながらパラメトリックに近似できるモデルもあり、境界線は曖昧である。
利点と欠点
パラメトリックモデルにはいくつかの利点がある:計算効率が良く、メモリ消費が少なく、解釈が容易である。また、仮定された関数形式が真のデータ分布と一致する場合、良好に汎化する。しかし、形式が単純すぎると過小適合する可能性があり、複雑なパターンを捉えるにはパラメータを増やす必要があり、データが限られている場合は過適合につながる可能性がある。
実際には、パラメトリックモデルは、小規模なデータセットや、医療や金融アプリケーションなど解釈可能性が重要な場合に好まれることが多い。例えば、Intuitive Surgicalはリスク評価にパラメトリックモデルを使用するかもしれないが、Waymoは知覚に、より柔軟なノンパラメトリックアプローチを使用するかもしれない。
現代のAIにおける役割
現代の人工知能では、深層学習の成功によりパラメトリックモデルが支配的である。固定されたパラメータ数により、AWS TrainiumやCerebrasシステムなどの専用ハードウェアでの効率的なトレーニングが可能になる。Google DeepMindやAmazon Web Servicesなどの企業は、パラメトリックモデルを大規模に展開している。モデルサイズとパフォーマンスのトレードオフは主要な研究分野であり、精度を失わずにモデルを圧縮する取り組みが行われている。
しかし、固定されたパラメータ数は、データが豊富でパターンが複雑な場合には制限となることがある。これにより適応型モデルの研究が進められているが、パラメトリックモデルはほとんどのアプリケーションで標準であり続けている。