機械学習において、ハイパーパラメータとは、モデルの学習プロセスの設定可能な部分を定義するために設定できるパラメータである。ハイパーパラメータは、ニューラルネットワークのトポロジーやサイズなどのモデルハイパーパラメータと、オプティマイザの学習率やバッチサイズなどのアルゴリズムハイパーパラメータに分類される。これらは、トレーニング中にモデルがデータから学習する特性であるパラメータと対比して、ハイパーパラメータと呼ばれる。
ハイパーパラメータは、すべてのモデルやアルゴリズムで必要とされるわけではない。通常最小二乗回帰などの単純なアルゴリズムでは、ハイパーパラメータは不要である。しかし、例えばLASSOアルゴリズムは、通常最小二乗法に正則化ハイパーパラメータを追加し、これをトレーニング前に設定する必要がある。ハイパーパラメータの定義が厳密に必須でないモデルやアルゴリズムでも、これらを慎重に選択しないと意味のある結果が得られない場合がある。ハイパーパラメータの最適値は常に予測が容易とは限らず、一部のハイパーパラメータは意味のある影響を持たないか、重要な変数が別の変数の値に依存する場合がある。多くの場合、データとタスクに適した組み合わせを見つけるために、別途ハイパーパラメータ調整のプロセスが必要となる。ハイパーパラメータは、モデルの性能向上に加えて、研究者が研究の堅牢性と再現性を導入するためにも使用でき、特に乱数生成を組み込んだモデルを使用する場合に有用である。
考慮事項
モデルのトレーニングとテストに必要な時間は、ハイパーパラメータの選択に依存することがある。ハイパーパラメータは通常、連続型または整数型であり、混合型の最適化問題を引き起こす。一部のハイパーパラメータの存在は他の値に依存しており、例えば、ニューラルネットワークの各隠れ層のサイズは層数に依存する場合がある。その結果、ハイパーパラメータは階層的または条件付きの構成空間を形成することがあり、ある設計選択が、どのさらなるハイパーパラメータが関連するかを決定する。
学習が困難なパラメータ
目的関数は通常、ハイパーパラメータに関して微分不可能である。そのため、ほとんどの場合、ハイパーパラメータは、モデルパラメータの学習に一般的に使用される勾配降下法などの勾配ベースの最適化手法では学習できない。これらのハイパーパラメータは、一般的な最適化手法では学習できないが、損失関数に影響を与えるモデル表現を記述する。例として、サポートベクターマシンにおける誤差の許容値ハイパーパラメータが挙げられる。
学習不可能なパラメータ
ハイパーパラメータは、モデルの容量を積極的に増加させ、損失関数を望ましくない最小値に押し上げ、データの構造の豊かさを正しくマッピングするのではなく、データへの過剰適合を引き起こす可能性があるため、トレーニングデータから学習できない場合がある。例えば、回帰モデルに適合する多項式方程式の次数を学習可能なパラメータとして扱うと、次数はモデルがデータに完全に適合するまで増加し、トレーニング誤差は低くなるが、汎化性能は低くなる。
調整可能性
ほとんどの性能変動は、わずか数個のハイパーパラメータに起因する。アルゴリズム、ハイパーパラメータ、または相互作用するハイパーパラメータの調整可能性は、それを調整することでどれだけの性能向上が得られるかの尺度である。LSTMの場合、学習率とネットワークサイズが最も重要なハイパーパラメータである一方、バッチ処理とモメンタムは性能に有意な影響を与えない。一部の研究ではミニバッチサイズを数千単位で使用することが提唱されているが、他の研究ではミニバッチサイズを2から32の間で最適な性能が得られることが示されている。
堅牢性
学習における固有の確率性は、経験的なハイパーパラメータ性能が必ずしも真の性能ではないことを直接的に意味する。ハイパーパラメータ、ランダムシード、または同じアルゴリズムの異なる実装の単純な変更に対して堅牢でない手法は、大幅な簡素化と堅牢化なしには、ミッションクリティカルな制御システムに統合できない。さらに、ハイパーパラメータの選択は、予測性能だけでなく、変更された入力条件やノイズの多い入力条件下でのモデル出力の堅牢性と安定性にも影響を与える可能性がある。特に強化学習アルゴリズムでは、多数のランダムシードにわたる性能の測定と、ハイパーパラメータ選択に対する感度の測定が必要である。少数のランダムシードでの評価は、分散が高いため性能を適切に捉えられない。DDPG(Deep Deterministic Policy Gradient)などの一部の強化学習手法は、他の手法よりもハイパーパラメータ選択に敏感である。
最適化
ハイパーパラメータ最適化は、与えられたテストデータ上の所定の損失関数を最小化する最適なモデルを生成するハイパーパラメータのタプルを見つける。目的関数はハイパーパラメータのタプルを受け取り、関連する損失を返す。通常、これらの手法は勾配ベースではなく、微分なし最適化やブラックボックス最適化の概念を適用する。一般的な手法には、グリッドサーチ、ランダムサーチ、ベイズ最適化が含まれるが、ソースはこれらの詳細を指定していない。
再現性
ハイパーパラメータの調整に加えて、機械学習ではパラメータと結果の保存と整理、およびそれらの再現性の確保が含まれる。この目的のための堅牢なインフラストラクチャがない場合、研究コードは急速に進化し、記録管理や再現性などの重要な側面を損なうことが多い。機械学習のオンラインコラボレーションプラットフォームは、科学者が実験、データ、アルゴリズムを自動的に共有、整理、議論することを可能にすることで、さらに進んでいる。再現性は、深層学習モデルでは特に困難な場合がある。例えば、研究によると、深層学習モデルは乱数生成器のランダムシード選択に非常に強く依存することが示されている。
関連項目
- ハイパーヒューリスティック
- 再現性の危機