機械学習において、ハイパーパラメータ調整(ハイパーパラメータ最適化とも呼ばれる)は、学習アルゴリズムに対して最適なハイパーパラメータの集合を選択する問題である。ハイパーパラメータは、学習プロセスを制御する値を持つパラメータであり、訓練開始前に設定する必要がある。これに対し、モデルパラメータは訓練中に学習される。目標は、所与のデータセット上で事前定義された損失関数を最小化する最適なモデルをもたらすハイパーパラメータの集合を決定することである。目的関数はハイパーパラメータの集合を受け取り、関連する損失を返す。交差検証は、汎化性能を推定し、選択プロセスを導くためにしばしば使用される。
ハイパーパラメータ調整はモデル訓練とは異なる。訓練はStochastic Gradient Descent VariantsやAdam (Optimizer)などの最適化アルゴリズムを用いて内部の重みを調整する一方、調整はより高次のレベルで動作し、Learning Rate Scheduling、Neural network内の層数、Dropoutの強度などの要素の値を設定する。効果的な調整は良好な性能を達成するために不可欠であり、不適切に選択されたハイパーパラメータは、訓練データの質やモデルアーキテクチャの洗練度に関係なく、過小適合や過適合を引き起こす可能性がある。
グリッドサーチ
ハイパーパラメータ最適化の伝統的な方法はグリッドサーチ、またはパラメータスイープであり、手動で指定されたハイパーパラメータ空間の部分集合を網羅的に探索する。グリッドサーチアルゴリズムは、通常、訓練セット上の交差検証またはホールドアウト検証セット上の評価によって測定される性能指標によって導かれる。パラメータ空間には実数値や非有界な値が含まれる可能性があるため、手動の境界と離散化がしばしば必要となる。
例えば、RBFカーネルを持つ典型的なソフトマージンサポートベクターマシンには、少なくとも2つのハイパーパラメータがある。正則化定数Cとカーネルハイパーパラメータγである。両方とも連続値であるため、グリッドサーチはそれぞれに対して有限の値の集合を選択する。例えば、C ∈ {10, 100, 1000}、γ ∈ {0.1, 0.2, 0.5, 1.0}などである。そして、直積内の各ペア(C, γ)でSVMを訓練し、性能を評価する。グリッドサーチは次元の呪いに悩まされるが、ハイパーパラメータ設定が独立しているため、しばしば容易に並列化可能である。
ランダムサーチ
ランダムサーチは、網羅的な列挙をハイパーパラメータの組み合わせをランダムに選択することで置き換える。離散空間、連続空間、混合空間に適用できる。グリッドサーチに対する利点は、連続ハイパーパラメータに対してより多くの値を探索できることである。特に、少数のハイパーパラメータだけが最終性能に大きく影響する場合(低い本質的次元性として知られる状況)には、グリッドサーチよりも優れた性能を発揮できる。ランダムサーチも容易に並列化可能であり、サンプリング分布を指定することで事前知識を取り入れることができる。その単純さにもかかわらず、新しいハイパーパラメータ最適化手法を比較するための重要なベースラインであり続けている。
ベイズ最適化
ベイズ最適化は、ノイズのあるブラックボックス関数に対する大域的最適化手法である。ハイパーパラメータ調整に適用すると、ハイパーパラメータ値を検証セット上の目的関数にマッピングする関数の確率モデルを構築する。現在のモデルに基づいて有望な構成を反復的に評価し、モデルを更新することで、ベイズ最適化は関数とその最適点の位置に関する情報を明らかにする観測を収集することを目指す。これは、探索(結果が不確実なハイパーパラメータ)と活用(最適点の近くにあると期待されるハイパーパラメータ)のバランスを取る。実際には、ベイズ最適化は、実験を実行する前にその品質を推論する能力により、グリッドサーチやランダムサーチよりも少ない評価回数でより良い結果を得ることが多い。
勾配ベース最適化
特定の学習アルゴリズムに対しては、ハイパーパラメータに関する勾配を計算し、勾配降下法を用いて最適化することが可能である。これらの手法の最初の使用はニューラルネットワークに焦点を当てており、その後、サポートベクターマシンやロジスティック回帰などのモデルに拡張されてきた。1つのアプローチは、自動微分を用いて反復最適化アルゴリズムのステップを微分するものである。より最近の研究では、陰関数定理を用いてハイパー勾配を計算し、逆ヘッセ行列の安定した近似を提案しており、一定のメモリで数百万のハイパーパラメータにスケーリングする。
別のアプローチでは、ハイパーネットワークを訓練して最良応答関数を近似する。これは離散ハイパーパラメータを扱うことができる。自己調整ネットワークは、ハイパーネットワークのコンパクトな表現を選択することでメモリ効率の良いバージョンを提供する。最近では、Δ-STNがハイパーネットワークを再パラメータ化して訓練を高速化し、最良応答ヤコビアンのより良い近似を得ることでこれを改善した。勾配ベース手法は、ニューラルアーキテクチャ探索で広く使用されているように、連続緩和を採用することで離散ハイパーパラメータも最適化できる。
進化的最適化
進化的最適化は、ノイズのあるブラックボックス関数の大域的最適化のための方法論であり、進化的アルゴリズムを用いてハイパーパラメータ空間を探索する。これは生物学的進化に触発されたプロセスに従う。ランダムな解の初期集団(通常100以上のハイパーパラメータタプル)を作成し、その適合度(例えば10分割交差検証の精度)を評価し、適合度でランク付けし、選択、交叉、突然変異を通じて新しい集団を生成する。この反復プロセスは停止基準が満たされるまで続く。進化的手法は堅牢であり、複雑で非微分可能な探索空間を扱うことができ、機械学習モデル、特に深層学習や大規模言語モデルで使用されるもののハイパーパラメータ調整に適している。
実用的な考慮事項
ハイパーパラメータ調整は、人工知能システムの開発における重要なステップである。方法の選択は、計算予算、ハイパーパラメータ空間の次元、モデルの性質に依存する。生成AIで使用されるトランスフォーマーなどの高コストなモデルでは、サンプル効率の良さからベイズ最適化がしばしば好まれる。より単純なモデルや並列リソースが豊富な場合には、ランダムサーチやグリッドサーチで十分なことがある。調整のためのツールやフレームワークは広く利用可能であり、バッチ正規化や他の訓練技術と統合するものなど、より効率的な方法への研究が続けられている。