ハイパーパラメータ最適化(ハイパーパラメータチューニングとも呼ばれる)は、学習アルゴリズムにとって最適なハイパーパラメータの集合を選択する問題である。ハイパーパラメータとは、学習プロセスを制御する値を持つパラメータであり、トレーニング開始前に設定する必要がある。目標は、与えられたデータセット上の定義済み損失関数を最小化する最適なモデルを生み出すハイパーパラメータ集合を見つけることである。目的関数はハイパーパラメータの集合を受け取り、関連する損失を返す。損失は、汎化性能を最大化するために、しばしば交差検証によって推定される。
ハイパーパラメータ最適化は、機械学習と深層学習における中核的なタスクであり、ニューラルネットワークやトランスフォーマーなどのモデルは、学習率、バッチサイズ、正則化強度などの設定に依存する。トレーニング中に学習されるモデルパラメータとは異なり、ハイパーパラメータは事前に設定され、モデルの性能に大きな影響を与える。検索プロセスは、特に大規模モデルでは計算コストが高くなる可能性があるが、効率と有効性のバランスを取るために様々な戦略が開発されてきた。
グリッドサーチ
グリッドサーチ(パラメータスイープとも呼ばれる)は、ハイパーパラメータ最適化の伝統的な方法である。これは、手動で指定されたハイパーパラメータ空間の部分集合を網羅的に探索する。グリッドサーチアルゴリズムは、通常、トレーニングセット上の交差検証またはホールドアウト検証セット上の評価によって測定される性能指標に基づいて導かれる。ハイパーパラメータ空間には実数値や非有界値が含まれる可能性があるため、手動の境界と離散化がしばしば必要となる。
例えば、RBFカーネルを持つソフトマージンサポートベクターマシンには、少なくとも2つのハイパーパラメータがある:正則化定数Cとカーネルハイパーパラメータγである。両方とも連続値であるため、グリッドサーチは有限集合、例えばC ∈ {10, 100, 1000} とγ ∈ {0.1, 0.2, 0.5, 1.0} を選択する。アルゴリズムは、デカルト積内の各ペア (C, γ) に対してSVMをトレーニングし、検証セット上の性能を評価し、最高スコアを持つ設定を出力する。
グリッドサーチは次元の呪いに悩まされる。評価回数がハイパーパラメータの数に応じて指数関数的に増加するためである。しかし、評価は独立しているため、しばしばembarrassingly parallelであり、複数のプロセッサやマシンに簡単に分散できる。
ランダムサーチ
ランダムサーチは、網羅的な列挙をランダムにハイパーパラメータの組み合わせを選択することで置き換える。これは、離散空間、連続空間、混合空間に適用できる。グリッドサーチに対する主な利点は、連続ハイパーパラメータに対してより多くの値を探索できることであり、少数のハイパーパラメータだけが性能に大きく影響する場合(低い本質的次元性として知られる状況)には、しばしばグリッドサーチを上回る。
ランダムサーチもembarrassingly parallelであり、サンプリング分布を指定することで事前知識を取り入れることができる。その単純さにもかかわらず、新しいハイパーパラメータ最適化手法が比較される重要なベースラインであり続けている。その有効性は、すべてのハイパーパラメータが等しく重要ではないという事実と、ランダムサンプリングが高次元空間をより効率的にカバーすることに由来する。
ベイズ最適化
ベイズ最適化は、ノイズの多いブラックボックス関数に対する大域的最適化手法である。ハイパーパラメータ最適化に適用すると、ハイパーパラメータ値から検証セット上で評価された目的関数へのマッピングの確率モデルを構築する。有望な構成を反復的に評価し、モデルを更新することで、関数とその最適値の位置についてできるだけ多くの情報を明らかにする観測を収集することを目指す。
ベイズ最適化は、探索(結果が不確実なハイパーパラメータ)と活用(最適値の近くにあると期待されるハイパーパラメータ)のバランスを取る。実際には、実験の品質を実行前に推論する能力により、グリッドサーチやランダムサーチよりも少ない評価回数でより良い結果を得る。一般的な実装では、ガウス過程や木構造パルゼン推定器を使用し、OpenAIのツールやGoogle CloudのAIプラットフォームなどのフレームワークで広く使用されている。
勾配ベースの最適化
特定の学習アルゴリズムでは、ハイパーパラメータに関する勾配を計算し、勾配降下法を使用して最適化することが可能である。初期の研究はニューラルネットワークに焦点を当てていたが、サポートベクターマシンやロジスティック回帰にも拡張されている。1つのアプローチは、反復最適化アルゴリズムのステップを自動微分を使用して微分することである。より最近の研究では、陰関数定理を使用してハイパー勾配を計算し、逆ヘッセ行列の安定した近似を用いて、数百万のハイパーパラメータに一定のメモリでスケーリングする。
別のアプローチでは、ハイパーネットワークをトレーニングして最良応答関数を近似し、離散ハイパーパラメータを扱うことができる。自己調整ネットワークは、コンパクトな表現を選択することでメモリ効率の良いバージョンを提供する。Δ-STNは、ハイパーネットワークを再パラメータ化し、重みに関してネットワークを線形化することでこれをさらに改善し、トレーニングを高速化し、最良応答ヤコビアンのより良い近似を得る。勾配ベースの手法は、ニューラルアーキテクチャ検索で使用されるように、連続緩和を介して離散ハイパーパラメータを最適化することもできる。
進化的最適化
進化的最適化は、生物学的進化に触発された進化的アルゴリズムを使用してハイパーパラメータ空間を探索する。プロセスは、ランダムなハイパーパラメータタプルの初期集団(通常100以上)から始まり、その適合度(例えば10分割交差検証精度)を評価し、ランク付けし、次に最良の個体を選択、突然変異、再結合して新しい世代を作成する。このサイクルは、停止基準が満たされるまで繰り返される。
進化的手法は、ノイズの多いブラックボックス関数に対して堅牢であり、複雑で高次元の空間を扱うことができる。目的関数が微分不可能である場合や事前知識が限られている場合に特に有用である。しかし、多くの評価を必要とするため計算集約的になる可能性があり、大規模モデルには法外なコストがかかるかもしれない。それにもかかわらず、様々な領域でのハイパーパラメータ最適化の実行可能な選択肢であり続けている。
実用的な考慮事項
ハイパーパラメータ最適化は、大規模言語モデルのトレーニングからAWSやAzureへのモデル展開まで、実世界のアプリケーションで重要である。手法の選択は、予算、ハイパーパラメータの数、各評価のコストに依存する。小規模な予算では、ランダムサーチやベイズ最適化が好まれることが多い。大規模なチューニングでは、分散および並列アプローチが不可欠である。
自動機械学習(AutoML)プラットフォームは、これらの手法を統合してモデル開発を効率化する。例えば、Alibaba CloudやOracle Cloudは、ハイパーパラメータチューニングを自動化するサービスを提供している。さらに、MIT CSAILやStanford AI Labなどの研究機関は最適化アルゴリズムの進歩に貢献し、Google DeepMindやAnthropicなどの企業は最先端のモデルにそれらを適用している。
課題と今後の方向性
ハイパーパラメータ最適化は、数百万のパラメータを持つ深層学習モデルにとって特に、高い計算コストなどの課題に直面している。探索空間は広大であり、単一の構成の評価に数時間のトレーニングが必要な場合がある。早期停止や多忠実度最適化などの技術は、不良な構成を早期に破棄することでコストを軽減するのに役立つ。
今後の方向性には、以前のタスクからの事前知識が最適化を高速化するメタ学習や、アーキテクチャとハイパーパラメータの両方を最適化するニューラルアーキテクチャ検索が含まれる。モデルが成長するにつれて、効率的な最適化がますます重要になり、モデルプルーニングやデータ拡張などの分野での研究を促進して負担を軽減する。この分野は進化し続けており、学界と産業界の両方から新しい手法が登場している。