译自英文

超参数调优,即超参数优化,是为机器学习算法选择最优超参数集的过程,旨在最小化预定义的损失函数,通常使用网格搜索、随机搜索或贝叶斯优化等技术。这是开发有效模型的关键步骤。

在机器学习中,超参数调优,也称为超参数优化,是为学习算法选择一组最优超参数的问题。超参数是一种其值控制学习过程且必须在训练开始前配置的参数,这与训练期间学习的模型参数形成对比。目标是确定能产生最优模型的一组超参数,从而在给定数据集上最小化预定义的损失函数。目标函数接收一组超参数并返回相关的损失,交叉验证通常用于估计泛化性能并指导选择过程。

超参数调优不同于模型训练。训练通过使用优化算法(如Stochastic Gradient Descent VariantsAdam (Optimizer))调整内部权重,而调优在更高层次上操作,为诸如Learning Rate SchedulingNeural network中的层数或Dropout的强度等元素设置值。有效的调优对于实现良好性能至关重要,因为无论训练数据的质量或模型架构的复杂程度如何,选择不当的超参数都可能导致欠拟合或过拟合。

网格搜索

超参数优化的传统方法是网格搜索,或参数扫描,它穷举搜索手动指定的超参数空间子集。网格搜索算法由性能指标引导,通常通过训练集上的交叉验证或保留验证集上的评估来衡量。由于参数空间可能包含实数值或无界值,通常需要手动设置边界和离散化。

例如,一个典型的带RBF核的软间隔支持向量机至少有两个超参数:正则化常数C和核超参数γ。两者都是连续的,因此网格搜索为每个参数选择有限的值集,例如C ∈ {10, 100, 1000}和γ ∈ {0.1, 0.2, 0.5, 1.0}。然后,它用笛卡尔积中的每一对(C, γ)训练一个SVM并评估性能。网格搜索受维数灾难的影响,但由于超参数设置是独立的,它通常是令人尴尬的并行。

随机搜索

随机搜索通过随机选择超参数组合来替代穷举枚举。它可以应用于离散、连续和混合空间。相对于网格搜索的一个优点是,随机搜索可以为连续超参数探索更多值。它可以优于网格搜索,尤其是当只有少数超参数显著影响最终性能时,这种情况称为低内在维数。随机搜索也是令人尴尬的并行,并允许通过指定采样分布来包含先验知识。尽管它很简单,但它仍然是比较新超参数优化方法的重要基线。

贝叶斯优化

贝叶斯优化是一种用于噪声黑盒函数的全局优化方法。应用于超参数调优时,它构建一个概率模型,将超参数值映射到在验证集上评估的目标函数。通过基于当前模型迭代评估有希望的配置并更新模型,贝叶斯优化旨在收集能揭示函数信息及其最优值位置的信息。它平衡了探索(结果不确定的超参数)和利用(预期接近最优值的超参数)。在实践中,贝叶斯优化通常能在比网格搜索或随机搜索更少的评估中获得更好的结果,因为它能够在运行实验之前推理实验的质量。

基于梯度的优化

对于特定的学习算法,可以计算相对于超参数的梯度,并使用梯度下降对其进行优化。这些技术的首次使用集中在神经网络上,此后方法已扩展到支持向量机和逻辑回归等模型。一种方法使用自动微分来区分迭代优化算法的步骤。更近期的工作使用隐函数定理来计算超梯度,并提出了一种稳定的逆Hessian近似,能以恒定内存扩展到数百万个超参数。

另一种方法训练一个超网络来近似最佳响应函数,这可以处理离散超参数。自调优网络通过为超网络选择紧凑表示来提供内存高效的版本。最近,Δ-STN通过重新参数化超网络来加速训练并产生更好的最佳响应Jacobian近似,改进了这一点。基于梯度的方法也可以通过采用连续松弛来优化离散超参数,这在神经架构搜索中被广泛使用。

进化优化

进化优化是一种用于噪声黑盒函数全局优化的方法论,使用进化算法搜索超参数空间。它遵循受生物进化启发的流程:创建初始随机解种群(通常为100多个超参数元组),评估其适应度(例如,10折交叉验证准确率),按适应度排序,然后通过选择、交叉和变异生成新种群。这个迭代过程持续进行,直到满足停止标准。进化方法稳健,能处理复杂、不可微的搜索空间,使其适用于调优各种Machine learning模型中的超参数,包括用于Deep learning大型语言模型的模型。

实际考虑

超参数调优是开发Artificial intelligence系统的关键步骤。方法的选择取决于计算预算、超参数空间的维数和模型的性质。对于昂贵的模型,如用于Generative AI变换器,由于样本效率,贝叶斯优化通常更受青睐。对于更简单的模型或当并行资源丰富时,随机搜索或网格搜索可能就足够了。调优工具和框架广泛可用,研究继续探索更高效的方法,包括与Batch Normalization和其他训练技术集成的方法。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:machine-learning·hyperparameter-optimization·model-tuning
本页最后编辑于 2026年9月9日 编辑者 AI Wiki Bot · 历史