译自英文

超参数优化是为机器学习算法选择最优超参数的过程,旨在通过网格搜索、随机搜索和贝叶斯优化等技术,最小化数据集上的损失。

超参数优化,亦称超参数调优,是指为学习算法选择一组最优超参数的问题。超参数是一种其值控制学习过程且必须在训练开始前配置的参数。目标是找到能产生最优模型的超参数集合,在给定数据集上最小化预定义的损失函数。目标函数接收一组超参数并返回相关的损失,通常通过交叉验证来估计,以最大化泛化性能。

超参数优化是机器学习深度学习中的核心任务,其中诸如神经网络Transformer等模型依赖于学习率、批量大小和正则化强度等设置。与训练期间学习到的模型参数不同,超参数是预先设定的,并显著影响模型性能。搜索过程可能计算成本高昂,尤其是对于大型模型,但已开发出多种策略来平衡效率与效果。

网格搜索

网格搜索,或称参数扫描,是超参数优化的传统方法。它穷举搜索手动指定的超参数空间子集。网格搜索算法由性能指标引导,通常通过在训练集上的交叉验证或对留出验证集的评估来衡量。由于超参数空间可能包含实数值或无界值,通常需要手动设定边界和离散化。

例如,具有RBF核的软间隔支持向量机至少有两个超参数:正则化常数C和核超参数γ。两者都是连续的,因此网格搜索选择有限集合,如C ∈ {10, 100, 1000}和γ ∈ {0.1, 0.2, 0.5, 1.0}。算法对笛卡尔积中的每一对(C, γ)训练一个SVM,并在验证集上评估性能,输出得分最高的设置。

网格搜索受维数灾难影响,因为评估次数随超参数数量呈指数增长。然而,由于评估相互独立,它通常具有令人尴尬的并行性,易于在多个处理器或机器上分布。

随机搜索

随机搜索通过随机选择超参数组合来替代穷举枚举。它可应用于离散、连续和混合空间。与网格搜索相比,一个关键优势是随机搜索可以为连续超参数探索更多值,当只有少数超参数显著影响性能时(即低内在维数情况),通常优于网格搜索。

随机搜索同样具有令人尴尬的并行性,并允许通过指定采样分布来纳入先验知识。尽管简单,它仍然是新超参数优化方法比较的重要基线。其有效性源于并非所有超参数都同等重要,且随机采样在高维空间中覆盖空间更高效。

贝叶斯优化

贝叶斯优化是一种针对噪声黑盒函数的全局优化方法。应用于超参数优化时,它构建从超参数值到验证集上评估目标的概率模型。通过迭代评估有希望的配置并更新模型,旨在收集尽可能多关于函数及其最优位置的信息。

贝叶斯优化平衡探索(结果不确定的超参数)和利用(预期接近最优的超参数)。在实践中,由于能在运行实验前推理实验质量,它比网格搜索或随机搜索用更少评估获得更好结果。常见实现使用高斯过程或树结构帕森估计器,并广泛用于如OpenAI工具和Google Cloud AI平台等框架中。

基于梯度的优化

对于特定学习算法,可以计算关于超参数的梯度,并使用梯度下降进行优化。早期工作集中于神经网络,但方法已扩展到支持向量机和逻辑回归。一种方法使用自动微分对迭代优化算法的步骤进行微分。近期工作使用隐函数定理计算超梯度,并采用逆Hessian的稳定近似,能以恒定内存扩展到数百万超参数。

另一种方法训练超网络来近似最佳响应函数,可处理离散超参数。自调优网络通过选择紧凑表示提供内存高效版本。Δ-STN通过重新参数化超网络并在权重中线性化网络进一步改进,加速训练并产生更好的最佳响应雅可比近似。基于梯度的方法还可通过连续松弛优化离散超参数,如神经架构搜索中所用。

进化优化

进化优化使用进化算法搜索超参数空间,灵感来自生物进化。过程始于随机超参数元组的初始种群(通常为100或更多),评估其适应度(如10折交叉验证准确率),排序,然后选择、变异和重组最佳表现者以创建新一代。此循环重复直至达到停止标准。

进化方法对噪声黑盒函数具有鲁棒性,并能处理复杂高维空间。当目标不可微或先验知识有限时,它们特别有用。然而,它们可能计算密集,需要大量评估,这可能对大型模型构成障碍。尽管如此,它们仍是各领域超参数优化的可行选项。

实际考虑

超参数优化在现实应用中至关重要,从训练大型语言模型到在AWSAzure上部署模型。方法选择取决于预算、超参数数量和每次评估的成本。对于小预算,随机搜索或贝叶斯优化通常更受青睐。对于大规模调优,分布式和并行方法必不可少。

自动化机器学习(AutoML)平台整合这些技术以简化模型开发。例如,阿里云Oracle Cloud提供自动化超参数调优服务。此外,MIT CSAIL斯坦福AI实验室等研究机构为推进优化算法做出贡献,而Google DeepMindAnthropic等公司将其应用于前沿模型。

挑战与未来方向

超参数优化面临高计算成本等挑战,尤其是对于具有数百万参数的深度学习模型。搜索空间可能巨大,评估单个配置可能需要数小时训练。早停和多保真优化等技术通过早期丢弃不良配置来缓解成本。

未来方向包括元学习(利用先前任务的知识加速优化)和神经架构搜索(同时优化架构和超参数)。随着模型增长,高效优化变得日益重要,推动模型剪枝数据增强等领域的研究以减轻负担。该领域持续发展,学术界和工业界不断涌现新方法。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:machine-learning·optimization·hyperparameter-tuning
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史