译自英文

实例选择是机器学习中的一个数据预处理步骤,通过选择具有代表性的子集来减小数据集规模,从而提高计算效率,并常通过移除噪声实例来提升分类准确性。

实例选择,也称为数据集缩减或数据集凝聚,是在许多机器学习和数据挖掘任务中应用的一种数据预处理步骤。其主要目的是将原始数据集缩减至可管理的规模,从而降低学习过程所需的计算资源。此外,实例选择算法可以在学习之前移除噪声实例,这能提高分类问题的准确性。最优结果是实现与使用整个数据集相比无性能损失的最小数据子集,这需要在缩减率与分类质量之间进行权衡。

算法类别

实例选择算法根据其保留的实例类型进行分组。一类关注边界实例,即位于类别决策边界附近的实例。该组中的算法包括DROP3、ICF和LSBo。另一类保留内部实例,即每个类别的中心实例;示例包括ENN和LSSm。这些内部选择算法通常用于过滤有害或噪声实例,并且可能作为边界选择方法的预处理步骤。例如,ENN是DROP3的第一步,而LSSm被LSBo使用。

第三类在任意邻域内选择最密集的实例,可能同时包含边界点和内部点。LDIS、CDIS和XLDIS等算法属于此类。LDIS和CDIS简单且生成的子集高度代表原始数据。由于它们分别在每个类别内搜索代表性实例,因此在时间复杂度和有效运行时间上比DROP3和ICF等算法更快。

基于原型的方法

一些算法不选择实际实例,而是生成合成原型。PSSA、PSDSP和PSSP使用空间划分的概念,特别是超矩形,来识别相似实例并为每组提取一个原型。这些方法可以调整以选择实际实例;算法ISDSP遵循类似策略,但选择真实实例而非原型。

应用与权衡

在训练时间和内存使用是重要关注点的大数据集场景中,实例选择具有价值。通过缩减数据集,它可以实现更快的模型训练,并通过消除噪声来改善泛化能力。然而,激进的缩减可能丢失信息丰富的实例,从而可能降低分类性能。缩减率与准确性之间的平衡是评估任何实例选择策略的核心。

与其他技术的关系

实例选择不同于数据增强,后者生成新的合成样本来扩展数据集,也不同于模型剪枝,后者在训练后减少模型复杂度。它也与特征选择不同,特征选择减少属性数量而非实例数量。在实践中,实例选择常与其他预处理步骤结合,以优化整体机器学习流程。

评估与实践考虑

常见评估指标包括缩减率(衡量移除实例的比例)和在保留测试集上的分类准确性。算法选择取决于数据分布和具体目标,如噪声移除或最大缩减。ENN等算法有效于清理噪声数据集,而基于边界的方法如DROP3旨在保留关键决策边界。选择过程本身的计算成本也是一个因素,对于非常大的数据集,LDIS等更简单的方法更受青睐。

未来方向

研究继续探索更高效和可扩展的实例选择方法,特别是针对高维数据和深度学习应用。人们有兴趣将实例选择与神经网络训练流程集成,其中缩减数据集可以加速训练而不会显著损失准确性。随着数据集规模和复杂性的增长,实例选择仍然是管理人工智能系统中计算资源的相关工具。

外部链接

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:machine-learning·data-preprocessing·dataset-reduction·classification
本页最后编辑于 2026年9月14日 编辑者 AI Wiki Bot · 历史