La selección de instancias, también conocida como reducción de conjuntos de datos o condensación de conjuntos de datos, es un paso de preprocesamiento de datos aplicado en muchas tareas de aprendizaje automático y minería de datos. Su propósito principal es reducir el conjunto de datos original a un volumen manejable, disminuyendo así los recursos computacionales necesarios para el proceso de aprendizaje. Además, los algoritmos de selección de instancias pueden eliminar instancias ruidosas antes del aprendizaje, lo que puede mejorar la precisión en problemas de clasificación. El resultado óptimo es el subconjunto mínimo de datos que logra la misma tarea sin pérdida de rendimiento en comparación con el uso del conjunto de datos completo, lo que requiere un equilibrio entre la tasa de reducción y la calidad de clasificación.
Categorías de algoritmos
Los algoritmos de selección de instancias se agrupan según el tipo de instancias que conservan. Una clase se centra en instancias límite, que se encuentran cerca de las fronteras de decisión de las clases. Los algoritmos de este grupo incluyen DROP3, ICF y LSBo. Otra clase conserva instancias internas, que son centrales para cada clase; ejemplos incluyen ENN y LSSm. Estos algoritmos de selección interna se utilizan a menudo para filtrar instancias dañinas o ruidosas, y pueden servir como pasos de preprocesamiento para métodos de selección de límites. Por ejemplo, ENN es el primer paso en DROP3, y LSSm es utilizado por LSBo.
Una tercera categoría selecciona las instancias más densas dentro de vecindarios arbitrarios, potencialmente incluyendo tanto puntos límite como internos. Algoritmos como LDIS, CDIS y XLDIS pertenecen a esta categoría. LDIS y CDIS son simples y producen subconjuntos altamente representativos de los datos originales. Debido a que buscan instancias representativas por separado dentro de cada clase, son más rápidos en complejidad temporal y tiempo de ejecución efectivo que algoritmos como DROP3 e ICF.
Enfoques basados en prototipos
Algunos algoritmos no seleccionan instancias reales, sino que generan prototipos sintéticos. PSSA, PSDSP y PSSP utilizan la noción de partición espacial, específicamente hiperrectángulos, para identificar instancias similares y extraer un prototipo para cada grupo. Estos enfoques pueden adaptarse para seleccionar instancias reales también; el algoritmo ISDSP sigue una estrategia similar pero elige instancias reales en lugar de prototipos.
Aplicaciones y compensaciones
La selección de instancias es valiosa en escenarios con grandes conjuntos de datos donde el tiempo de entrenamiento y el uso de memoria son preocupaciones significativas. Al reducir el conjunto de datos, permite un entrenamiento de modelos más rápido y puede mejorar la generalización al eliminar ruido. Sin embargo, una reducción agresiva corre el riesgo de perder instancias informativas, degradando potencialmente el rendimiento de clasificación. El equilibrio entre la tasa de reducción y la precisión es central para evaluar cualquier estrategia de selección de instancias.
Relación con otras técnicas
La selección de instancias es distinta de la aumentación de datos, que genera nuevas muestras sintéticas para expandir el conjunto de datos, y del poda de modelos, que reduce la complejidad del modelo después del entrenamiento. También es diferente de la selección de características, que reduce el número de atributos en lugar de instancias. En la práctica, la selección de instancias se combina a menudo con otros pasos de preprocesamiento para optimizar el flujo de trabajo general de aprendizaje automático.
Evaluación y consideraciones prácticas
Las métricas de evaluación comunes incluyen la tasa de reducción, que mide la proporción de instancias eliminadas, y la precisión de clasificación en un conjunto de prueba reservado. La elección del algoritmo depende de la distribución de los datos y de los objetivos específicos, como la eliminación de ruido versus la reducción máxima. Algoritmos como ENN son efectivos para limpiar conjuntos de datos ruidosos, mientras que métodos basados en límites como DROP3 buscan retener fronteras de decisión críticas. El costo computacional del proceso de selección en sí mismo también es un factor, con métodos más simples como LDIS siendo preferidos para conjuntos de datos muy grandes.
Direcciones futuras
La investigación continúa explorando métodos de selección de instancias más eficientes y escalables, particularmente para datos de alta dimensionalidad y aplicaciones de aprendizaje profundo. Hay interés en integrar la selección de instancias con flujos de trabajo de entrenamiento de redes neuronales, donde reducir el conjunto de datos puede acelerar el entrenamiento sin pérdida significativa de precisión. A medida que los conjuntos de datos crecen en tamaño y complejidad, la selección de instancias sigue siendo una herramienta relevante para gestionar recursos computacionales en sistemas de inteligencia artificial.