El aprendizaje basado en instancias, también llamado aprendizaje basado en memoria, es una familia de algoritmos de aprendizaje automático que realizan predicciones comparando nuevas instancias de problemas con instancias de entrenamiento previamente vistas almacenadas en memoria. Debido a que el cálculo se pospone hasta que se observa una nueva instancia, estos algoritmos a veces se denominan "perezosos". Esto contrasta con los métodos de aprendizaje ansioso, que construyen un modelo generalizado durante el entrenamiento y luego descartan los datos sin procesar.
El enfoque se denomina basado en instancias porque construye hipótesis directamente a partir de las propias instancias de entrenamiento, en lugar de derivar una función o un conjunto de reglas separado. Es una técnica central en campos como el reconocimiento de patrones y la minería de datos, y sustenta muchos sistemas prácticos donde los datos de entrenamiento son abundantes pero la interpretabilidad del modelo es menos crítica.
Método
Un ejemplo de algoritmo de aprendizaje basado en instancias es el algoritmo de los k vecinos más cercanos (k-NN). Almacena un subconjunto de su conjunto de entrenamiento; al predecir un valor o clase para una nueva instancia, calcula distancias o similitudes entre esta instancia y las instancias de entrenamiento para tomar una decisión. Para la clasificación, las k instancias más cercanas se pueden combinar mediante votación por mayoría o votación ponderada por distancia; para la regresión, sus valores objetivo se pueden combinar mediante una media o una media ponderada.
La elección de la métrica de distancia y la escala de características puede cambiar qué instancias se identifican como más cercanas. Las métricas comunes incluyen la distancia euclidiana, la distancia de Manhattan y la distancia de Minkowski, que generaliza ambas. La escala de características, como la normalización o la estandarización, garantiza que las dimensiones con rangos más grandes no dominen el cálculo de la distancia. Otros métodos basados en instancias incluyen la regresión ponderada localmente, el razonamiento basado en casos y variantes de aprendizaje curricular que organizan los ejemplos de entrenamiento por dificultad.
Características Computacionales
La complejidad de la hipótesis puede crecer con los datos. En el peor de los casos, una hipótesis es una lista de n elementos de entrenamiento, y la complejidad computacional de clasificar una sola instancia nueva es O(n) si el costo de comparar dos instancias se trata como constante. Diferir el cálculo hace que el entrenamiento sea económico, pero traslada el cálculo al momento de la predicción.
Para un clasificador k-NN básico que utiliza una distancia de Minkowski simple, la búsqueda exhaustiva sobre n muestras almacenadas descritas por d características toma O(dn) tiempo. Un árbol k-d equilibrado puede reducir el tiempo de recuperación a O(d log n), aunque esta ventaja disminuye a medida que crece el número de características. En espacios de alta dimensión, la "maldición de la dimensionalidad" puede degradar el rendimiento, ya que las distancias se vuelven menos discriminativas. Para reducir el almacenamiento requerido para las instancias de entrenamiento y la sensibilidad al ruido en el conjunto de entrenamiento, se han propuesto algoritmos de reducción de instancias, como el vecino más cercano condensado y el vecino más cercano editado, que eliminan puntos redundantes o ruidosos.
Aplicaciones y Variantes
El aprendizaje basado en instancias se utiliza ampliamente en sistemas de recomendación, diagnóstico médico y detección de anomalías. En aplicaciones de inteligencia artificial, sirve como referencia para evaluar modelos más complejos como redes de aprendizaje profundo. Las variantes incluyen k-NN ponderado, donde los vecinos más cercanos tienen mayor influencia, y métodos basados en prototipos que agrupan los datos de entrenamiento en ejemplares representativos. Para conjuntos de datos a gran escala, a menudo se emplean técnicas de búsqueda aproximada del vecino más cercano, como el hashing sensible a la localidad, para acelerar la recuperación.
Relación con Otros Paradigmas de Aprendizaje
A diferencia de las redes neuronales o los transformadores utilizados en los grandes modelos de lenguaje modernos, los métodos basados en instancias no requieren optimización iterativa sobre parámetros. Son no paramétricos, lo que significa que la complejidad del modelo crece con el número de instancias de entrenamiento. Esto los hace fáciles de actualizar con nuevos datos, pero intensivos en memoria para conjuntos de datos masivos. En contraste, los métodos de aprendizaje ansioso como las redes residuales o las arquitecturas U-Net comprimen la información en parámetros de tamaño fijo, lo que permite una inferencia más rápida a costa de un reentrenamiento para las actualizaciones.
Limitaciones y Extensiones
Una limitación clave es el costo computacional en el momento de la predicción, especialmente con datos de alta dimensión. La reducción de instancias y las estructuras de indexación mitigan esto, pero introducen una sobrecarga. La sensibilidad a características irrelevantes y al ruido se puede abordar mediante la ponderación de características o el aprendizaje de métricas de distancia. Extensiones como la aumentación de datos pueden generar instancias sintéticas para mejorar la robustez. En la práctica, el aprendizaje basado en instancias sigue siendo una herramienta valiosa para conjuntos de datos pequeños y medianos y para problemas donde la interpretabilidad y el aprendizaje incremental son prioridades.