abess (Adaptive Best Subset Selection, también ABESS) es un método de aprendizaje automático diseñado para abordar el problema de la selección del mejor subconjunto en el modelado estadístico. Dado un conjunto de datos y una tarea de predicción, determina qué características o variables son cruciales para un rendimiento óptimo del modelo. El método fue introducido por Zhu en 2020 y selecciona dinámicamente el tamaño del modelo de manera adaptativa, eliminando la necesidad de seleccionar parámetros de regularización. abess es aplicable en diversas tareas estadísticas y de aprendizaje automático, incluyendo la regresión lineal, el modelo de índice único y otros modelos predictivos comunes, y también puede aplicarse en bioestadística.
La innovación central de abess radica en su capacidad para realizar la selección del mejor subconjunto bajo una restricción de norma L0 con complejidad temporal polinómica, proporcionando estimaciones insesgadas y consistentes. A diferencia de los métodos de regularización tradicionales que requieren ajustar parámetros de penalización, abess determina adaptativamente el tamaño del conjunto de soporte mediante un algoritmo de intercambio iterativo, lo que lo hace particularmente atractivo para el análisis de datos de alta dimensión.
Forma Básica
La forma básica de abess aborda el problema de selección del subconjunto óptimo en la regresión lineal general. Es un método L0 caracterizado por una complejidad temporal polinómica y la propiedad de proporcionar estimaciones tanto insesgadas como consistentes. En el contexto de la regresión lineal, supongamos que tenemos conocimiento de n muestras independientes (x_i, y_i), i = 1, ..., n, donde x_i es un vector de dimensión p e y_i es una respuesta escalar. Definimos X como la matriz de diseño de n por p e y como el vector de respuesta de dimensión n. El modelo de regresión lineal general se expresa como y = Xβ + ε, donde β es el vector de coeficientes y ε es el término de error.
Para obtener los parámetros apropiados β, se considera la función de pérdida para la regresión lineal: L_n^LR(β; X, y) = (1/(2n)) ||y - Xβ||_2^2. En abess, el enfoque inicial es optimizar esta función de pérdida bajo la restricción L0, resolviendo el problema: minimizar L_n^LR(β; X, y) sujeto a ||β||_0 ≤ s, donde s representa el tamaño deseado del conjunto de soporte, y ||β||_0 = suma de indicadores (β_i ≠ 0) es la norma L0 del vector.
Algoritmo y Concepto de Sacrificio
Para abordar el problema de optimización, abess intercambia iterativamente un número igual de variables entre el conjunto activo y el conjunto inactivo. En cada iteración, se introduce el concepto de sacrificio. Para cada variable j en el conjunto activo, el sacrificio ξ_j se define como el aumento en la función de pérdida cuando la variable j se elimina del conjunto activo: ξ_j = L_n^LR(β_hat_{A \ {j}}) - L_n^LR(β_hat_A), donde A es el conjunto activo actual y β_hat_A es el vector de coeficientes estimado restringido a A.
El algoritmo procede calculando los sacrificios para todas las variables del conjunto activo, luego identifica las variables con los sacrificios más pequeños (aquellas que pueden eliminarse con un aumento mínimo de la pérdida). Simultáneamente, evalúa variables candidatas del conjunto inactivo que podrían añadirse. El paso de intercambio reemplaza las variables activas menos importantes con los candidatos inactivos más prometedores, manteniendo el tamaño de soporte s. Este proceso continúa hasta la convergencia, típicamente medida por el cambio en la función de pérdida o la estabilidad del conjunto activo.
Selección Adaptativa del Tamaño del Modelo
Una característica distintiva de abess es su selección adaptativa del tamaño del modelo s, lo que elimina la necesidad de validación cruzada o criterios de información para elegir el número de variables. El método comienza con un tamaño de soporte pequeño y lo aumenta gradualmente mientras monitorea la mejora en la función de pérdida. Utiliza un criterio basado en el equilibrio entre la bondad de ajuste y la complejidad del modelo, empleando a menudo un criterio de información bayesiano (BIC) modificado o una penalización similar que se adapta a los datos.
Este enfoque adaptativo es computacionalmente eficiente porque evita ajustar modelos para una cuadrícula de valores de s. En su lugar, abess aprovecha la trayectoria de soluciones a medida que s aumenta, reutilizando cálculos de iteraciones anteriores. El tamaño final del modelo se elige cuando la mejora marginal en el ajuste cae por debajo de un umbral, o cuando el criterio de información alcanza un mínimo.
Propiedades Teóricas
abess proporciona varias garantías teóricas que lo distinguen de otros métodos de selección de variables. Bajo condiciones de regularidad estándar, el método logra consistencia en la estimación y consistencia en la selección de variables, lo que significa que los coeficientes estimados convergen a los valores verdaderos y el conjunto de soporte seleccionado coincide con el conjunto activo verdadero con probabilidad tendiendo a uno a medida que crece el tamaño de la muestra. La complejidad temporal polinómica es una ventaja significativa sobre la selección exhaustiva del mejor subconjunto, que es NP-difícil en general.
La propiedad de insesgadez surge porque la penalización L0 no reduce los coeficientes de las variables seleccionadas, a diferencia de los métodos basados en L1 como el lasso, que introducen sesgo mediante la contracción. Esto hace que abess sea particularmente atractivo cuando las estimaciones insesgadas de los coeficientes son importantes para la interpretación o la inferencia posterior.
Aplicaciones en Regresión y Más Allá
abess es aplicable a una amplia gama de modelos estadísticos más allá de la regresión lineal. En el contexto del modelo de índice único, abess puede extenderse para seleccionar covariables relevantes mientras estima la función de enlace desconocida. El método se ha adaptado para modelos lineales generalizados, incluyendo regresión logística y de Poisson, donde la función de pérdida se modifica en consecuencia. En bioestadística, abess se ha utilizado para el descubrimiento de biomarcadores, donde identificar un pequeño conjunto de genes o variables clínicas predictivas es crucial.
El método también maneja escenarios de alta dimensión donde el número de predictores p puede superar en gran medida el tamaño de la muestra n. En tales escenarios, el mecanismo de selección adaptativa y el algoritmo de intercambio mantienen la viabilidad computacional mientras proporcionan una selección de variables fiable.
Implementación de Software
El método abess está implementado en un paquete de R de código abierto, también llamado abess, que proporciona funciones para regresión lineal, regresión logística y otros modelos. El paquete incluye código C++ eficiente para el algoritmo central, lo que lo hace adecuado para conjuntos de datos a gran escala. Los usuarios pueden especificar el tamaño máximo de soporte o dejar que el procedimiento adaptativo lo determine automáticamente. El paquete también ofrece herramientas de visualización para la trayectoria de soluciones y gráficos de diagnóstico.
Comparación con Otros Métodos
En comparación con los enfoques basados en regularización como el lasso y la red elástica, abess ofrece la ventaja de estimaciones insesgadas y selección automática del tamaño del modelo sin parámetros de ajuste. Sin embargo, puede ser computacionalmente más intensivo que el lasso para p muy grande, aunque la complejidad temporal polinómica mitiga esta preocupación. En comparación con algoritmos codiciosos como la búsqueda de correspondencia ortogonal, abess proporciona un mecanismo de intercambio más fundamentado que puede escapar de óptimos locales.
Limitaciones y Extensiones
Aunque abess es potente, asume que el modelo lineal o sus extensiones son válidos y que la restricción L0 es apropiada para el problema. Para relaciones altamente no lineales, pueden necesitarse extensiones que utilicen expansiones de bases o métodos de kernel. La investigación continúa sobre la extensión de abess a modelos más complejos, incluyendo arquitecturas de aprendizaje profundo y entornos de redes neuronales, donde la selección de características se integra en el proceso de entrenamiento.
Véase También
Referencias
Zhu, J. (2020). abess: Adaptive Best Subset Selection. (Artículo de introducción original)
Enlaces Externos
- Paquete R abess en CRAN (no enlazado aquí según las pautas)