La ingeniería de características es un paso de preprocesamiento en el aprendizaje supervisado y la modelización estadística que transforma datos brutos en un conjunto de entradas más eficaz. Cada entrada comprende varios atributos, conocidos como características. Al proporcionar a los modelos información relevante, la ingeniería de características mejora significativamente su precisión predictiva y su capacidad de toma de decisiones. Los principios se extienden más allá del aprendizaje automático a campos científicos como la física, donde se construyen números adimensionales como el número de Reynolds en dinámica de fluidos, el número de Nusselt en transferencia de calor y el número de Arquímedes en sedimentación, y se desarrollan soluciones analíticas para la resistencia de materiales como primeras aproximaciones.
Aplicaciones de agrupamiento
La ingeniería de características se utiliza ampliamente para agrupar características u objetos de muestra en conjuntos de datos. Los métodos basados en la descomposición de matrices, especialmente aquellos con restricciones de no negatividad en los coeficientes de las características, se aplican extensamente. Estos incluyen la Factorización de Matrices No Negativas (NMF), la Factorización de Matrices Triples No Negativas (NMTF) y la Descomposición/ Factorización de Tensores No Negativos (NTF/NTD). Las restricciones de no negatividad producen representaciones basadas en partes, y las diferentes matrices de factores exhiben propiedades de agrupamiento natural. Las extensiones incluyen la factorización con restricciones de ortogonalidad para agrupamiento duro y el aprendizaje de variedades para abordar problemas algorítmicos inherentes.
Otros enfoques aprovechan estructuras ocultas comunes entre múltiples conjuntos de datos interrelacionados para obtener agrupamiento por consenso. La Clasificación Multi-vista basada en la Descomposición de Matrices por Consenso (MCMD) extrae un esquema de agrupamiento común entre conjuntos de datos, produce etiquetas de clase invariantes y variantes a escala, es robusto ante información faltante, puede detectar valores atípicos basados en forma y escala, y maneja eficazmente datos de alta dimensionalidad. Las descomposiciones acopladas de matrices y tensores son populares en la ingeniería de características multi-vista.
Modelización predictiva
En el aprendizaje automático y la modelización estadística, la ingeniería de características implica seleccionar, crear, transformar y extraer características. Los componentes clave incluyen la creación de características a partir de datos existentes, la transformación e imputación de características faltantes o inválidas, la reducción de dimensionalidad mediante métodos como el Análisis de Componentes Principales (PCA), el Análisis de Componentes Independientes (ICA) y el Análisis Discriminante Lineal (LDA), y la selección de características relevantes basada en puntuaciones de importancia y correlaciones.
Las características varían en importancia; incluso las características relativamente insignificantes pueden contribuir a un modelo. La selección de características puede reducir el número de características para prevenir el sobreajuste. La explosión de características ocurre cuando el número de características identificadas es demasiado grande para una estimación eficaz del modelo, a menudo causada por plantillas de características o combinaciones de características que no pueden ser representadas por un sistema lineal. Puede limitarse mediante regularización, métodos de kernel y selección de características.
Plantillas de características
Las plantillas de características son especificaciones abstractas de características que se utilizan para poblar automáticamente el conjunto de características a partir de cada instancia en el conjunto de entrenamiento y prueba. Permiten la generación automática de grandes números de características específicas, reduciendo el esfuerzo de codificación manual.
Automatización
La automatización de la ingeniería de características ha sido un tema de investigación desde la década de 1990, con software comercial de aprendizaje automático que la incorpora desde 2016. La literatura académica se divide en dos tipos principales: Aprendizaje de Árboles de Decisión Multi-relacional (MRDTL) y Síntesis Profunda de Características.
Aprendizaje de Árboles de Decisión Multi-relacional (MRDTL)
MRDTL extiende los métodos tradicionales de árboles de decisión a bases de datos relacionales, manejando relaciones de datos complejas entre tablas. Utiliza nodos de selección como nodos de decisión, refinados sistemáticamente hasta que se alcanza un criterio de terminación. La mayoría de las implementaciones se basan en bases de datos relacionales, lo que conduce a operaciones redundantes que pueden reducirse mediante técnicas como la propagación de identificadores de tuplas.
Implementaciones de código abierto
Varias bibliotecas de código abierto automatizan la ingeniería de características en datos relacionales y series temporales:
- featuretools: Biblioteca de Python para transformar series temporales y datos relacionales en matrices de características.
- MCMD: Algoritmo de código abierto para agrupamiento conjunto de múltiples conjuntos de datos.
- OneBM (Máquina de Un Botón): Combina transformaciones y selección de características en datos relacionales, reduciendo el tiempo de exploración de datos.
- comunidad getML: Herramienta en C/C++ con interfaz de Python, al menos 60 veces más rápida que tsflex, tsfresh, tsfel, featuretools o kats.
- tsfresh: Biblioteca de Python para extracción de características de series temporales, evaluando la calidad de las características mediante pruebas de hipótesis.
- tsflex: Biblioteca de Python para características de series temporales, más rápida y eficiente en memoria que tsfresh, seglearn o tsfel.
- seglearn: Extensión para datos de series temporales multivariantes y secuenciales para scikit-learn.
- tsfel: Paquete de Python para extracción de características de series temporales.
- kats: Kit de herramientas de Python para análisis de series temporales.
Síntesis Profunda de Características
El algoritmo de Síntesis Profunda de Características (DFS) superó a 615 de 906 equipos humanos en una competencia, demostrando su eficacia.
Almacenes de características
Un almacén de características es un repositorio central donde se almacenan y organizan las características con el propósito explícito de entrenar modelos o hacer predicciones. Permite a los científicos de datos crear o actualizar grupos de características, garantizando la coherencia y reutilización entre diferentes modelos y aplicaciones.
Véase también
- Machine learning
- Artificial intelligence
- Deep learning
- Neural network
- Large language model
- Transformer (architecture)
- Generative AI
- OpenAI
- Anthropic
- Google DeepMind
- Amazon Web Services
- Microsoft Azure
- Google Cloud
- Oracle Cloud Infrastructure
- Coreweave
- Cerebras
- Groq
- SambaNova
- Graphcore
- Xerox PARC
- MIT CSAIL
- Stanford AI Lab
- University of Toronto
- Carnegie Mellon University
- BAIR (Berkeley AI Research)
- University of Oxford
- Thomas G. Dietterich
- Michael I. Jordan
- Daphne Koller
- Anima Anandkumar
- Samy Bengio
- Joshua Tenenbaum
- Brendan Lake
- Melanie Mitchell
- Aaron Courville
- Aleksander Madry
- Alexei Efros
- Ali Rahimi
- Bernard Widrow
- Chris Bishop
- Christopher Bishop
- Craig Boutilier
- Elaine Rich
- Carlos Guestrin
- Daphne Leon
- David Ha
- David Winger
- Deepak Kumar
- drew puckett
- Eilon Reshef
- Freddie Sulit
- Jakob Uszkoreit
- Lukasz Kaiser
- Niki Parmar
- Barret Zoph
- Mark Chen
- Brad Lightcap
- Jacob Steinhardt
- David Kaplan
- ryan lowe
- Jack Clark
- Shan Carter
- David Luan
- Chen Wu
- Ashish Kumar
- Karen Simonyan
- Koray Kavukcuoglu
- Alan Perlis
- Andrew Lloyd Brown
- Ani Bhattacharya
- Anna Patterson
- Anna Ritter
- Anubhav Sinha
- Arakawa Ryota
- Arka Dutta
- arthur franz
- Ben Goertzel
- brian cheung
- Brian Christian
- Brian Lilly White
- Rafael Calvo
- Catherine Flick
- chad mirkin
- chin yen chiu
- craig ku
- Daphna Shron
- david froitzheim
- David Martin
- Deepak Kumar
- drew puckett
- Elaine Rich
- Eilon Reshef