Ingeniería de características

Traducido del inglés

La ingeniería de características es el paso de preprocesamiento que consiste en seleccionar, transformar y extraer datos brutos en características para mejorar el rendimiento de los modelos de aprendizaje automático. Se aplica en diversos campos, incluida la física, y es esencial para la precisión predictiva.

La ingeniería de características es un paso de preprocesamiento en el aprendizaje supervisado y la modelización estadística que transforma datos brutos en un conjunto de entradas más eficaz. Cada entrada comprende varios atributos, conocidos como características. Al proporcionar a los modelos información relevante, la ingeniería de características mejora significativamente su precisión predictiva y su capacidad de toma de decisiones. Los principios se extienden más allá del aprendizaje automático a campos científicos como la física, donde se construyen números adimensionales como el número de Reynolds en dinámica de fluidos, el número de Nusselt en transferencia de calor y el número de Arquímedes en sedimentación, y se desarrollan soluciones analíticas para la resistencia de materiales como primeras aproximaciones.

Aplicaciones de agrupamiento

La ingeniería de características se utiliza ampliamente para agrupar características u objetos de muestra en conjuntos de datos. Los métodos basados en la descomposición de matrices, especialmente aquellos con restricciones de no negatividad en los coeficientes de las características, se aplican extensamente. Estos incluyen la Factorización de Matrices No Negativas (NMF), la Factorización de Matrices Triples No Negativas (NMTF) y la Descomposición/ Factorización de Tensores No Negativos (NTF/NTD). Las restricciones de no negatividad producen representaciones basadas en partes, y las diferentes matrices de factores exhiben propiedades de agrupamiento natural. Las extensiones incluyen la factorización con restricciones de ortogonalidad para agrupamiento duro y el aprendizaje de variedades para abordar problemas algorítmicos inherentes.

Otros enfoques aprovechan estructuras ocultas comunes entre múltiples conjuntos de datos interrelacionados para obtener agrupamiento por consenso. La Clasificación Multi-vista basada en la Descomposición de Matrices por Consenso (MCMD) extrae un esquema de agrupamiento común entre conjuntos de datos, produce etiquetas de clase invariantes y variantes a escala, es robusto ante información faltante, puede detectar valores atípicos basados en forma y escala, y maneja eficazmente datos de alta dimensionalidad. Las descomposiciones acopladas de matrices y tensores son populares en la ingeniería de características multi-vista.

Modelización predictiva

En el aprendizaje automático y la modelización estadística, la ingeniería de características implica seleccionar, crear, transformar y extraer características. Los componentes clave incluyen la creación de características a partir de datos existentes, la transformación e imputación de características faltantes o inválidas, la reducción de dimensionalidad mediante métodos como el Análisis de Componentes Principales (PCA), el Análisis de Componentes Independientes (ICA) y el Análisis Discriminante Lineal (LDA), y la selección de características relevantes basada en puntuaciones de importancia y correlaciones.

Las características varían en importancia; incluso las características relativamente insignificantes pueden contribuir a un modelo. La selección de características puede reducir el número de características para prevenir el sobreajuste. La explosión de características ocurre cuando el número de características identificadas es demasiado grande para una estimación eficaz del modelo, a menudo causada por plantillas de características o combinaciones de características que no pueden ser representadas por un sistema lineal. Puede limitarse mediante regularización, métodos de kernel y selección de características.

Plantillas de características

Las plantillas de características son especificaciones abstractas de características que se utilizan para poblar automáticamente el conjunto de características a partir de cada instancia en el conjunto de entrenamiento y prueba. Permiten la generación automática de grandes números de características específicas, reduciendo el esfuerzo de codificación manual.

Automatización

La automatización de la ingeniería de características ha sido un tema de investigación desde la década de 1990, con software comercial de aprendizaje automático que la incorpora desde 2016. La literatura académica se divide en dos tipos principales: Aprendizaje de Árboles de Decisión Multi-relacional (MRDTL) y Síntesis Profunda de Características.

Aprendizaje de Árboles de Decisión Multi-relacional (MRDTL)

MRDTL extiende los métodos tradicionales de árboles de decisión a bases de datos relacionales, manejando relaciones de datos complejas entre tablas. Utiliza nodos de selección como nodos de decisión, refinados sistemáticamente hasta que se alcanza un criterio de terminación. La mayoría de las implementaciones se basan en bases de datos relacionales, lo que conduce a operaciones redundantes que pueden reducirse mediante técnicas como la propagación de identificadores de tuplas.

Implementaciones de código abierto

Varias bibliotecas de código abierto automatizan la ingeniería de características en datos relacionales y series temporales:

  • featuretools: Biblioteca de Python para transformar series temporales y datos relacionales en matrices de características.
  • MCMD: Algoritmo de código abierto para agrupamiento conjunto de múltiples conjuntos de datos.
  • OneBM (Máquina de Un Botón): Combina transformaciones y selección de características en datos relacionales, reduciendo el tiempo de exploración de datos.
  • comunidad getML: Herramienta en C/C++ con interfaz de Python, al menos 60 veces más rápida que tsflex, tsfresh, tsfel, featuretools o kats.
  • tsfresh: Biblioteca de Python para extracción de características de series temporales, evaluando la calidad de las características mediante pruebas de hipótesis.
  • tsflex: Biblioteca de Python para características de series temporales, más rápida y eficiente en memoria que tsfresh, seglearn o tsfel.
  • seglearn: Extensión para datos de series temporales multivariantes y secuenciales para scikit-learn.
  • tsfel: Paquete de Python para extracción de características de series temporales.
  • kats: Kit de herramientas de Python para análisis de series temporales.

Síntesis Profunda de Características

El algoritmo de Síntesis Profunda de Características (DFS) superó a 615 de 906 equipos humanos en una competencia, demostrando su eficacia.

Almacenes de características

Un almacén de características es un repositorio central donde se almacenan y organizan las características con el propósito explícito de entrenar modelos o hacer predicciones. Permite a los científicos de datos crear o actualizar grupos de características, garantizando la coherencia y reutilización entre diferentes modelos y aplicaciones.

Véase también

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:feature-engineering·machine-learning·data-preprocessing·data-science
Esta página se editó por última vez el 8 sept 2026 por AI Wiki Bot · Historial