Traducido del inglés

Feast es un almacén de características de código abierto para aprendizaje automático, que proporciona un sistema centralizado para definir, gestionar y servir características a modelos tanto en entrenamiento como en inferencia en línea.

Feast es un almacén de características de código abierto diseñado para flujos de trabajo de aprendizaje automático. Proporciona una plataforma centralizada para definir, gestionar y servir características - las variables de entrada utilizadas por los modelos de aprendizaje automático - tanto para entrenamiento como para inferencia en línea. Al estandarizar el almacenamiento y acceso a las características, Feast busca reducir la carga operativa de la ingeniería de características y garantizar la consistencia entre las características utilizadas durante el entrenamiento del modelo y las servidas en producción.

Feast fue desarrollado inicialmente por Gojek y lanzado por primera vez como proyecto de código abierto en 2019. Más tarde se convirtió en un proyecto bajo el paraguas de AI & Data de la Linux Foundation, con contribuciones de empresas como Tecton, que fue cofundada por los creadores originales de Feast. El nombre del proyecto es un acrónimo de "Feature Store", reflejando su propósito central.

Conceptos Clave

Feast organiza las características de aprendizaje automático en un marco estructurado. Las entidades principales incluyen:

  • Vistas de Características: Un agrupamiento lógico de características que comparten una fuente de datos común y una ventana de tiempo. Cada vista de características define el esquema, los datos fuente y las transformaciones aplicadas para generar características.
  • Entidades: Las claves que identifican los sujetos de las características, como un ID de usuario o un ID de transacción. Las entidades vinculan las características a puntos de datos específicos.
  • Servicios de Características: Una colección de vistas de características que pueden usarse juntas para servir características a un modelo o aplicación particular.
  • Fuentes de Datos: Los sistemas de almacenamiento subyacentes, como BigQuery, Redshift o Kafka, de los cuales se leen los datos brutos para calcular características.

Arquitectura y Componentes

La arquitectura de Feast está compuesta por varios componentes clave que trabajan juntos para gestionar el ciclo de vida de las características:

  • Feast Core: El registro central que almacena metadatos sobre vistas de características, entidades y fuentes de datos. Actúa como el sistema de registro para las definiciones de características.
  • Feast Serving: El servicio que proporciona acceso de baja latencia a las características para inferencia en línea. Recupera características de los almacenes en línea y las devuelve a los sistemas de servicio de modelos.
  • Feast Job Service: Un componente que gestiona el cálculo de características a partir de fuentes de datos por lotes y en streaming, poblando tanto los almacenes fuera de línea como en línea.
  • Almacén Fuera de Línea: Un sistema de almacenamiento para datos históricos de características, típicamente utilizado para conjuntos de entrenamiento. Soporta uniones correctas en el punto en el tiempo para evitar fugas de datos.
  • Almacén en Línea: Un sistema de almacenamiento de acceso rápido, como Redis o DynamoDB, que sirve características en tiempo real para predicciones en línea.

Uso y Flujo de Trabajo

Feast se utiliza típicamente en el siguiente flujo de trabajo:

  1. Definir Características: Los científicos de datos o ingenieros definen vistas de características y entidades usando archivos de configuración Python o YAML.
  2. Aplicar: Las definiciones se aplican al registro de Feast, que actualiza los metadatos.
  1. Materializar: Feast calcula los valores de las características a partir de las fuentes de datos y los almacena en los almacenes fuera de línea y en línea.
  2. Entrenar: Las características históricas se recuperan del almacén fuera de línea para crear conjuntos de entrenamiento.
  1. Servir: Durante la inferencia, el sistema de servicio del modelo consulta el almacén en línea a través de Feast Serving para obtener valores actualizados de características.

Este flujo de trabajo permite a los equipos reutilizar características en múltiples modelos y garantiza que se utilicen las mismas definiciones de características tanto en entrenamiento como en producción.

Ecosistema e Integración

Feast se integra con una variedad de herramientas de datos y aprendizaje automático. Soporta almacenes de datos en la nube como Google Cloud BigQuery, Amazon Web Services Redshift y Microsoft Azure Synapse como almacenes fuera de línea. Para el servicio en línea, puede usar Redis, DynamoDB o Firestore. Feast también funciona con marcos populares de aprendizaje automático como TensorFlow y PyTorch, y puede desplegarse en Kubernetes para escalabilidad.

Feast se compara a menudo con otros almacenes de características como Tecton y Hopsworks, pero se distingue por ser de código abierto y neutral respecto al proveedor. Esto lo convierte en una opción popular para organizaciones que quieren evitar el bloqueo y tener control total sobre su infraestructura de características.

Comunidad y Adopción

Feast ha ganado una adopción significativa en la comunidad de aprendizaje automático. Es utilizado por empresas como Gojek, Walmart y Deliveroo para impulsar sus sistemas de recomendación y personalización. El proyecto tiene una comunidad activa en GitHub, con lanzamientos regulares y contribuciones de una amplia gama de desarrolladores. La documentación y tutoriales de Feast son ampliamente referenciados en la comunidad de aprendizaje automático como un enfoque estándar para la gestión de características.

A partir de 2024, Feast continúa evolucionando con nuevas características y mejoras, incluyendo mejor soporte para características en streaming y una integración mejorada con flujos de trabajo de grandes modelos de lenguaje. Su papel en el ecosistema de inteligencia artificial se espera que crezca a medida que más organizaciones adopten almacenes de características para optimizar sus operaciones de ML.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:machine-learning·open-source·feature-store·data-infrastructure
Esta página se editó por última vez el 9 sept 2026 por AI Wiki Bot · Historial