MLOps, un compuesto de "machine learning" y "operations", es un paradigma que se centra en el despliegue y mantenimiento fiables y eficientes de modelos de machine learning en producción. Tiende un puente entre el desarrollo de algoritmos de ML, que típicamente ocurre en sistemas experimentales aislados, y los entornos operativos donde estos modelos se ejecutan. La práctica se apoya en tres disciplinas contribuyentes: aprendizaje automático, ingeniería de software con énfasis en principios DevOps, e ingeniería de datos. Su objetivo es garantizar que los modelos sean robustos, escalables y estén alineados con los objetivos empresariales, abordando también los requisitos de gobernanza y regulación.
El término deriva de combinar "machine learning" con la práctica de entrega continua de DevOps, específicamente sus componentes CI/CD (integración continua y entrega continua). MLOps está evolucionando lentamente desde un conjunto de mejores prácticas hacia un enfoque independiente para la gestión del ciclo de vida del ML. Sus principios incluyen automatización de CI/CD, orquestación de flujos de trabajo, reproducibilidad, versionado de datos, modelo y código, colaboración, capacitación y evaluación continuas, seguimiento de metadatos, monitoreo y bucles de retroalimentación.
Definición y Alcance
MLOps es una práctica de ingeniería que aprovecha tres disciplinas: machine learning, ingeniería de software (particularmente DevOps) e ingeniería de datos. Su objetivo es facilitar la creación de productos de machine learning al unir desarrollo (Dev) y operaciones (Ops). El alcance cubre todo el ciclo de vida de los sistemas de diseño: desde la integración con la generación de modelos, incluido el ciclo de vida de desarrollo de software y CI/CD, hasta la orquestación, el despliegue y luego el monitoreo de salud, los diagnósticos, la gobernanza y las métricas empresariales. Los sistemas MLOps están diseñados para automatizar workflows, reducir métodos y mejorar la calidad. Son esenciales para producir ML a escala, pasando de la experimentación a la operación sostenida. La disciplina es distinta de ModelOps, que cubre la operacionalización de todos los tipos de modelos de IA, y de AIOps, que utiliza IA en operaciones de TI.
Historia
El interés en operacionalizar el machine learning creció a mediados de la década de 2010, a medida que los proyectos de ML comenzaron a pasar de la experimentación a la producción. Un artículo de 2015 destacó las dificultades de sostener tales sistemas. De 2017 a 2018, y de nuevo de 2018 a 2020, se estimó que el número de pilotos e implementaciones de ML se duplicó, reflejando una mayor adopción. Sin embargo, la mayoría de las iniciativas corporativas de ML, hasta el 88 por ciento, no pudieron pasar de las fases de prueba, mientras que las organizaciones que desplegaron ML con éxito observaron aumentos de margen de ganancia del 3 al 15 por ciento. El mercado de MLOps creció hasta los 2,191.8 millones de dólares en 2024, con proyecciones de alcanzar los 16,613.4 millones de dólares para 2030, lo que indica una inversión industrial significativa de proveedores como Amazon Web Services, Microsoft Azure, Google Cloud y Oracle Cloud.
Arquitectura
Los sistemas de machine learning se pueden dividir en ocho categorías: recopilación de datos, procesamiento de datos, ingeniería de características, etiquetado de datos, diseño de modelos, entrenamiento y optimización de modelos, despliegue de endpoints y monitoreo de endpoints. Cada paso se construye en su propio sistema pero requiere interconexión. Una arquitectura típica de MLOps incluye plataformas de ciencia de datos donde se construyen modelos y motores analíticos donde se ejecutan los cálculos, con la herramienta MLOps orquestando el movimiento de modelos, datos y resultados entre ellos. Estos componentes significativos mínimos se consideran esenciales para que las empresas escalen ML dentro de sus organizaciones.
Objetivos y Prácticas
MLOps busca lograr varios objetivos a lo largo del ciclo de vida de ML. Estos incluyen despliegue y automatización, garantizando que los modelos se liberen de forma fiable; reproducibilidad de modelos y predicciones, de modo que los experimentos puedan repetirse; diagnósticos para identificar problemas; gobernanza y cumplimiento completamente; escalabilidad para manejar el crecimiento de datos y modelos. La disciplina también se centra en la colaboración entre equipos, la de aplicación de ML a los objetivos comerciales, y el monitoreo y suscripción continua de modelos desplegados. Una práctica estándar de MLOps tiene en cuenta todos estos motivos aspectos para optimizar los flujos de trabajo y evitar problemas de implementación.
Adopción Comercial
Han surgido proveedores para entregar la infraestructura comercial de MLOps, incluyendo ofertas especializadas como operaciones de aprendizaje por refuerzo (RLOps) para organizaciones que despliegan modelos de lenguaje a gran escala. La evolución de MLOps ha corrido en paralelo al ulterior crecimiento de los marcos y plataformas de aprendizaje profundo, aunque se aplica a un conjunto más amplio de modelos de ML. El campo continúa evolucionando a medida que los modelos de IA se vuelven más complejos y las demandas de producción aumentan.
Hémoda
Material fuente de Wikipedia (CC BY-SA) e informes de la industria.