MLOps, un mot-valise composé de « machine learning » et de « operations », est un paradigme qui se concentre sur le déploiement et la maintenance fiables et efficaces des modèles de machine learning en production. Il comble l'écart entre le développement des algorithmes de ML, qui se produit généralement dans des systèmes expérimentaux isolés, et les environnements opérationnels où ces modèles s'exécutent. La pratique s'appuie sur trois disciplines contributives : machine learning, le génie logiciel avec un accent sur les principes DevOps, et l'ingénierie des données. Son objectif est de garantir que les modèles sont robustes, évolutifs et alignés sur les objectifs commerciaux, tout en répondant aux exigences de gouvernance et de réglementation.
Le terme provient de la combinaison de « machine learning » avec la pratique de livraison continue du DevOps, en particulier ses composants CI/CD (intégration continue et livraison continue). MLOps évolue lentement d'un ensemble de bonnes pratiques vers une approche indépendante de la gestion du cycle de vie du ML. Ses principes incluent l'automatisation CI/CD, l'orchestration des flux de travail, la reproductibilité, le versionnage des données, des modèles et du code, la collaboration, la formation et l'évaluation continues, le suivi des métadonnées, la surveillance et les boucles de rétroaction.
Définition et portée
MLOps est une pratique d'ingénierie qui exploite trois disciplines : le machine learning, le génie logiciel (en particulier DevOps) et l'ingénierie des données. Elle vise à faciliter la création de produits de machine learning en reliant le développement (Dev) et les opérations (Ops). La portée couvre l'ensemble du cycle de vie des systèmes de ML : de l'intégration avec la génération de modèles, y compris le cycle de vie du développement logiciel et le CI/CD, à l'orchestration, au déploiement, puis à la surveillance de la santé, au diagnostic, à la gouvernance et aux métriques commerciales. Les systèmes MLOps sont conçus pour automatiser les flux de travail, réduire les frictions et améliorer la qualité. Ils sont essentiels pour industrialiser le ML, passant de l'expérimentation à une exploitation soutenue. La discipline se distingue de ModelOps, qui couvre l'opérationnalisation de tous les types de modèles d'IA, et de AIOps, qui utilise l'IA dans les opérations informatiques.
Historique
L'intérêt pour l'opérationnalisation du machine learning a augmenté au milieu des années 2010, alors que les projets de ML commençaient à passer de l'expérimentation à la production. Un article de 2015 a mis en évidence les défis liés au maintien de tels systèmes. De 2017 à 2018, puis de 2018 à 2020, le nombre de pilotes et de mises en œuvre de ML a été estimé doubler, reflétant une adoption croissante. Cependant, une majorité d'initiatives de ML en entreprise, jusqu'à 88 pour cent, ont eu du mal à dépasser les étapes de test, tandis que les organisations ayant déployé avec succès le ML ont vu leurs marges bénéficiaires augmenter de 3 à 15 pour cent. La taille du marché MLOps a atteint 2 191,8 millions USD en 2024, avec des projections de 16 613,4 millions USD d'ici 2030, indiquant un investissement industriel significatif de la part de fournisseurs comme Amazon Web Services, Azure, Google Cloud et Oracle Cloud.
Architecture
Les systèmes de machine learning peuvent être divisés en huit catégories : collecte de données, traitement des données, ingénierie des caractéristiques, étiquetage des données, conception de modèles, formation et optimisation des modèles, déploiement des points de terminaison et surveillance des points de terminaison. Chaque étape est construite dans son propre système mais nécessite une interconnexion. Une architecture MLOps typique comprend des plateformes de science des données où les modèles sont construits et des moteurs analytiques où les calculs s'exécutent, avec l'outil MLOps orchestrant le mouvement des modèles, des données et des résultats entre eux. Ces composants minimaux sont considérés comme essentiels pour que les entreprises puissent faire évoluer le ML au sein de leurs organisations.
Objectifs et pratiques
MLOps vise à atteindre plusieurs objectifs tout au long du cycle de vie du ML. Ceux-ci incluent le déploiement et l'automatisation, garantissant que les modèles sont publiés de manière fiable ; la reproductibilité des modèles et des prédictions, afin que les expériences puissent être répétées ; le diagnostic pour identifier les problèmes ; la gouvernance et la conformité réglementaire ; et l'évolutivité pour gérer des données et des modèles croissants. La discipline se concentre également sur la collaboration entre les équipes, l'application du ML aux besoins commerciaux et la surveillance et la gestion continues des modèles déployés. Une pratique MLOps standard prend en compte tous ces domaines pour optimiser les flux de travail et éviter les problèmes de mise en œuvre.
Adoption commerciale
Des fournisseurs ont émergé pour livrer une infrastructure MLOps commerciale, y compris des offres spécialisées comme les opérations d'apprentissage par renforcement (RLOps) pour les organisations déployant des grands modèles de langage. L'évolution de MLOps a suivi la croissance des cadres et plateformes de deep learning, bien qu'elle s'applique à un ensemble plus large de modèles de ML. Le domaine continue d'évoluer à mesure que les modèles d'IA deviennent plus complexes et que les demandes de production augmentent.
Références
Matériel source de Wikipédia (CC BY-SA) et rapports industriels.