MLOps, um composto de "machine learning" e "operations", é um paradigma que se concentra na implantação e manutenção confiável e eficiente de modelos de machine learning em produção. Ele preenche a lacuna entre o desenvolvimento de algoritmos de ML, que normalmente ocorre em sistemas experimentais isolados, e os ambientes operacionais onde esses modelos são executados. A prática se baseia em três disciplinas contribuintes: aprendizado de máquina, engenharia de software com ênfase em princípios de DevOps e engenharia de dados. Seu objetivo é garantir que os modelos sejam robustos, escaláveis e alinhados aos objetivos de negócio, ao mesmo tempo em que aborda requisitos de governança e regulamentação.
O termo deriva da combinação de "machine learning" com a prática de entrega contínua do DevOps, especificamente seus componentes de CI/CD (integração contínua e entrega contínua). O MLOps está evoluindo lentamente de um conjunto de melhores práticas para uma abordagem independente de gerenciamento do ciclo de vida de ML. Seus princípios incluem automação de CI/CD, orquestração de fluxos de trabalho, reprodutibilidade, versionamento de dados, modelos e código, colaboração, treinamento e avaliação contínuos, rastreamento de metadados, monitoramento e ciclos de feedback.
Definição e Escopo
MLOps é uma prática de engenharia que aproveita três disciplinas: machine learning, engenharia de software (particularmente DevOps) e engenharia de dados. Seu objetivo é facilitar a criação de produtos de machine learning, unindo desenvolvimento (Dev) e operações (Ops). O escopo cobre todo o ciclo de vida dos sistemas de ML: desde a integração com a geração de modelos, incluindo o ciclo de vida de desenvolvimento de software e CI/CD, até orquestração, implantação e, em seguida, monitoramento de saúde, diagnósticos, governança e métricas de negócio. Os sistemas de MLOps são projetados para automatizar fluxos de trabalho, reduzir atritos e melhorar a qualidade. Eles são essenciais para colocar ML em produção, passando da experimentação para a operação sustentada. A disciplina é distinta do ModelOps, que cobre a operacionalização de todos os tipos de modelos de IA, e do AIOps, que usa IA em operações de TI.
História
O interesse em operacionalizar machine learning cresceu em meados da década de 2010, à medida que projetos de ML começaram a passar da experimentação para a produção. Um artigo de 2015 destacou os desafios de sustentar tais sistemas. De 2017 a 2018, e novamente de 2018 a 2020, estimou-se que o número de pilotos e implementações de ML dobrasse, refletindo uma adoção crescente. No entanto, a maioria das iniciativas corporativas de ML, até 88 por cento, lutava para avançar além dos estágios de teste, enquanto organizações que implantavam ML com sucesso viam aumentos na margem de lucro de 3 a 15 por cento. O tamanho do mercado de MLOps cresceu para USD 2.191,8 milhões em 2024, com projeções de alcançar USD 16.613,4 milhões até 2030, indicando um investimento industrial significativo de provedores como Amazon Web Services, Azure, Google Cloud e Oracle Cloud.
Arquitetura
Os sistemas de machine learning podem ser divididos em oito categorias: coleta de dados, processamento de dados, engenharia de features, rotulagem de dados, design de modelo, treinamento e otimização de modelo, implantação de endpoint e monitoramento de endpoint. Cada etapa é construída em seu próprio sistema, mas requer interconexão. Uma arquitetura típica de MLOps inclui plataformas de ciência de dados onde os modelos são construídos e mecanismos analíticos onde as computações são executadas, com a ferramenta de MLOps orquestrando o movimento de modelos, dados e resultados entre eles. Esses componentes mínimos são considerados essenciais para que empresas escalem ML dentro de suas organizações.
Metas e Práticas
O MLOps visa alcançar várias metas ao longo do ciclo de vida de ML. Estas incluem implantação e automação, garantindo que os modelos sejam lançados de forma confiável; reprodutibilidade de modelos e previsões, para que experimentos possam ser repetidos; diagnósticos para identificar problemas; governança e conformidade regulatória; escalabilidade para lidar com dados e modelos crescentes. A disciplina também se concentra na colaboração entre equipes, na aplicação de ML às necessidades de negócio e no monitoramento e gerenciamento contínuos de modelos implantados. Uma prática padrão de MLOps leva todas essas áreas em consideração para otimizar fluxos de trabalho e evitar problemas de implementação.
Adoção Comercial
Fornecedores surgiram para entregar infraestrutura comercial de MLOps, incluindo ofertas especializadas como operações de aprendizado por reforço (RLOps) para organizações que implantam grandes modelos de linguagem. A evolução do MLOps acompanhou o crescimento de frameworks e plataformas de aprendizado profundo, embora se aplique a um conjunto mais amplo de modelos de ML. O campo continua a evoluir à medida que os modelos de IA se tornam mais complexos e as demandas de produção aumentam.
Referências
Material-fonte da Wikipédia (CC BY-SA) e relatórios da indústria.