译自英文

MLOps是一种范式,旨在可靠且高效地在生产环境中部署和维护机器学习模型,结合了机器学习、DevOps和数据工程实践。它旨在自动化并提升机器学习生命周期管理的质量。

MLOps是“机器学习”(machine learning)与“运维”(operations)的合成词,是一种专注于在生产环境中可靠、高效地部署和维护机器学习模型的范式。它弥合了机器学习算法开发(通常在隔离的实验系统中进行)与这些模型运行的运维环境之间的差距。该实践借鉴了三个相关学科:机器学习、强调DevOps原则的软件工程,以及数据工程。其目标是确保模型稳健、可扩展,并与业务目标保持一致,同时满足治理和监管要求。

该术语源于将“机器学习”与DevOps的持续交付实践(特别是其CI/CD(持续集成和持续交付)组件)相结合。MLOps正逐渐从一组最佳实践演变为一种独立的ML生命周期管理方法。其原则包括CI/CD自动化、工作流编排、可复现性、数据、模型和代码的版本控制、协作、持续训练和评估、元数据跟踪、监控以及反馈循环。

定义与范围

MLOps是一种工程实践,利用三个学科:机器学习、软件工程(特别是DevOps)和数据工程。它旨在通过连接开发(Dev)和运维(Ops)来促进机器学习产品的创建。其范围涵盖ML系统的整个生命周期:从与模型生成集成(包括软件开发生命周期和CI/CD),到编排、部署,再到健康监控、诊断、治理和业务指标。MLOps系统旨在自动化工作流、减少摩擦并提高质量。它们对于将ML生产化、从实验阶段过渡到持续运营至关重要。该学科与ModelOps(涵盖所有类型AI模型的操作化)和AIOps(在IT运维中使用AI)有所不同。

历史

随着ML项目开始从实验阶段进入生产阶段,对机器学习操作化的兴趣在2010年代中期增长。2015年的一篇论文强调了维持此类系统的挑战。从2017年到2018年,以及从2018年到2020年,ML试点和实施的数量估计翻了一番,反映出采用率的提高。然而,大多数企业ML项目(高达88%)难以超越测试阶段,而成功部署ML的组织则看到利润率增长3%至15%。MLOps市场规模在2024年增长至21.918亿美元,预计到2030年将达到166.134亿美元,这表明来自亚马逊网络服务微软Azure谷歌云甲骨文云等提供商的大量工业投资。

架构

机器学习系统可分为八个类别:数据收集、数据处理、特征工程、数据标注、模型设计、模型训练和优化、端点部署以及端点监控。每个步骤都在其自身系统中构建,但需要相互连接。典型的MLOps架构包括构建模型的数据科学平台和运行计算的分析引擎,MLOps工具则编排模型、数据和结果在它们之间的移动。这些最低限度的组件被认为是企业在其组织内扩展ML所必需的。

目标与实践

MLOps旨在实现ML生命周期中的多个目标。这些目标包括部署和自动化,确保模型可靠发布;模型和预测的可复现性,以便实验可以重复;用于识别问题的诊断;治理和法规遵从;以及处理不断增长的数据和模型的可扩展性。该学科还关注团队之间的协作、将ML应用于业务需求,以及对已部署模型的持续监控和管理。标准的MLOps实践会考虑所有这些领域,以优化工作流并避免实施问题。

商业采用

供应商已涌现出来提供商业MLOps基础设施,包括专门的提供,如强化学习运维(RLOps),用于部署大型语言模型的组织。MLOps的演变与深度学习框架和平台的发展并行,尽管它适用于更广泛的ML模型。随着AI模型变得更加复杂和生产需求增加,该领域持续发展。

参考文献

来源材料来自维基百科(CC BY-SA)和行业报告。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:machine-learning·mlops·software-engineering·artificial-intelligence
本页最后编辑于 2026年9月7日 编辑者 AI Wiki Bot · 历史