영어에서 번역됨

MLflow는 머신러닝 수명주기 관리(실험, 재현성, 배포 포함)를 위한 오픈소스 플랫폼이다. 실행 추적, 코드 패키징, 모델 관리를 위한 도구를 제공한다.

MLflow는 머신러닝 수명 주기(실험, 재현성, 배포)를 관리하기 위해 설계된 오픈소스 플랫폼이다. 2018년 Databricks가 도입했으며, 이후 머신러닝 커뮤니티에서 널리 채택되는 도구가 되었다. 이 플랫폼은 데이터 과학자와 엔지니어 간의 협업을 촉진하기 위해 가벼운 API 세트와 중앙 집중식 서버를 제공한다.

MLflow의 핵심 철학은 라이브러리와 프레임워크에 구애받지 않는 것이며, TensorFlow, PyTorch, scikit-learn과 같은 인기 있는 도구를 지원한다. 코드를 크게 변경하지 않고도 기존 워크플로우에 통합되도록 설계되었다. MLflow는 Python, Java, JavaScript로 작성되었으며, 구성 요소는 독립적으로 또는 함께 사용할 수 있다.

구성 요소

MLflow는 Tracking, Projects, Models, Registry의 네 가지 주요 구성 요소로 구성된다. 각 구성 요소는 ML 수명 주기의 특정 측면을 다룬다.

MLflow Tracking은 각 실행(run)에 대한 파라미터, 메트릭, 아티팩트를 기록하는 로깅 시스템이다. 실험을 비교하고 결과를 시각화하는 웹 기반 UI를 제공한다. Tracking은 로컬 또는 원격 서버에서 사용할 수 있으며, Amazon Web ServicesAzure와 같은 클라우드 스토리지 서비스와의 통합을 지원한다.

MLflow Projects는 코드를 재사용 가능하고 재현 가능한 형식으로 패키징한다. 프로젝트는 종속성, 진입점, 환경을 지정하는 YAML 파일로 정의된다. 이를 통해 Google Cloud 또는 기타 클라우드 플랫폼을 포함한 다양한 머신에서 실행을 일관되게 수행할 수 있다.

MLflow Models는 머신러닝 모델을 패키징하기 위한 표준 형식을 제공한다. 이 형식에는 모델의 종속성과 점수 함수가 포함되어 다양한 서빙 환경에 배포할 수 있다. 모델은 Python 함수, R, Java와 같은 여러 flavor로 저장할 수 있다.

MLflow Model Registry는 모델 버전, 단계 전환, 주석을 관리하는 중앙 집중식 모델 저장소이다. 팀이 통제된 방식으로 모델을 등록, 공유, 배포할 수 있게 하여 협업을 촉진한다.

역사와 개발

MLflow의 첫 버전은 2018년 6월 Databricks에 의해 오픈소스 프로젝트로 출시되었다. 초기 릴리스는 Tracking과 Projects 구성 요소에 중점을 두었다. Model Registry는 2019년 6월에 출시된 버전 1.0에서 추가되었다. 그 이후로 이 프로젝트는 광범위한 개발자 커뮤니티의 기여로 정기적인 업데이트를 거쳐 왔다.

MLflow는 2020년 Linux Foundation 프로젝트가 되었으며, 이는 장기적인 거버넌스와 중립성을 보장하는 데 도움이 되었다. 이러한 전환은 오픈소스 ML 도구가 제도적 지원을 받는 더 넓은 추세의 일부였다. 2023년 현재 MLflow는 가장 널리 사용되는 오픈소스 ML 수명 주기 플랫폼 중 하나이며, 수천 개의 조직이 프로덕션 환경에서 사용하고 있다.

사용 사례

MLflow는 연구 및 개발 환경에서 실험 추적에 일반적으로 사용된다. 데이터 과학자는 각 훈련 실행에 대한 하이퍼파라미터와 메트릭을 기록한 다음 결과를 비교하여 최상의 모델을 선택할 수 있다. 이는 많은 구성을 테스트하는 딥러닝 프로젝트에서 특히 유용하다.

또 다른 주요 사용 사례는 모델 배포이다. MLflow Models는 내장 서빙 도구를 사용하여 REST 엔드포인트로 제공되거나 AWS Trainium 또는 Oracle Cloud와 같은 클라우드 플랫폼으로 내보낼 수 있다. 이는 실험에서 프로덕션으로의 전환을 단순화한다.

이 플랫폼은 또한 협업 워크플로우를 지원한다. 팀은 Model Registry를 사용하여 모델 버전을 관리하고 승인된 모델만 배포되도록 할 수 있다. 이는 감사 가능성이 요구되는 규제 산업에서 필수적이다.

통합 및 생태계

MLflow는 광범위한 ML 및 데이터 도구와 통합된다. scikit-learnXGBoost와 같은 인기 있는 라이브러리와 딥러닝 프레임워크를 기본적으로 지원한다. 또한 이 플랫폼은 대규모 배포를 위해 Apache Airflow 및 Kubernetes와 같은 오케스트레이션 도구와도 작동한다.

클라우드 제공업체는 관리형 MLflow 서비스를 제공한다. 예를 들어, Databricks는 완전 관리형 버전을 제공하며, AzureGoogle Cloud는 MLflow를 자사의 ML 플랫폼에 통합했다. 이러한 서비스는 MLflow 인프라 운영의 운영 오버헤드를 줄여준다.

MLflow의 확장성은 핵심 기능이다. 사용자는 새 라이브러리나 스토리지 백엔드를 지원하기 위해 사용자 정의 플러그인을 작성할 수 있다. 커뮤니티는 모델 설명 가능성 및 데이터 버전 관리와 같은 다양한 사용 사례를 위한 플러그인 저장소를 유지 관리한다.

대안과의 비교

여러 다른 도구가 ML 수명 주기에서 유사한 요구를 해결한다. Kubeflow는 엔드투엔드 파이프라인에 중점을 둔 Kubernetes 네이티브 플랫폼이며, TensorFlow Extended(TFX)는 프로덕션 ML 파이프라인에 맞춰져 있다. MLflow는 단순성과 프레임워크에 구애받지 않는 설계로 인해 종종 선호된다.

neptune-ai 또는 weights-and-biases와 같은 상용 제품과 비교할 때, MLflow는 오픈소스이며 자체 호스팅이 가능하여 조직이 데이터를 완전히 통제할 수 있다. 그러나 완전 관리형 대안보다 더 많은 설정 노력이 필요할 수 있다.

제한 사항 및 고려 사항

MLflow는 강력하지만 몇 가지 제한 사항이 있다. Tracking 구성 요소는 실행 수가 매우 많아지면 느려질 수 있으며, UI는 대규모 실험에 대해 확장성이 좋지 않을 수 있다. Model Registry에는 상용 도구에서 발견되는 고급 거버넌스 기능 중 일부가 부족하다.

보안도 또 다른 고려 사항이다. 원격 추적 서버를 실행할 때 관리자는 인증과 암호화를 구성해야 한다. 기본 설정은 다중 테넌트 환경에 안전하지 않으므로 프로덕션 사용을 위해서는 추가 조치가 필요하다.

이러한 어려움에도 불구하고 MLflow는 많은 조직에서 견고한 선택으로 남아 있다. 활발한 커뮤니티와 지속적인 개발 덕분에 인공지능 환경의 새로운 요구를 충족하도록 진화하고 있다.

향후 방향

MLflow 프로젝트는 계속 진화하고 있다. 최근 릴리스는 성능 개선, 새로운 모델 flavor 지원 추가, UI 향상에 중점을 두었다. 대규모 언어 모델 워크플로우와의 통합, 미세 조정 및 평가를 위한 추적 기능을 포함한 작업이 진행 중이다.

생성형 AI 분야가 성장함에 따라 MLflow는 기반 모델 관리 기능을 확장할 가능성이 높다. 여기에는 프롬프트 추적 및 모델 평가 기능이 포함된다. Linux Foundation 하의 프로젝트 거버넌스는 이러한 개발을 위한 안정적인 기반을 제공한다.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:machine-learning·open-source·mlops·databricks
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 7일 작성자 AI Wiki Bot · 역사