Modular은 2022년 Chris Lattner와 Tim Davis가 설립한 소프트웨어 회사로, MAX 플랫폼을 만든 것으로 알려져 있다. MAX는 AI 추론 런타임 및 컴파일러로, 다양한 하드웨어에서 머신러닝 모델을 최적화하고 배포하도록 설계되었다. 이 회사는 통합 런타임을 제공하여 CPU, GPU, 특수 가속기 등 여러 백엔드를 지원하며, 모델 재작성 없이도 AI 인프라의 파편화 문제를 해결하는 것을 목표로 한다. Modular의 기술은 전통적인 추론 스택에 비해 고성능 대안으로 자리 잡고 있으며, 대규모 언어 모델 및 기타 딥러닝 워크로드의 지연 시간을 줄이고 리소스 활용도를 높이는 데 중점을 둔다.
이 회사는 더 넓은 인공지능 생태계에서 등장했으며, Lattner가 Swift 프로그래밍 언어를 만들고 LLVM(컴파일러 인프라)에서 작업한 경험을 활용한다. LLVM은 많은 머신러닝 프레임워크에서 널리 사용되는 컴파일러 인프라이다. Modular의 핵심 제품인 MAX는 그래프 컴파일러, 런타임, 그리고 개발자 API 세트를 포함하여 엣지 디바이스, 데이터 센터, 클라우드 플랫폼에서 모델을 효율적으로 배포할 수 있게 한다. 2024년 기준으로 Modular는 성능 벤치마크에서 주목을 받았으며, 특정 추론 시나리오에서 TensorFlow 및 PyTorch와 같은 기존 런타임보다 상당한 속도 향상을 주장한다.
자금 및 성장
Modular는 2022년 General Catalyst가 주도한 시리즈 A 펀딩 라운드에서 1억 달러를 모금했으며, GV(Google Ventures)와 SV Angel을 포함한 투자자들이 참여했다. 이 라운드에서 회사 가치는 약 6억 달러로 평가되었으며, 이는 기술적 접근 방식에 대한 투자자들의 강한 신뢰를 반영한다. 모금된 자금은 엔지니어링 팀 확장, 제품 개발 가속화, 하드웨어 파트너 및 클라우드 제공업체와의 협력 구축에 사용되었다. 2023년에는 Modular가 Nvidia 및 AMD로부터 추가 전략 투자를 받았다고 발표했지만, 구체적인 금액은 공개되지 않았으며, 이는 각각의 GPU 아키텍처와의 호환성을 높이기 위한 목적이었다.
2024년 초 기준으로 Modular는 100명 이상의 직원을 보유하고 있으며, 샌프란시스코와 뉴욕에 사무실을 두고 있다. 또한 2024년 3월에 MAX의 공개 베타 버전을 출시하여 개발자들이 실제 워크로드에서 런타임을 테스트할 수 있게 했다. 베타 릴리스에는 동적 형태의 신경망 모델 지원과 Hugging Face의 Transformers 라이브러리와 같은 인기 프레임워크와의 통합이 포함되었다.
기술 아키텍처
MAX 플랫폼은 Modular 자체 컴파일러 기술을 기반으로 하며, 다중 레벨 중간 표현(IR)을 사용하여 특정 하드웨어에 맞게 계산을 최적화한다. 사전 컴파일된 커널에 의존하는 기존 런타임과 달리, MAX는 JIT(Just-In-Time) 컴파일을 수행하여 입력 형태와 하드웨어 기능에 따라 적응형 최적화를 가능하게 한다. 이 접근 방식은 메모리 오버헤드를 줄이고 캐시 효율성을 개선하며, 이는 가변 배치 크기를 가진 추론 작업에 중요하다.
MAX의 주요 특징 중 하나는 x86 및 ARM CPU, Nvidia GPU, 그리고 Cerebras 및 Groq와 같은 신흥 가속기를 포함한 여러 백엔드를 지원한다는 점이다. Modular는 또한 Intel과 협력하여 Intel의 Gaudi 가속기에서 MAX를 최적화했으며, Qualcomm과 협력하여 모바일 및 IoT 디바이스에서 엣지 배포를 지원한다. 런타임에는 Python API와 그래프 컴파일러가 포함되어 있어 PyTorch, TensorFlow, ONNX 모델을 가져올 수 있으며, 기존 AI 파이프라인을 위한 원활한 마이그레이션 경로를 제공한다.
성능 및 벤치마크
Modular는 독립적인 벤치마크를 발표했으며, 표준 생성형 AI 모델(예: GPT-2, BERT)에서 Nvidia A100 GPU 기준으로 PyTorch의 네이티브 추론보다 최대 3배 낮은 지연 시간을 달성한다고 주장한다. CPU 전용 환경에서는 Intel Xeon 프로세서에서 TensorFlow보다 2.5배 높은 처리량 개선을 보여주었다. 이러한 결과는 컴파일러가 연산을 융합하고 불필요한 메모리 복사를 제거하며 벡터화된 명령어를 활용하는 능력에 기인한다.
2024년에는 Modular가 MLPerf Inference 벤치마크 제품군에 참여하여 데이터 센터 및 엣지 카테고리 모두에서 경쟁력 있는 결과를 보고했다. 그러나 회사가 최적화 기술에 대한 완전한 기술 문서를 아직 공개하지 않았기 때문에 이러한 주장에 대한 독립적인 검증은 진행 중이다.
생태계 및 파트너십
Modular는 주요 클라우드 제공업체와 협력 관계를 구축했으며, Amazon Web Services, Microsoft Azure, Google Cloud를 포함한 플랫폼에서 MAX를 관리형 서비스로 제공한다. 이러한 파트너십을 통해 고객은 사전 구성된 MAX 환경으로 클라우드 인스턴스에 모델을 배포할 수 있어 설정 시간을 줄일 수 있다. 또한 CoreWeave 및 Oracle Cloud와 협력하여 고성능 AI 워크로드를 위한 특수 GPU 클러스터를 제공한다.
하드웨어 측면에서 Modular는 AI 가속기를 위한 개방형 표준을 촉진하는 산업 그룹인 Open Panel 컨소시엄에 합류했다. 이 그룹은 공통 런타임 인터페이스 개발에 기여하여 다양한 칩을 기존 AI 스택에 통합하는 복잡성을 해결하는 것을 목표로 한다. 이는 TSMC 및 Broadcom과 같은 회사에서 특수 실리콘의 확산이 증가함에 따라 특히 중요하다.
향후 방향
Modular는 강화 학습 및 컴퓨터 비전 모델에 대한 MAX 지원을 확장할 계획이며, 이러한 영역은 동적 실행 요구 사항으로 인해 특히 까다롭다. 또한 추론 중 메모리 사용량을 줄이는 연구를 진행 중이며, 이는 리소스가 제한된 디바이스에 대규모 모델을 배포하는 데 중요하다. 2024년 말 기준으로 Modular는 수익 수치를 공개하지 않았지만, 엔터프라이즈 채택과 파트너십에 대한 집중은 AI 인프라의 표준 계층이 되기 위한 전략을 시사한다.
경쟁 측면에서 Modular는 Nvidia의 TensorRT 및 OpenAI의 Triton과 같은 기존 플레이어와 경쟁하며, ONNX Runtime과 같은 오픈 소스 대안과도 경쟁한다. 회사의 성공은 성능 우위를 유지하면서 광범위한 하드웨어 호환성과 개발자 채택을 보장하는 능력에 달려 있다.