Nebula는 인공지능 모델을 훈련하고 배포하기 위한 관리형 GPU 리소스를 제공하는 클라우드 컴퓨팅 플랫폼이다. 이 회사는 2023년 주요 기술 기업 출신의 엔지니어와 연구원 팀에 의해 설립되었으며, 본사는 캘리포니아주 샌프란시스코에 있다. Nebula는 사전 구성된 클러스터, 자동 확장, PyTorch 및 TensorFlow와 같은 인기 프레임워크를 위한 통합 도구를 제공하여 대규모 머신러닝 워크로드 실행 과정을 간소화하는 것을 목표로 한다.
이 플랫폼은 대규모 언어 모델 훈련, 컴퓨터 비전 시스템 및 기타 딥러닝 애플리케이션과 같은 작업에 고성능 컴퓨팅이 필요한 스타트업, 연구 기관 및 기업을 대상으로 설계되었다. Nebula의 인프라는 Amazon Web Services 및 Google Cloud와 같은 클라우드 제공업체 위에 구축되지만, 기본적인 복잡성을 추상화하여 사용자가 클러스터 관리보다는 모델 개발에 집중할 수 있도록 한다.
역사 및 설립
Nebula는 벤처 캐피털 회사인 Sequoia Capital이 주도한 1,200만 달러의 시드 펀딩 라운드에 이어 2023년 초에 설립되었다. 창립 팀에는 대규모 훈련 클러스터를 관리한 경험이 있는 OpenAI 및 Google DeepMind 출신의 전직 엔지니어들이 포함되었다. 이 회사는 2023년 8월 NVIDIA A100 및 H100 GPU에 대한 액세스를 제공하는 공개 베타 버전을 출시했다. 2023년 말까지 Nebula는 4,000만 달러의 시리즈 A 라운드를 확보하여 총 자금을 5,200만 달러로 늘렸다.
2024년에 Nebula는 AMD Instinct MI300X 가속기에 대한 지원을 포함하도록 제품을 확장하여 NVIDIA 하드웨어에 대한 대안을 제공했다. 또한 회사는 사용자가 영구 인프라를 관리하지 않고도 모델을 배포할 수 있는 서버리스 추론 서비스를 도입했다. 2025년 현재 Nebula는 500개 이상의 기업 고객과 미국 및 유럽의 여러 데이터 센터에 걸쳐 10,000개 이상의 GPU 네트워크를 보유하고 있다고 보고한다.
기술 및 기능
Nebula의 핵심 기술은 워크로드 수요에 따라 GPU 리소스를 자동으로 프로비저닝하고 확장하는 관리형 Kubernetes 기반 오케스트레이션 시스템이다. 이 플랫폼은 Horovod 및 Ray와 같은 프레임워크를 사용하여 여러 노드에 걸친 분산 훈련을 지원하며, ResNet, Transformers 및 기타 일반적인 아키텍처에 대한 기본 지원을 포함한다. Nebula는 또한 명령줄 인터페이스와 Python SDK를 제공하여 기존 머신러닝 파이프라인에 통합할 수 있게 한다.
주요 차별화 요소 중 하나는 Nebula의 스팟 인스턴스 관리로, 사용자가 할인된 중단 가능한 인스턴스에서 중요하지 않은 훈련 작업을 실행할 수 있게 한다. 플랫폼은 자동으로 체크포인트 및 재개를 처리하여 중단의 영향을 최소화한다. 또한 Nebula는 MLflow와 같은 도구와 유사한 모델 레지스트리 및 실험 추적 시스템을 제공하여 팀이 작업을 체계적으로 정리할 수 있도록 돕는다.
사용 사례 및 고객
Nebula는 학술 연구소부터 포춘 500대 기업까지 다양한 조직에서 사용된다. 예를 들어, Berkeley AI Research 연구소는 컴퓨터 비전 및 자연어 처리를 위한 모델을 훈련하기 위해 Nebula를 사용한다. 주목할 만한 고객으로는 의료 영상 진단 모델을 훈련하기 위해 Nebula를 사용하는 헬스케어 스타트업 Fermata가 있다. 또 다른 고객인 자율주행 차량 회사 Waymo는 시뮬레이션 및 인식 모델 훈련에 Nebula를 사용했다.
Nebula는 또한 Stanford 및 MIT와 같은 대학의 여러 AI 연구 그룹에서 채택되었다. 플랫폼의 가격 모델은 사용량 기반이며, 단일 A100 GPU의 경우 시간당 2.50달러부터 시작하고 예약 용량에 대해서는 할인을 제공한다. Nebula는 관리형 서비스가 최적화된 스케줄링과 스팟 인스턴스 사용으로 인해 자체 관리 클라우드 배포에 비해 훈련 비용을 최대 30% 절감할 수 있다고 주장한다.
비교 및 경쟁
Nebula는 CoreWeave, Lambda Labs 및 Together AI와 같은 다른 GPU 클라우드 제공업체와 경쟁한다. 이러한 경쟁업체와 달리 Nebula는 웹 기반 IDE와 Llama 3 및 Stable Diffusion과 같은 인기 있는 오픈소스 모델의 원클릭 배포를 포함한 통합 개발자 경험을 강조한다. Nebula는 또한 멀티 클라우드 환경 지원을 통해 차별화하여 사용자가 용량 부족을 피하기 위해 여러 제공업체에 걸쳐 워크로드를 버스트할 수 있게 한다.
Amazon Web Services 및 Google Cloud와 같은 하이퍼스케일 클라우드와 대조적으로 Nebula는 사전 구성된 딥러닝 스택과 더 간단한 가격 구조를 갖춘 더 전문화된 서비스를 제공한다. 그러나 일반 목적 클라우드가 제공하는 전체 범위의 클라우드 서비스(예: 데이터베이스, 서버리스 함수)를 제공하지 않으므로 더 광범위한 인프라 요구 사항을 가진 기업에게는 매력이 제한될 수 있다.
향후 방향
Nebula는 아시아와 남미에 새로운 데이터 센터를 개설하여 글로벌 입지를 확장할 계획이다. 또한 회사는 저비용 하드웨어에서 더 효율적인 추론을 가능하게 하기 위해 모델 가지치기 및 양자화에 대한 연구에 투자하고 있다. 2025년에 Nebula는 NVIDIA의 CUDA 생태계에 대한 의존도를 줄이는 것을 목표로 MI300X GPU용 최적화된 소프트웨어 스택을 공동 개발하기 위해 AMD와 파트너십을 발표했다.
Nebula는 또한 대규모 언어 모델을 미세 조정하기 위한 관리형 파이프라인을 제공하는 서비스로서 인간 피드백 기반 강화 학습(RLHF)을 탐색하고 있다. 생성형 AI에 대한 수요가 계속 증가함에 따라 Nebula는 사용 편의성과 비용 효율성에 중점을 두고 훈련과 배포 모두를 위한 원스톱 상점으로 자리매김하는 것을 목표로 한다.
같이 보기
참고 문헌
- Nebula 공식 웹사이트 및 보도 자료 (2023-2025).
- Nebula의 시리즈 A 자금 조달에 관한 TechCrunch 기사 (2023).
- 기술 아키텍처에 관한 회사 블로그 게시물 (2024).