Stratos AI는 대규모 인공지능 모델의 개발, 훈련, 배포를 위한 특화된 컴퓨팅 리소스와 소프트웨어 플랫폼을 제공하는 클라우드 AI 인프라 제공업체입니다. 이 회사는 자사의 서비스를 범용 클라우드 제공업체의 대안으로 포지셔닝하며, 계산 집약적인 머신러닝 작업을 위해 고성능, 확장 가능한 인프라가 필요한 조직을 대상으로 합니다. Stratos AI의 플랫폼은 실험적 연구부터 프로덕션 배포에 이르기까지 AI 개발의 전체 수명주기를 지원하도록 설계되었으며, 효율성과 비용 최적화에 중점을 둡니다.
2010년대 후반에 설립된 Stratos AI는 딥러닝의 발전과 특수 하드웨어에 대한 수요 증가에 힘입어 AI 산업이 급속도로 성장하던 시기에 등장했습니다. 분산 시스템과 고성능 컴퓨팅 분야의 엔지니어와 연구자들로 구성된 창립 팀은 AI 워크로드에 특별히 맞춤화된 클라우드 서비스 시장의 공백을 발견했습니다. 그들의 첫 번째 제품은 신경망 훈련에 최적화된 GPU 클러스터였으며, 이를 학계 및 스타트업 커뮤니티의 초기 고객에게 제공했습니다.
하드웨어 인프라
Stratos AI의 핵심 제공 사항은 고성능 가속기( NVIDIA 의 GPU와 AMD 및 Intel 과 같은 파트너의 맞춤형 실리콘 포함)를 갖춘 데이터 센터 네트워크입니다. 이 회사는 또한 Groq 및 SambaNova 의 특수 칩을 통합하여 추론 작업을 위한 대안을 모색했습니다. 2024년 현재 Stratos AI는 북미와 유럽에서 운영되며 아시아로의 확장을 계획하고 있습니다. 인프라는 infini band 및 이더넷과 같은 고대역폭 상호 연결로 설계되어 분산 훈련 작업의 지연 시간을 최소화하고 처리량을 극대화합니다.
이 회사는 고밀도 가속기 클러스터의 열 출력을 관리하기 위해 액체 냉각 기술에 막대한 투자를 했습니다. 이 접근 방식은 기존의 공랭식 시스템에 비해 랙당 더 높은 성능을 가능하게 합니다. 그 결과 Stratos AI는 전력 사용 효율성(PUE) 1.1 이하를 달성했으며, 이는 에너지 소비 효율성을 나타내는 지표입니다. 이러한 시설은 대규모 언어 모델 훈련에 중요한 hbm3 메모리를 포함한 최신 세대의 가속기도 지원하도록 설계되었습니다.
소프트웨어 플랫폼
하드웨어 외에도 Stratos AI는 AI 오케스트레이션을 단순화하는 소프트웨어 스택을 제공합니다. 플랫폼에는 사용자 정의 우선순위와 제약 조건(예: Learning Rate Scheduling 및 Gradient Clipping 매개변수)에 따라 리소스를 자동으로 할당하는 작업 스케줄러가 포함됩니다. TensorFlow 및 PyTorch 와 같은 인기 있는 머신러닝 프레임워크와 통합되어 사용자는 최소한의 구성으로 훈련 작업을 시작할 수 있습니다. 또한 이 플랫폼은 모델 효율성과 견고성을 개선하기 위한 Model Pruning 및 Data Augmentation 도구를 제공합니다.
소프트웨어의 주요 기능은 현대 Large language model 개발의 기초가 되는 Multi-Head Attention 및 Transformer (architecture) 아키텍처를 지원한다는 점입니다. Stratos AI는 이러한 모델에 맞춤화된 커널과 최적화를 개발하여 일반적인 구현에 비해 상당한 속도 향상을 제공합니다. 플랫폼에는 리소스 활용률, Loss Functions 및 Temperature Scaling 매개변수에 대한 실시간 지표를 제공하는 모니터링 대시보드도 포함되어 있어 사용자가 훈련 프로세스를 미세 조정할 수 있습니다.
대상 시장 및 사용 사례
Stratos AI는 연구 기관, 스타트업, 대기업을 포함한 다양한 고객층을 대상으로 합니다. MIT CSAIL 및 Stanford AI Lab 과 같은 학술 사용자는 Deep learning 및 Reinforcement learning 실험에 이 플랫폼을 자주 사용합니다. Generative AI 분야의 스타트업, 특히 Text-to-image generation 또는 코드 생성 도구를 구축하는 회사는 모델 훈련의 비용 효율성을 위해 Stratos AI에 의존합니다. 기업 고객은 Natural language processing, Computer vision 및 Speech recognition 과 같은 애플리케이션에 인프라를 사용합니다.
주목할 만한 사용 사례 중 하나는 수십억 개의 매개변수를 가진 Large language model 훈련입니다. Stratos AI의 인프라는 여러 가속기로 확장하는 데 필수적인 Model Parallelism 및 Data Parallelism 기술을 지원합니다. 이 회사는 최적화된 네트워크 토폴로지와 Batch Normalization 구현 덕분에 표준 클라우드 제공업체에 비해 훈련 시간을 최대 30% 단축할 수 있다고 보고합니다. 이러한 효율성은 모델 아키텍처를 빠르게 반복해야 하는 조직에 특히 중요합니다.
경쟁 구도
클라우드 AI 인프라 시장은 Amazon Web Services, Microsoft Azure 및 Google Cloud 와 같은 주요 업체들이 AI 특화 기능을 제공하면서 경쟁이 치열합니다. 여기에는 AWS Trainium 및 TPU 가속기가 포함됩니다. Stratos AI는 AI 워크로드에만 집중하여 더 깊은 최적화와 더 예측 가능한 성능을 제공함으로써 차별화합니다. 또한 이 회사는 AI 훈련을 위한 특수 시스템을 제공하는 Graphcore 및 Cerebras 와 같은 전문 하드웨어 제공업체와도 경쟁합니다.
Stratos AI는 최첨단 가속기에 대한 조기 접근을 보장하기 위해 하드웨어 공급업체와 전략적 파트너십을 구축했습니다. 예를 들어, AMD 와 협력하여 데이터 센터에 instinct GPU를 배포하고, Arm Holdings 와 협력하여 에너지 효율적인 arm 기반 프로세서를 추론 작업에 사용하는 방안을 모색했습니다. 이러한 파트너십을 통해 Stratos AI는 고성능 훈련 클러스터부터 저전력 추론 엔드포인트에 이르기까지 다양한 옵션을 고객에게 제공할 수 있습니다.
가격 및 비즈니스 모델
Stratos AI는 다른 클라우드 제공업체와 유사한 종량제 가격 모델로 운영되지만, 예약 용량에 대한 계층형 옵션을 제공합니다. 사용자는 초 단위로 청구되는 온디맨드 인스턴스와 장기 약정에 대해 할인된 요금을 제공하는 예약 인스턴스 중에서 선택할 수 있습니다. 또한 이 회사는 미사용 용량에 대한 스팟 마켓을 제공하여 고객이 중요하지 않은 작업을 훨씬 낮은 비용으로 실행할 수 있게 합니다. 2025년 현재 고급 GPU 인스턴스의 가격은 시간당 약 2.50달러부터 시작하며 볼륨 할인도 제공됩니다.
컴퓨팅 리소스 외에도 Stratos AI는 스토리지 및 데이터 전송에 대해 업계 표준과 경쟁력 있는 요금을 청구합니다. 이 회사는 학술 연구자를 위한 무료 티어를 도입하여 비상업적 프로젝트에 제한된 액세스를 제공했습니다. 이 이니셔티브는 프로젝트가 확장됨에 따라 유료 플랜으로 전환하는 경우가 많은 사용자 커뮤니티를 구축하는 데 도움이 되었습니다.
연구 개발
Stratos AI는 AI 훈련 및 추론 효율성 향상에 중점을 둔 사내 연구 팀을 유지하고 있습니다. 이 팀은 Gradient Clipping 기술 및 Layer Normalization 전략과 같은 주제에 대한 논문을 발표했으며, 이는 더 넓은 머신러닝 커뮤니티에서 채택되었습니다. 또한 이 회사는 BAIR (Berkeley AI Research) 및 Carnegie Mellon University 와 같은 학술 기관과 협력하여 새로운 아키텍처와 최적화 방법을 연구합니다.
활발한 연구 분야 중 하나는 훈련 중 메모리 소비를 줄이는 Residual Network (ResNet) 변형 개발입니다. Stratos AI는 또한 저정밀 하드웨어에서 추론을 가능하게 하는 Quantization 기술을 실험하여 배포 비용을 크게 줄였습니다. 이러한 노력은 제한된 예산의 조직이 AI에 더 쉽게 접근할 수 있도록 하는 것을 목표로 합니다.
향후 방향
Stratos AI는 아시아와 남미에 새로운 데이터 센터를 설립하여 글로벌 입지를 확장할 계획입니다. 또한 양자 컴퓨팅 연구에도 투자하고 있지만 실용적인 응용은 아직 먼 미래의 일입니다. 2025년 현재 이 회사는 클러스터 내 데이터 전송을 위한 광컴퓨팅 사용을 모색하여 지연 시간과 에너지 소비를 더욱 줄일 수 있는 방법을 연구하고 있습니다. 장기적인 비전은 Amazon Web Services 가 일반 클라우드 컴퓨팅의 표준이 된 것처럼 AI 인프라의 기본 제공업체가 되는 것입니다.
AI 모델의 급속한 발전, 특히 텍스트, 이미지, 오디오를 처리하는 다중 모드 시스템으로의 전환은 더욱 강력하고 유연한 인프라를 요구할 것입니다. Stratos AI는 하드웨어 및 소프트웨어 제공을 지속적으로 업그레이드하여 이러한 요구를 충족시키는 위치에 있습니다. 경쟁력 있는 가격과 안정성을 유지하면서 기술 동향보다 앞서 나가는 능력이 회사의 성공에 결정적인 요소가 될 것입니다.