Baseten Labs는 머신러닝 모델을 프로덕션 환경에서 배포, 확장, 서빙하기 위한 플랫폼을 제공하는 AI 인프라 기업이다. 2019년에 설립된 이 회사는 조직이 실험적인 AI 단계에서 안정적이고 고성능의 대규모 추론(inference) 단계로 전환할 수 있도록 지원하는 데 중점을 둔다. Baseten의 플랫폼은 특히 대규모 언어 모델 및 기타 생성형 AI 시스템과 같은 현대 머신러닝 모델의 계산 요구를 처리하도록 설계되었다.
이 회사는 모델 개발과 프로덕션 배포 사이의 다리 역할을 자처하며, AI 추론에 필요한 복잡한 인프라를 단순화하는 도구를 제공한다. 기본 하드웨어와 오케스트레이션을 추상화함으로써 Baseten은 데이터 과학 및 엔지니어링 팀이 서버 관리와 확장 로직에 신경 쓰기보다 모델 구축과 개선에 집중할 수 있게 한다. 이러한 접근 방식은 빠르게 성장하는 AI 인프라 분야에서 주요 업체로 자리매김하게 했으며, 주요 클라우드 제공업체 및 전문 스타트업의 서비스와 경쟁하고 있다.
플랫폼 및 아키텍처
Baseten의 핵심 제공 사항은 다양한 머신러닝 프레임워크와 모델 아키텍처를 지원하는 모델 서빙 플랫폼이다. 이 플랫폼은 아마존 웹 서비스 위에 구축되었으며, 쿠버네티스 스타일의 오케스트레이션을 활용하여 컴퓨팅 리소스를 동적으로 관리한다. PyTorch, TensorFlow, ONNX와 같은 인기 프레임워크를 지원하므로 사용자는 기존 코드를 최소한으로 변경하여 모델을 배포할 수 있다.
이 플랫폼은 챗봇, 추천 엔진, 자율 시스템과 같은 실시간 애플리케이션에 중요한 요구 사항인 저지연 추론을 위해 설계되었다. 자동 확장, GPU 최적화, 지능형 요청 라우팅과 같은 기능을 통해 이를 달성한다. Baseten은 또한 사용하지 않을 때 0으로 확장되는 서버리스 추론 옵션을 제공하여 변동이 심한 트래픽 패턴을 가진 워크로드의 비용을 절감한다.
주요 아키텍처 구성 요소는 대부분의 현대 대규모 언어 모델의 기반이 되는 트랜스포머 기반 모델 지원이다. 이 플랫폼에는 효율적인 어텐션 메커니즘과 배칭 전략과 같은 트랜스포머 추론 최적화 기능이 포함되어 있어 처리량을 극대화하고 지연 시간을 최소화한다. 따라서 GPT, BERT 및 그 파생 모델과 같은 모델을 배포하는 데 특히 적합하다.
성능 및 최적화
Baseten은 성능 최적화를 핵심 가치 제안으로 강조한다. 이 플랫폼은 낮은 정밀도 산술을 사용하여 메모리 사용량을 줄이고 추론 속도를 높이는 모델 양자화 도구를 제공한다. 또한 모델 가지치기 및 기타 압축 기술을 지원하여 정확도를 크게 떨어뜨리지 않으면서 효율성을 더욱 향상시킨다.
이 회사는 표준 배포 방법보다 상당한 성능 향상을 보여주는 벤치마크를 발표했다. 예를 들어 Baseten은 유사한 하드웨어에서 단순 구현에 비해 최대 10배 낮은 지연 시간과 5배 높은 처리량을 달성한다고 주장한다. 이러한 최적화는 주어진 트래픽 부하를 서빙하는 데 필요한 GPU 수를 직접 줄여주므로 비용에 민감한 애플리케이션에 특히 중요하다.
Baseten은 또한 Python SDK와 REST API를 제공하여 기존 워크플로우와 쉽게 통합할 수 있다. 이 플랫폼에는 모니터링 및 관찰 기능이 포함되어 있어 사용자가 추론 지연 시간, 오류율, 리소스 활용도를 실시간으로 추적할 수 있다. 이 데이터는 팀이 병목 현상을 식별하고 모델과 인프라를 지속적으로 최적화하는 데 도움이 된다.
사용 사례 및 고객
Baseten은 금융, 의료, 전자상거래, 미디어 등 다양한 산업의 고객에게 서비스를 제공한다. 일반적인 사용 사례로는 AI 기반 검색, 콘텐츠 생성, 사기 탐지, 개인화된 추천 기능이 있다. 이 플랫폼은 광범위한 사내 인프라를 구축하지 않고도 AI 기능을 빠르게 확장해야 하는 스타트업과 중견 기업 사이에서 특히 인기가 높다.
주목할 만한 사용 사례 중 하나는 챗봇 및 텍스트 요약 도구와 같은 생성형 AI 애플리케이션 배포이다. 대규모 언어 모델의 높은 계산 요구를 처리하는 Baseten의 능력은 이러한 애플리케이션에 자연스러운 선택지가 된다. 이 회사는 또한 다양한 모델 제공업체 및 오픈소스 커뮤니티와 협력하여 몇 번의 클릭으로 배포할 수 있는 사전 훈련된 모델을 제공한다.
Baseten은 전체 고객 목록을 공개적으로 공개하지 않지만 AI 및 기술 분야 기업과의 협업을 강조해 왔다. 플랫폼의 유연성 덕분에 배치 처리와 실시간 추론을 모두 지원하여 다양한 애플리케이션 요구 사항을 충족할 수 있다.
경쟁 구도
AI 추론 시장은 경쟁이 치열하며, AWS, 마이크로소프트 애저, 구글 클라우드와 같은 주요 클라우드 제공업체가 자체 모델 서빙 솔루션을 제공한다. 이러한 플랫폼은 각자의 클라우드 생태계와의 긴밀한 통합 및 광범위한 기업 관계의 이점을 누린다. 그러나 Baseten은 성능 최적화와 사용 편의성에 중점을 두어 차별화하며, GPU 기반 워크로드에서 종종 우수한 지연 시간과 비용 효율성을 제공한다.
Groq 및 SambaNova Systems와 같은 전문 스타트업도 이 분야에서 경쟁하지만, 일반적으로 맞춤형 하드웨어와 칩에 초점을 맞춘다. 반면 Baseten은 하드웨어에 구애받지 않으며 표준 클라우드 GPU에서 실행되므로 더 광범위한 사용자에게 접근성을 제공한다. 이러한 접근 방식은 고객이 특수 인프라에 투자하지 않고도 엔비디아 및 AMD의 최신 GPU 제공 사항을 활용할 수 있게 한다.
이 회사는 또한 유사한 기능을 제공하지만 배포 및 관리에 더 많은 기술적 전문 지식이 필요한 Ray 및 vLLM과 같은 오픈소스 도구와도 경쟁한다. Baseten의 관리형 서비스 모델은 내장된 지원과 유지보수를 갖춘 턴키 솔루션을 선호하는 팀에게 매력적이다.
자금 및 성장
Baseten은 AI 인프라에 대한 증가하는 수요를 반영하여 상당한 벤처 캐피탈 투자를 유치했다. 이 회사는 2023년 IVP가 주도하고 Basis Set Ventures 및 Bloomberg Beta를 포함한 기존 투자자가 참여한 4,000만 달러 규모의 시리즈 B 라운드를 조달했다. 이 자금은 엔지니어링 팀 확장, 플랫폼 기능 강화, 고객 확보 노력 확대에 사용되었다.
회사의 성장은 산업 전반에 걸친 생성형 AI의 빠른 채택에 힘입은 바 크다. 점점 더 많은 조직이 대규모 언어 모델을 프로덕션에 배포하려고 함에 따라 안정적이고 효율적인 추론 플랫폼에 대한 수요가 급증했다. Baseten은 이러한 추세를 활용하여 강력한 매출 성장을 보고하고 고객 기반을 확장해 왔다.
앞으로 Baseten은 성능 최적화와 개발자 경험에 계속 투자할 계획이다. 또한 신흥 하드웨어 가속기 및 엣지 배포 시나리오 지원을 모색하여 AI 인프라 혁신의 최전선에 서는 것을 목표로 한다. AI 산업이 아직 초기 단계에 있는 가운데, 실용적이고 확장 가능한 추론 솔루션에 대한 Baseten의 초점은 지속적인 성장에 유리한 위치를 제공한다.