SambaNova Cloud는 AI 하드웨어 및 소프트웨어를 전문으로 하는 기업인 SambaNova Systems가 개발한 클라우드 기반 추론 플랫폼이다. 이 플랫폼은 개발자와 기업이 SambaNova의 맞춤형 주문형 집적 회로(ASIC)인 SambaNova Dataflow Processing Unit(DPU)을 사용하여 오픈소스 대규모 언어 모델(LLM)을 고속으로 실행할 수 있게 한다. 2023년에 출시된 SambaNova Cloud는 사용자가 Llama 3.1, Llama 3.2, Qwen 2.5 및 기타 인기 있는 오픈소스 모델에 액세스할 수 있는 관리형 환경을 제공하며, 기본 인프라를 관리할 필요가 없다. 이 서비스는 실험을 위한 무료 플레이그라운드와 프로덕션 사용을 위한 유료 API를 모두 제공하며, 저지연 추론과 비용 효율성에 중점을 둔다.
이 플랫폼은 1,040억 개의 트랜지스터를 통합하고 최대 256GB의 온칩 메모리를 지원하는 2세대 DPU인 SambaNova SN40L 칩을 기반으로 구축되었다. 이 하드웨어 아키텍처는 대부분의 현대 LLM의 기반이 되는 트랜스포머 기반 모델을 가속화하도록 설계되었다. SambaNova Cloud는 GPU 기반 대안보다 훨씬 빠른 추론 속도를 제공한다고 주장하며, 일부 벤치마크에서는 Llama 3.1 405B와 같은 모델에서 최대 3배의 처리량 개선을 보여준다. 이 서비스는 텍스트 생성과 비전-언어 모델을 포함한 멀티모달 작업을 모두 지원하며, 배치 처리, 스트리밍 응답 및 미세 조정 기능과 같은 기능을 제공한다.
역사 및 개발
SambaNova Systems는 2017년 스탠포드 대학 교수인 Kunle Olukotun과 역시 스탠포드 교수인 Chris Ré, 그리고 엔지니어와 연구원 팀에 의해 설립되었다. 이 회사는 처음에 기업 고객을 위한 하드웨어와 소프트웨어를 포함한 풀스택 AI 솔루션 구축에 집중했다. 2023년, SambaNova는 클라우드 우선 전략으로 전환하여 고성능 AI 추론에 대한 액세스를 민주화하기 위해 SambaNova Cloud를 공개 플랫폼으로 출시했다. 플랫폼의 첫 공개 릴리스는 2023년 9월에 이루어졌으며, Llama 2 및 CodeLlama와 같은 모델에 대한 액세스를 제공했다. 그 이후로 플랫폼은 모델 카탈로그를 확장하고 OpenAI의 API 형식과 호환되는 SambaNova Cloud API와 같은 기능을 도입하여 개발자가 다른 제공업체에서 쉽게 전환할 수 있게 했다.
2024년, SambaNova Cloud는 특히 Llama 3.1 출시 이후 상당한 traction을 얻었으며, 플랫폼은 이 모델을 고속으로 제공했다. 이 회사는 또한 과학 연구를 위한 AI 추론 기능을 제공하기 위해 미국 에너지부를 포함한 다양한 조직과 파트너십을 발표했다. 2025년 초까지 SambaNova Cloud는 수십억 개의 토큰을 처리했으며 수천 명의 개발자와 기업이 사용했다.
하드웨어 및 성능
SambaNova Cloud의 핵심은 기존 GPU와 다른 재구성 가능한 데이터플로우 아키텍처인 SN40L 칩이다. 고정 명령어 세트를 사용하는 GPU와 달리 SN40L은 특정 모델 아키텍처에 맞게 데이터 흐름을 최적화하도록 동적으로 재구성될 수 있다. 이를 통해 트랜스포머 모델을 효율적으로 실행하여 메모리 병목 현상을 줄이고 처리량을 개선할 수 있다. SN40L 칩은 1,040억 개의 트랜지스터를 포함하고 과도한 데이터 이동 없이 대규모 모델을 처리하는 데 중요한 256GB의 온칩 고대역폭 메모리(HBM)를 갖추고 있다. SambaNova는 이 아키텍처가 Llama 3.1 405B와 같은 모델에서 선도적인 GPU 기반 솔루션보다 최대 3배 빠른 추론을 가능하게 하면서도 전력 소비는 더 적다고 주장한다.
실제로 SambaNova Cloud는 타사 벤치마크에서 인상적인 성능을 입증했다. 예를 들어, 2024년 Artificial Analysis의 평가에서 SambaNova Cloud는 Llama 3.1 405B에 대해 가장 높은 처리량을 달성하여 사용자당 초당 200개 이상의 토큰을 제공했다. 이 플랫폼은 또한 많은 모델에서 첫 토큰까지의 시간이 종종 1초 미만인 저지연 응답을 지원한다. 이러한 성능 특성은 SambaNova Cloud를 챗봇, 코드 생성 및 요약과 같은 실시간 애플리케이션에 매력적으로 만든다.
모델 카탈로그 및 기능
SambaNova Cloud는 Llama 3.1(8B, 70B, 405B), Llama 3.2(1B, 3B, 11B, 90B), Qwen 2.5(7B, 14B, 72B) 및 Mistral 7B를 포함한 성장하는 오픈소스 모델 카탈로그를 제공한다. 플랫폼은 또한 코드 생성을 위한 CodeLlama 및 Llama 3.2 Vision과 같은 비전-언어 모델과 같은 특수 모델을 지원한다. 사용자는 웹 플레이그라운드, REST API 또는 Python SDK를 통해 이러한 모델에 액세스할 수 있다. API는 OpenAI의 API와 드롭인 호환되도록 설계되어 개발자가 최소한의 변경으로 마이그레이션할 수 있다. 또한 SambaNova Cloud는 프로덕션급 애플리케이션을 구축하는 데 필수적인 JSON 모드, 함수 호출 및 스트리밍 응답과 같은 기능을 제공한다.
기업을 위해 SambaNova Cloud는 프라이빗 클러스터 및 온프레미스 배포를 포함한 전용 용량 옵션을 제공한다. 플랫폼은 또한 사용자 지정 데이터 세트에 대한 모델 미세 조정을 지원하여 조직이 오픈소스 모델을 특정 도메인에 적용할 수 있게 한다. 보안 기능에는 전송 중 및 저장 중 데이터 암호화와 SOC 2와 같은 표준 준수가 포함된다.
경쟁 구도
SambaNova Cloud는 OpenAI의 API, Anthropic의 Claude, Google Cloud의 Vertex AI를 포함한 다른 클라우드 AI 추론 제공업체 및 Cerebras 및 Groq와 같은 특수 AI 하드웨어 기업과 경쟁한다. AWS Trainium 및 Microsoft Azure와 같은 GPU 기반 클라우드가 범용 AI 서비스를 제공하는 반면, SambaNova Cloud는 오픈소스 모델에만 전념하고 맞춤형 하드웨어에서 고속 추론을 제공함으로써 차별화한다. 특수 칩에서 빠른 추론을 제공하는 Groq와 비교하여 SambaNova Cloud는 더 큰 모델(예: 405B)을 지원하고 더 포괄적인 기능 세트를 제공한다. 플랫폼의 가격은 대량 워크로드의 경우 일반적으로 GPU 기반 대안보다 낮아 추론 중심 애플리케이션에 비용 효율적인 선택이 된다.
사용 사례 및 채택
SambaNova Cloud는 금융, 의료 및 기술을 포함한 다양한 산업에서 사용된다. 예를 들어, 금융 기관은 실시간 문서 분석 및 위험 평가를 위해 플랫폼을 사용하고, 의료 기관은 의학 문헌 요약 및 임상 의사 결정 지원을 위해 활용한다. 플랫폼은 또한 학술 연구자와 스타트업이 AI 애플리케이션을 프로토타이핑하고 배포하는 데 채택되었다. 2024년, SambaNova Cloud는 미국 에너지부의 오크리지 국립연구소에 의해 과학 연구를 위한 AI 추론을 지원하도록 선택되어 신뢰성과 성능을 강조했다. 또한 플랫폼은 LangChain 및 LlamaIndex와 같은 도구에 통합되어 개발자가 복잡한 AI 워크플로우를 더 쉽게 구축할 수 있게 한다.
향후 방향
SambaNova Systems는 모델 카탈로그를 확장하고 미세 조정 기능을 강화할 계획으로 SambaNova Cloud 개선에 계속 투자하고 있다. 이 회사는 또한 성능과 효율성을 더욱 향상시킬 것으로 예상되는 SN50 칩과 같은 차세대 하드웨어를 개발 중이다. 오픈소스 LLM 추론에 대한 수요가 증가함에 따라 SambaNova Cloud는 고속, 비용 효율적인 AI 배포를 위한 선도적인 플랫폼으로 자리매김하는 것을 목표로 한다. 그러나 주요 클라우드 제공업체와 특수 스타트업이 모두 시장 점유율을 놓고 경쟁하는 등 경쟁 구도는 여전히 치열하다. SambaNova의 성공은 성능 우위를 유지하고 개발자와 기업 고객의 강력한 생태계를 구축하는 능력에 달려 있다.