Jamba는 2024년 2월 AI21 Labs가 출시한 대규모 언어 모델이다. Mamba 상태 공간 모델(SSM)과 기존 Transformer를 결합한 하이브리드 아키텍처와 최대 256,000개의 토큰을 처리할 수 있는 대규모 컨텍스트 창으로 주목받았다. 이 모델은 오픈 가중치로 출시되어 연구자와 개발자가 다운로드하여 사용할 수 있었으며, 성능과 계산 효율성의 균형을 맞추기 위해 혼합 전문가(MoE) 설계를 채택했다.
이번 출시는 대부분의 현대 대규모 언어 모델의 기반이 되는 표준 Transformer 아키텍처의 대안을 탐구하는 데 있어 중요한 단계로 평가되었다. AI21 Labs는 긴 시퀀스를 선형 시간으로 처리하는 Mamba SSM을 Transformer의 주의 메커니즘의 검증된 강점과 통합함으로써, 매우 긴 컨텍스트를 처리할 때 발생하는 계산 문제를 해결하고자 했다.
배경 및 개발
AI21 Labs는 2017년 11월 텔아비브에서 Yoav Shoham, Ori Goshen, Amnon Shashua에 의해 설립되었으며, 이전에 Jurassic 시리즈 언어 모델을 개발한 바 있다. 2021년 8월에 출시된 Jurassic-1과 2023년 3월의 Jurassic-2를 포함한 초기 작업은 자연어 처리 분야에서의 전문성을 확립했다. Jamba는 이러한 순수 Transformer 기반 모델에서 벗어나, 2023년 후반에 Albert Gu와 Tri Dao를 포함한 연구자들이 도입한 Mamba 아키텍처를 통합한 것이 특징이다.
Jamba의 개발은 주의 기반 메커니즘의 잠재적 보완 또는 대안으로 상태 공간 모델을 탐구하는 광범위한 연구 추세의 일부였다. 선택적 상태 공간으로 알려진 Mamba 아키텍처는 표준 주의의 이차적 확장과 달리 시퀀스 길이에 따라 선형적으로 확장되는 계산 복잡성으로 시퀀스를 처리할 수 있는 방법을 제공했다. AI21 Labs는 이러한 효율성을 복잡한 추론과 맥락 이해가 필요한 작업에서 Transformer의 입증된 능력과 결합하고자 했다.
아키텍처 및 기술 세부 사항
Jamba의 아키텍처는 Mamba SSM 레이어와 Transformer 레이어가 교차된 패턴으로 배열된 하이브리드 구조이다. 이 모델은 피드포워드 레이어 내에서 혼합 전문가(MoE) 접근 방식을 사용하여 각 토큰에 대해 매개변수의 하위 집합만 활성화함으로써 모델 용량을 희생하지 않으면서 추론 효율성을 향상시킨다. 총 매개변수 수는 상당하지만, MoE 설계 덕분에 토큰당 활성 매개변수는 훨씬 적다.
256,000개 토큰의 컨텍스트 창은 핵심 판매 포인트였으며, 전체 책이나 방대한 코드베이스와 같은 매우 긴 문서를 한 번에 처리할 수 있게 했다. 이 기능은 장거리 의존성을 효율적으로 처리하는 Mamba 레이어 덕분에 가능했다. 이 모델은 여러 크기로 출시되었으며, 가장 큰 버전은 총 520억 개의 매개변수를 가지며, 그중 120억 개가 주어진 토큰에 대해 활성화된다.
출시 및 이용 가능성
AI21 Labs는 2024년 2월 28일 Jamba를 발표하고 모델 가중치를 오픈 라이선스로 공개했다. 이를 통해 연구 커뮤니티는 자체 인프라에서 모델을 미세 조정하고 배포할 수 있었다. 출시에는 모델 체크포인트와 문서가 포함되었으며, 모델은 Hugging Face와 같은 플랫폼에서 제공되었다. 오픈 가중치 접근 방식은 OpenAI 및 Anthropic과 같은 경쟁사의 폐쇄형 모델과 대조되었지만, AI21 Labs는 AI21 Studio 플랫폼을 통해 상업적 접근도 제공했다.
출시 시점은 Jamba를 OpenAI의 GPT-4, Anthropic의 Claude, Google DeepMind의 Gemini와 같은 모델이 지배하는 경쟁 환경에 위치시켰다. Jamba는 전반적인 벤치마크 성능에서 이러한 최첨단 모델을 따라잡지 못했지만, 독특한 아키텍처와 긴 컨텍스트 창은 특히 광범위한 문서 처리가 필요한 응용 분야에서 이 분야에 주목할 만한 기여를 했다.
성능 및 벤치마크
AI21 Labs가 보고한 벤치마크에서 Jamba는 긴 문서 요약 및 질의응답과 같은 장기 컨텍스트 이해 작업에서 강력한 성능을 보여주었다. 이 모델은 Mixtral 8x7B와 같은 유사한 크기의 다른 오픈 가중치 모델과 경쟁력 있는 성능을 보였으며, 더 긴 컨텍스트 창을 제공했다. MMLU 및 HellaSwag과 같은 표준 자연어 처리 벤치마크에서 Jamba의 성능은 견고했지만 최첨단은 아니었으며, 이는 하이브리드 설계의 절충을 반영했다.
Mamba 레이어의 효율성 이점은 처리량 테스트에서 강조되었으며, Jamba는 동일한 크기의 순수 Transformer 모델보다 더 높은 토큰 생성 속도를 보여주었다. 이는 엣지 디바이스나 실시간 응답이 필요한 응용 프로그램과 같은 자원 제약 환경에서의 배포에 매력적이었다.
반응 및 영향
Jamba의 출시는 특히 Transformer 아키텍처의 대안을 탐구하는 연구자들 사이에서 머신 러닝 커뮤니티의 관심을 받았다. 모델의 오픈 가중치는 하이브리드 SSM-Transformer 설계에 대한 추가 연구를 촉진했으며, 여러 후속 연구에서 Jamba를 영감으로 인용했다. 이 모델은 또한 상태 공간 모델이 생산 준비가 된 규모로 확장될 수 있음을 보여주어 이 연구 분야에 대한 투자를 장려했다.
비평가들은 일부 벤치마크에서 Jamba의 성능이 선도적인 폐쇄형 모델과 일치하지 않으며, 아키텍처의 복잡성이 미세 조정과 배포에 어려움을 초래할 수 있다고 지적했다. 그러나 모델의 긴 컨텍스트 창과 효율성은 진정한 장점으로 여겨졌으며, AI21 Labs는 후속 출시를 통해 설계를 계속 개선했다.
후속 개발
초기 Jamba 출시 이후, AI21 Labs는 모델 제품군을 계속 개발했다. 2024년 9월, 회사는 Amazon Web Services와 협력하여 Jamba 1.5 제품군을 Amazon Bedrock에서 제공하고 기업 응용 프로그램에 통합했다. 2025년 3월, AI21 Labs는 기업 전용 배포를 위한 Jamba 1.6을 출시하고 여러 벤치마크에서 성능이 개선되었다고 주장했다. 같은 달에 회사는 AI 계획 시스템인 Maestro도 출시했다.
이후 버전들은 하이브리드 아키텍처를 개선하고 모델의 기능을 확장했지만, Mamba SSM과 Transformer 레이어를 결합한 핵심 혁신은 중심에 남았다. Jamba 제품군은 Meta 및 Mistral AI와 같은 조직과 함께 오픈 가중치 모델 분야에서 AI21 Labs를 중요한 플레이어로 자리매김하게 했다.
AI 연구에서의 중요성
Jamba의 출시는 딥 러닝의 아키텍처 혁신에 대한 지속적인 탐구에 기여했다. 하이브리드 접근 방식의 성공은 미래의 대규모 언어 모델이 주의 메커니즘에만 의존하지 않고 다른 시퀀스 처리 기술을 통합할 수 있음을 시사했다. 또한 이 모델은 대규모 모델의 훈련 및 배포 비용에 대한 우려가 커지면서 AI 개발에서 효율성의 중요성을 강조했다.
오픈 가중치 출시는 학술 기관과 독립 연구자들이 모델의 동작을 연구할 수 있게 하여 다양한 아키텍처 구성 요소가 어떻게 상호 작용하는지에 대한 더 넓은 이해에 기여했다. 이러한 투명성은 많은 선도 모델이 폐쇄된 분야에서 가치가 있었으며, 고급 AI 기술에 대한 접근을 민주화하는 데 도움이 되었다.