DBRX는 2024년 3월에 출시된 Databricks가 개발한 오픈소스 대규모 언어 모델이다. 이 모델은 혼합 전문가(MoE) 아키텍처를 사용하며, 각 입력에 대해 매개변수의 일부만 활성화하여 높은 성능을 유지하면서 효율적인 추론을 가능하게 한다. 이 모델은 OpenAI 및 Anthropic의 독점 시스템에 대한 경쟁력 있는 대안으로 자리 잡았으며, Databricks는 개방형 가용성과 비용 효율적인 운영을 강조했다.
DBRX의 출시는 Databricks가 데이터 플랫폼에 생성형 AI 기능을 통합하려는 전략에서 중요한 단계였다. 이는 회사가 이전에 도입한 더 작은 오픈소스 모델인 Dolly와 2023년 MosaicML 인수에 이어 이루어졌다. DBRX는 데이터 분석 및 인공지능을 위한 클라우드 기반 플랫폼을 포함한 회사의 기존 인프라를 기반으로 구축되었으며, Amazon Web Services, Microsoft Azure, Google Cloud에서 기본적으로 운영된다.
아키텍처 및 설계
DBRX는 혼합 전문가 아키텍처를 활용한다. 이 기술은 계산 비용을 비례적으로 증가시키지 않고 매개변수를 확장할 수 있는 능력으로 대규모 언어 모델에서 두각을 나타내고 있다. 모델에는 총 1320억 개의 매개변수가 있지만, 주어진 순방향 패스 중에는 360억 개만 활성화된다. 이러한 희소 활성화는 각 토큰에 가장 관련성 높은 전문가를 선택하는 라우터 네트워크를 통해 달성되며, 이 메커니즘은 멀티 헤드 어텐션 및 트랜스포머 아키텍처의 다른 구성 요소와 관련이 있다.
MoE 설계를 통해 DBRX는 훨씬 더 작은 모델과 비교할 수 있는 추론 속도를 달성하면서도 더 큰 네트워크의 지식 용량을 유지할 수 있다. Databricks는 DBRX가 언어 이해, 추론, 코드 생성 측정을 포함한 여러 벤치마크에서 기존 오픈소스 모델을 능가한다고 보고했다. 모델은 대규모 텍스트 및 코드 말뭉치로 훈련되었으며, Databricks는 고품질 데이터 큐레이션 및 필터링 기술의 사용을 강조했다.
훈련 및 개발
DBRX는 2013년 Apache Spark의 원래 창시자들이 캘리포니아 대학교 버클리에서 설립한 Databricks에 의해 개발되었다. 훈련 과정은 회사의 자체 인프라, 즉 머신 러닝 플랫폼과 2023년에 인수한 MosaicML 훈련 도구 키트를 활용했다. 회사는 정확한 컴퓨팅 리소스를 공개하지 않았지만, 유사한 모델에 비해 상대적으로 짧은 기간에 훈련이 완료되었다고 밝혔다.
DBRX의 개발은 독점 제공과 경쟁하는 오픈소스 모델을 향한 생성형 AI의 더 넓은 추세의 일부였다. Databricks는 DBRX를 조직이 자체 환경에 배포할 수 있는 모델로 자리 매김하여 외부 API로 데이터를 보낼 필요를 없앴다. 이 접근 방식은 보안 경계 내에서 관리형 AI 인프라를 제공하는 회사의 초점과 일치했으며, 이 기능은 타사 모델과의 통합에도 적용된다.
성능 및 벤치마크
Databricks는 출시 당시 DBRX에 대한 벤치마크 결과를 공개하여 오픈소스 및 독점 모델 모두에 대해 경쟁력 있는 성능을 보여주었다. 57개 주제에 걸친 광범위한 지식을 테스트하는 MMLU 벤치마크에서 DBRX는 73.7%를 기록하여 여러 기존 오픈소스 모델을 능가했다. 코드 생성용 HumanEval 벤치마크에서 DBRX는 pass@1 점수 70.1%를 달성하여 당시 오픈소스 모델로서 강력한 결과를 보여주었다.
모델은 또한 초등학교 수학 문제용 GSM8K 벤치마크에서 72.8%를 기록하는 등 추론 작업에서 강력한 성능을 입증했다. Databricks는 이러한 결과를 MoE 아키텍처와 훈련 데이터의 품질 덕분으로 돌렸다. 그러나 회사는 Google DeepMind 또는 OpenAI의 가장 고급 독점 모델과의 직접 비교를 제공하지 않았으며, 출시 후 몇 달 동안 독립적인 평가는 제한적이었다.
오픈소스 출시 및 가용성
DBRX는 오픈소스 라이선스로 출시되어 연구자와 개발자가 모델을 자유롭게 다운로드, 수정, 배포할 수 있게 했다. 가중치는 Hugging Face와 같은 플랫폼을 통해 제공되었으며, Databricks는 미세 조정 및 추론을 위한 문서와 예제를 제공했다. 이 출시는 당시 대부분의 오픈소스 모델이 훨씬 더 작았기 때문에 크기 면에서 주목할 만했으며, 독점 시스템에 근접한 성능 면에서도 주목할 만했다.
DBRX의 오픈소스 특성은 OpenAI와 Anthropic의 폐쇄적 접근 방식과 대조되는 Databricks의 의도적인 선택이었다. 회사는 오픈 모델이 특히 규제 산업의 기업에 더 큰 투명성과 통제력을 제공한다고 주장했다. DBRX는 또한 데이터 인텔리전스 플랫폼과 AI 에이전트 구축 도구를 포함한 Databricks 자체 제품 제공의 기반이 되었다.
Databricks 플랫폼과의 통합
DBRX는 데이터 엔지니어링, 데이터 과학, AI를 위한 통합 환경을 제공하는 Databricks 플랫폼에 통합되었다. 사용자는 배치 및 실시간 추론을 모두 지원하는 플랫폼의 모델 서빙 기능을 통해 DBRX에 액세스할 수 있었다. 통합을 통해 조직은 DBRX를 Databricks가 개척한 데이터 웨어하우스와 데이터 레이크의 하이브리드인 레이크하우스 아키텍처에 저장된 자체 데이터와 결합할 수 있었다.
플랫폼은 또한 AI 피드백 기반 강화 학습 및 커리큘럼 학습과 같은 기술을 사용하여 사용자 정의 데이터 세트에서 DBRX를 미세 조정하는 도구를 제공했다. Databricks는 이러한 기능을 기업이 처음부터 훈련하는 비용 없이 도메인별 모델을 구축할 수 있는 방법으로 자리 매김했다. 회사의 더 넓은 전략은 자체 오픈소스 출시와 함께 파트너의 독점 모델을 포함한 다양한 모델을 제공하는 것이었다.
시장 맥락 및 반응
DBRX의 출시는 대규모 언어 모델 공간에서 치열한 경쟁이 벌어지던 시기에 발생했다. OpenAI는 2023년 3월 GPT-4를 출시했고, Anthropic은 DBRX보다 몇 주 전인 2024년 3월 Claude 3를 도입했다. 이 출시는 Databricks의 재정 성장과 관련된 시점에서도 주목할 만했으며, 회사는 2023 회계 연도에 16억 달러의 매출을 보고하고 상당한 자금 조달 라운드를 진행했다.
DBRX에 대한 반응은 일반적으로 긍정적이었으며, 리뷰어들은 크기 대비 성능과 오픈 라이선스를 칭찬했다. 일부 분석가들은 MoE 아키텍처가 희소 활성화로 컴퓨팅 요구 사항을 줄여 비용에 민감한 배포에 특히 매력적이라고 지적했다. 그러나 모델은 더 확립된 오픈소스 모델과 더 작고 효율적인 모델의 인기 증가와 경쟁하면서 생태계 채택 측면에서 어려움에 직면했다.
영향 및 유산
DBRX는 오픈소스 모델이 독점 시스템과의 격차를 좁히는 더 넓은 추세에 기여했다. 출시는 MoE 아키텍처가 대규모로 효과적으로 훈련되고 배포될 수 있음을 입증하여 다른 조직의 후속 모델 설계에 영향을 미쳤다. Databricks는 AI 기능 개발을 계속하여 나중에 AI 에이전트 구축용 Agent Bricks 제품군과 AI 애플리케이션용 데이터베이스인 Lakebase를 포함한 추가 모델과 도구를 도입했다.
모델은 또한 엔터프라이즈 소프트웨어 회사에게 오픈소스 AI의 전략적 중요성을 강조했다. DBRX를 출시함으로써 Databricks는 인프라와 모델을 모두 제공하는 제공자로 자리 매김하여 클라우드 제공자 및 AI 스타트업과 경쟁했다. 2025년 OpenAI 및 Anthropic과의 회사 후속 파트너십은 그들의 모델을 Databricks 플랫폼에 통합했으며, 자체 제공과 함께 다중 모델 접근 방식을 계속 지원했음을 보여주었다.
기술 사양
DBRX의 기술적 세부 사항은 Databricks가 발행한 기술 보고서와 블로그 게시물에 공개되었다. 모델은 피드포워드 네트워크를 대체하는 혼합 전문가 계층이 있는 표준 트랜스포머 디코더 아키텍처를 사용한다. 총 1320억 개의 매개변수가 있으며, 추론 중에는 360억 개가 활성화된다. 모델은 상당한 컴퓨팅 리소스가 필요한 대규모 데이터 세트인 12조 개의 텍스트 및 코드 토큰으로 훈련되었다.
모델은 32,768 토큰의 컨텍스트 길이를 지원하여 긴 문서와 대화를 처리할 수 있다. 100,000 토큰의 어휘를 가진 토크나이저를 사용하여 다양한 텍스트를 효율적으로 인코딩한다. Databricks는 또한 지침 따르기 및 채팅 기반 상호 작용에 최적화된 미세 조정 버전인 DBRX Instruct를 출시했다. 미세 조정 과정은 현대 언어 모델 개발에서 일반적인 기술인 지도 학습과 인간 피드백 기반 강화 학습을 사용했다.
현대 모델과의 비교
출시 당시 DBRX는 Meta의 Llama 2 및 Mistral의 Mixtral 8x7B를 포함한 여러 다른 오픈소스 모델과 비교되었다. DBRX는 일반적으로 특히 코드 생성 및 추론 작업에서 표준 벤치마크에서 이러한 모델을 능가했다. 모델의 성능은 일부 독점 모델과도 비교적 호의적으로 평가되었지만, OpenAI 또는 Google의 가장 고급 시스템에는 미치지 못했다.
MoE 아키텍처는 DBRX에게 추론 효율성에서 뚜렷한 이점을 제공했다. 활성 매개변수가 360억 개에 불과하여 유사한 총 크기의 밀집 모델보다 토큰당 더 적은 컴퓨팅이 필요했다. 이는 AMD 및 Intel 프로세서와 특수 가속기를 포함한 다양한 하드웨어에 배포하기에 적합하게 만들었다. Databricks는 특정 지연 시간 측정을 제공하지 않았지만, 아키텍처 설계는 경쟁력 있는 성능을 시사했다.
향후 개발
DBRX 출시 이후 Databricks는 AI 연구 및 개발에 계속 투자했다. 2025년 OpenAI와의 파트너십 및 2026년 Electric 인수를 포함한 회사의 후속 인수 및 파트너십은 AI 기능 확장에 초점을 맞추고 있음을 나타냈다. Databricks는 DBRX의 직접적인 후속 모델을 발표하지 않았지만, 모델의 아키텍처와 오픈소스 철학은 회사의 후속 제품에 영향을 미쳤다.
DBRX 출시 후 더 넓은 AI 환경은 빠르게 진화했으며, 새로운 모델과 기술이 정기적으로 등장했다. DBRX가 예시한 효율성과 개방형 가용성에 대한 강조는 조직이 비용 효율적이고 투명한 방식으로 AI를 배포하려고 함에 따라 업계의 핵심 주제로 남아 있었다. 모델 개발자이자 인프라 제공자로서의 Databricks의 역할은 이러한 추세에서 이점을 얻을 수 있는 위치에 있었다.