DBRX는 Mosaic이 모회사 Databricks 아래에서 개발하고 2024년 3월 27일에 Databricks 오픈 모델 라이선스로 출시한 대규모 언어 모델이다. 이는 혼합 전문가 Transformer (architecture) 모델로, 총 1,320억 개의 파라미터를 가지며 각 토큰에 대해 16개 전문가 중 4개를 사용하여 360억 개의 활성 파라미터를 갖는다. 출시된 모델은 기본 파운데이션 모델과 명령어 튜닝 변형의 두 가지 버전으로 제공된다.
출시 당시 DBRX는 언어 이해, 프로그래밍 능력, 수학을 다루는 여러 벤치마크에서 Meta의 Llama 2, Mistral AI의 Mixtral, xAI의 Grok-1과 같은 주요 모델을 능가하는 성능을 보였다. 그 아키텍처와 훈련 접근 방식은 빠르게 진화하는 Generative AI 환경에서 경쟁력 있는 오픈 가중치 대안으로 자리매김하게 했다.
아키텍처 및 설계
DBRX는 혼합 전문가(MoE) 아키텍처를 사용하는데, 이는 모델의 파라미터를 여러 특화된 "전문가" 네트워크로 나누는 설계이다. 각 입력 토큰에 대해 게이팅 메커니즘이 처리할 전문가의 하위 집합을 선택하여, 총 파라미터 수를 확장하면서도 토큰당 계산 비용을 관리 가능한 수준으로 유지한다. DBRX에서는 16개의 전문가가 있지만 토큰당 4개만 활성화되어 총 1,320억 개 중 360억 개의 활성 파라미터를 갖는다. 이러한 희소 활성화는 유사한 크기의 밀집 모델에 비해 효율적인 추론과 훈련을 가능하게 한다.
이 모델은 Transformer (architecture) 아키텍처를 기반으로 하며, Multi-Head Attention 메커니즘을 사용하여 순차 데이터를 처리한다. DBRX는 Layer Normalization 및 Positional Encoding과 같은 현대 LLM에서 흔한 기법을 통합하여 훈련을 안정화하고 토큰 순서를 포착한다. 혼합 전문가 접근 방식은 Model Pruning의 역방향 형태로, 파라미터를 제거하는 대신 일부만 선택적으로 사용하여 계산 오버헤드를 줄인다.
훈련 및 개발
DBRX는 3,072개의 Nvidia H100 GPU를 InfiniBand를 통해 초당 3.2테라바이트 대역폭으로 연결하여 2.5개월 동안 훈련되었다. 보고된 훈련 비용은 미화 1,000만 달러로, 일부 동시대 모델에 비해 상대적으로 적은 금액이며, 이는 MoE 설계의 효율성과 훈련 파이프라인의 최적화를 반영한다. 훈련 데이터는 다양한 텍스트와 코드 말뭉치로 구성되었지만, 구체적인 세부 사항은 완전히 공개되지 않았다.
개발은 2023년 Databricks에 인수된 Mosaic이 주도했으며, 이 회사는 Machine learning 모델의 효율적인 훈련을 전문으로 했다. 분산 훈련과 최적화에 대한 Mosaic의 전문성은 비교적 짧은 훈련 기간과 비용에 기여했다. 모델은 Gradient Clipping 및 Learning Rate Scheduling 조정과 같은 기법을 사용하여 안정성을 보장하며 훈련되었다.
성능 및 벤치마크
출시 당시 DBRX는 다양한 벤치마크에서 강력한 성능을 보여주었다. 언어 이해 작업에서는 Llama 2와 Mixtral을 능가하여 개선된 추론과 이해력을 보여주었다. 프로그래밍 벤치마크에서는 DBRX가 코드 생성과 디버깅에서 뛰어나 Grok-1을 능가했다. 수학적 추론은 DBRX가 경쟁력 있는 결과를 보여준 또 다른 영역으로, 더 큰 활성 파라미터 수를 가진 모델과 자주 일치하거나 초과했다.
이러한 결과는 DBRX가 밀집 1,320억 파라미터 모델의 전체 계산 비용 없이 높은 정확도를 달성할 수 있게 하는 혼합 전문가 접근 방식의 효과를 강조했다. 명령어 튜닝 변형은 대화형 및 작업 지향 애플리케이션에 최적화되어 인간 선호 정렬 작업에서 성능을 더욱 향상시켰다.
출시 및 라이선스
DBRX는 상업적 애플리케이션을 포함한 광범위한 사용을 허용하되 특정 제한이 있는 Databricks 오픈 모델 라이선스로 출시되었다. 오픈 출시를 통해 연구자와 개발자는 모델 가중치에 접근할 수 있어 추가 실험과 미세 조정이 용이해졌다. 이러한 움직임은 OpenAI 및 Anthropic과 같은 조직의 다른 출시에서 볼 수 있듯이 Artificial intelligence 커뮤니티의 오픈 가중치 모델 추세와 일치했지만, 이러한 모델은 종종 독점적으로 유지된다.
기본 및 명령어 튜닝 버전 모두 제공됨에 따라 연구부터 프로덕션 배포까지 다양한 사용 사례에 유연성을 제공했다. Databricks는 DBRX를 기업용 도구로 포지셔닝하고 데이터 플랫폼 및 클라우드 서비스와 통합했으며, 여기에는 Amazon Web Services 및 Microsoft Azure가 포함된다.
영향 및 유산
DBRX는 효율적인 MoE 아키텍처가 더 큰 독점 모델과 경쟁할 수 있음을 보여주며 오픈소스 LLM의 경쟁 구도에 기여했다. 상대적으로 낮은 훈련 비용과 높은 성능은 이후 모델 개발의 기준점이 되었다. DBRX의 성공은 이후 다른 주요 업체들이 채택한 MoE 설계에 대한 추가 투자를 장려했다.
Deep learning의 더 넓은 맥락에서 DBRX는 계산 예산을 관리하면서 모델 용량을 확장하는 추세를 예시했다. 그 출시는 또한 Nvidia H100 GPU와 같은 특수 하드웨어의 역할과 대규모 모델 훈련에서 고대역폭 상호 연결의 중요성을 강조했다. 2025년 초 현재 DBRX는 오픈 가중치 MoE 모델의 주목할 만한 사례로 남아 있지만, 이후 더 개선된 기능을 가진 새로운 모델이 등장했다.