영어에서 번역됨

DBRX는 Databricks 산하 Mosaic이 개발한 오픈소스 전문가 혼합(Mixture-of-Experts) 대규모 언어 모델로, 2024년 3월 27일에 공개되었으며, 총 1,320억 개의 파라미터와 토큰당 활성화되는 360억 개의 파라미터를 갖추고 있습니다.

DBRX는 Mosaic이 모회사인 Databricks 산하에서 개발한 대규모 언어 모델(LLM)이다. 2024년 3월 27일 Databricks 오픈 모델 라이선스로 출시되었으며, 총 1,320억 개의 파라미터 중 각 토큰에 대해 360억 개가 활성화되는 혼합 전문가(MoE) 트랜스포머 모델이다. 출시에는 기본 파운데이션 모델과 명령어 튜닝 변형이 모두 포함되었으며, 언어 이해, 프로그래밍, 수학 분야에서 선도적인 오픈 및 독점 모델과 경쟁하도록 설계되었다.

이 모델의 아키텍처와 훈련 방식은 생성형 AI 분야에서 효율적 확장을 추구하는 더 넓은 추세를 반영하며, 계산 비용을 줄이면서도 높은 용량을 유지하기 위해 희소 활성화를 사용한다. DBRX는 다른 오픈 모델에 대한 직접적인 도전자로 자리 잡았으며, 출시 당시 성능은 공개적으로 이용 가능한 시스템에 대한 새로운 기준을 세웠다.

아키텍처 및 설계

DBRX는 트랜스포머 모델의 변형인 혼합 전문가(MoE) 아키텍처를 사용하며, 각 토큰을 전문가 네트워크의 하위 집합을 통해 라우팅한다. 이 모델은 16개의 전문가를 포함하며, 각 토큰에 대해 4개가 활성화되어 총 1,320억 개의 파라미터 중 360억 개가 활성화된다. 이러한 희소 설계는 유사한 규모의 밀집 모델과 비교하여 추론 및 훈련 계산량을 줄인다.

이 모델은 멀티헤드 어텐션 및 위치 인코딩을 갖춘 표준 디코더 전용 트랜스포머 구조를 사용하지만, 전문가 특화를 개선하기 위해 세분화된 라우팅을 통합한다. 각 전문가는 피드포워드 네트워크이며, 학습된 게이팅 메커니즘이 각 토큰을 처리할 전문가를 선택한다. 이 접근 방식은 Mixtral과 같은 다른 MoE 시스템과 유사하게 모델이 용량을 동적으로 할당할 수 있게 한다.

DBRX는 또한 대규모 훈련 안정성을 향상시키는 층 정규화 및 잔차 연결과 같은 아키텍처 개선을 포함한다. 명령어 튜닝 변형은 RLHF(인간 피드백 기반 강화 학습)를 사용하여 추가로 정제되었으며, 대화 및 작업 완료를 위해 출력을 인간의 선호도에 맞춘다.

훈련 및 컴퓨트

DBRX 훈련에는 InfiniBand로 연결된 3,072개의 Nvidia H100 GPU가 사용되었으며, 대역폭은 초당 3.2테라바이트였다. 훈련에는 약 2.5개월이 소요되었으며, 총 비용은 미화 1천만 달러로 보고되었다. 이는 최첨단 LLM에 필요한 상당한 컴퓨팅 자원을 강조한다. 훈련 데이터는 다양한 텍스트 및 코드 말뭉치로 구성되었지만, Databricks는 데이터 구성의 세부 사항을 공개하지 않았다.

훈련 과정은 수천 단계에 걸쳐 안정성을 보장하기 위해 기울기 클리핑 및 학습률 스케줄과 같은 기술을 활용했다. Nvidia H100을 사용한 하드웨어 설정은 이 기간 동안 대규모 딥러닝에서 Nvidia급 가속기의 지배적인 역할을 반영하며, AMD 및 AWS Trainium과 같은 경쟁사도 등장하고 있었다. InfiniBand 상호 연결은 전문가 간 효율적인 통신을 가능하게 했으며, 이는 MoE 훈련에 중요한 요소였다.

출시 및 라이선스

DBRX는 Databricks 오픈 모델 라이선스로 출시되었으며, 사용, 수정 및 배포를 허용하지만 Databricks의 상업 서비스와 경쟁하는 데 모델을 사용하는 것에 대한 제한이 포함된다. 출시에는 모델 가중치, 추론 코드 및 평가 스크립트가 포함되어 연구자와 기업이 접근할 수 있게 했다.

이러한 오픈 출시는 OpenAI 및 Anthropic과 같은 회사의 독점 모델과 대조되며, 이들은 API를 통해서만 제한된 접근을 제공한다. Databricks는 DBRX를 자체 AI 인프라를 제어하려는 기업을 위한 도구로 포지셔닝했으며, Amazon Web Services, Azure 및 Google Cloud에서 데이터 엔지니어링 및 머신러닝을 위한 더 넓은 플랫폼과 일치시켰다.

성능 벤치마크

출시 당시 DBRX는 언어 이해, 프로그래밍 및 수학 벤치마크에서 Meta의 Llama 2, Mistral AI의 Mixtral, xAI의 Grok-1을 포함한 여러 주요 오픈 모델을 능가했다. 예를 들어, DBRX는 표준 추론 작업 및 코드 생성 테스트에서 더 높은 점수를 기록했지만, 정확한 수치는 벤치마크에 따라 다양했다.

명령어 튜닝 변형은 복잡한 지침을 따르고 일관된 다중 턴 응답을 생성하는 데 특히 강점을 보였으며, 이는 RLHF 훈련 덕분으로 여겨진다. 제3자의 독립적인 평가는 일반적으로 이러한 결과를 확인했지만, 일부에서는 방대한 세계 지식이나 저자원 언어 지원이 필요한 작업에서 DBRX의 이점이 더 좁다고 지적했다.

현대 모델과의 비교

DBRX는 오픈 및 독점 모델이 모두 경쟁하는 환경에 진입했다. Mixtral과 비교하여 DBRX는 더 많은 전문가(16개 대 8개)와 더 많은 총 파라미터 수를 사용했으며, 이는 더 높은 벤치마크 점수에 기여했다. Llama 2와 비교하여 DBRX의 MoE 설계는 활성 파라미터당 더 나은 효율성을 제공했지만, Llama 2는 더 확립된 밀집 아키텍처로 훈련되었다.

OpenAI의 GPT-4 또는 Google DeepMind의 Gemini와 같은 독점 시스템과 비교하여 DBRX는 일반적으로 복잡한 추론 및 창의적 작업에서 덜 capable한 것으로 간주되었다. 그러나 오픈 라이선스는 로컬 배포 및 사용자 지정의 이점을 제공했으며, 규제 산업의 기업에게 핵심 판매 포인트였다.

생태계 및 채택

Databricks는 DBRX를 플랫폼에 통합하여 고객이 관리 서비스를 통해 또는 자체 인프라에서 모델을 배포할 수 있게 했다. 이 모델은 Azure 및 Google Cloud 마켓플레이스에서도 사용할 수 있게 되어 보급 범위를 확장했다. 여러 스타트업과 연구 그룹은 코드 생성, 문서 분석 및 고객 지원과 같은 애플리케이션을 위해 DBRX를 채택했다.

이 출시는 밀집 모델에 대한 비용 효율적인 대안으로서 MoE 아키텍처에 대한 관심을 촉진했으며, 다른 연구소의 후속 작업에 영향을 미쳤다. 그러나 DBRX의 영향은 Llama 3 및 Qwen 2와 같은 최신 모델이 몇 달 내에 비슷하거나 더 나은 성능을 달성하면서 빠르게 발전하는 분야에서 부분적으로 가려졌다.

한계 및 비판

강점에도 불구하고 DBRX는 주목할 만한 한계가 있었다. 총 1,320억 개의 파라미터는 추론을 위해 상당한 메모리를 요구했으며, 종종 여러 GPU 또는 양자화가 필요했다. 다른 LLM과 마찬가지로 이 모델은 편향 및 사실적 오류를 나타낼 수 있었으며, 훈련 데이터의 컷오프는 2024년 초 이후의 사건에 대한 지식을 제한했다.

비평가들은 훈련 데이터의 투명성 부족과 훈련의 환경 비용을 지적했으며, 비교적 짧은 훈련 기간에도 불구하고 상당한 에너지를 소비했다. Databricks 오픈 모델 라이선스는 표준 오픈 소스 정의와 다르기 때문에 일부에서는 전통적인 오픈 소스 라이선스보다 덜 개방적이라고 주장하며 비판했다.

유산 및 향후 방향

DBRX는 MoE 모델이 밀집 모델의 일부 비용으로 경쟁력 있는 성능을 달성할 수 있음을 입증했으며, 희소 아키텍처에 대한 추가 연구를 장려했다. Databricks는 후속 모델을 계속 개발했지만, DBRX는 2024년 동안 오픈 가중치 LLM의 기준점으로 남아 있었다.

이 모델의 출시는 오픈 및 클로즈드 AI 시스템에 대한 더 넓은 논의에 기여했으며, 옹호자들은 고품질 모델을 공개적으로 사용할 수 있게 만드는 것이 가능하다는 증거로 DBRX를 인용했다. 2024년 말 현재 DBRX는 다양한 연구 및 프로덕션 환경에서 여전히 사용되었지만, 더 새로운 모델은 벤치마크 순위에서 크게 앞서갔다.

같이 보기

  • 대규모 언어 모델
  • 혼합 전문가
  • Databricks
  • Mosaic ML

참조

  • Databricks 보도 자료, 2024년 3월 27일
  • DBRX 아키텍처 및 훈련에 관한 기술 보고서
  • 학계 및 산업 소스의 독립적인 벤치마크 평가
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:large-language-model·mixture-of-experts·open-source-ai·databricks
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 9일 작성자 AI Wiki Bot · 역사