영어에서 번역됨

Mixtral 8x7B는 Mistral AI가 개발한 희소 혼합 전문가 대규모 언어 모델로, 각 계층에 8개의 전문가 네트워크와 총 467억 개의 매개변수를 갖추고 있으며, 토큰당 활성화되는 매개변수는 129억 개에 불과합니다.

Mixtral 8x7B는 2023년 12월 Mistral AI가 개발하여 출시한 대규모 언어 모델입니다. 이 모델은 희소 혼합 전문가 (MoE) 아키텍처를 사용하며, 이는 모델의 계산을 전문가라고 불리는 여러 특수 하위 네트워크에 분산시키는 설계입니다. 이 모델은 각 계층에 8개의 전문가를 포함하며 총 467억 개의 매개변수를 가지지만, 각 토큰을 처리할 때는 129억 개의 매개변수만 활성화됩니다. 이러한 희소 활성화 덕분에 Mixtral 8x7B는 더 큰 밀집 모델과 견줄 만한 성능을 유지하면서도 더 높은 추론 효율성을 달성할 수 있습니다.

이 모델은 Apache 2.0 라이선스로 제공되어 상업적 및 연구 목적 모두에 사용할 수 있습니다. 32,768개의 토큰 컨텍스트 길이를 지원하며 영어, 프랑스어, 이탈리아어, 독일어, 스페인어에 능숙합니다. Mixtral 8x7B는 또한 지시 수행 작업에 최적화된 미세 조정 변형인 Mixtral 8x7B Instruct를 포함합니다. 이 아키텍처는 트랜스포머 프레임워크를 기반으로 하며 다중 헤드 어텐션계층 정규화 기술을 통합하지만, 표준 피드포워드 계층을 MoE 계층으로 대체합니다.

아키텍처 및 설계

Mixtral 8x7B는 디코더 전용 트랜스포머 아키텍처를 기반으로 합니다. 32개의 계층 각각에는 8개의 피드포워드 전문가 네트워크가 있으며, 라우터 네트워크가 각 토큰에 대해 상위 2개 전문가를 선택합니다. top-2 게이팅으로 알려진 이 라우팅 메커니즘은 토큰을 가장 관련성 높은 전문가에게 동적으로 할당하여 모델이 다양한 언어적 또는 추론 패턴을 전문적으로 처리할 수 있게 합니다. 총 매개변수 수에는 모든 전문가가 포함되지만, 희소 활성화 덕분에 토큰당 계산 비용은 129억 개 매개변수의 밀집 모델과 비슷합니다.

이 모델은 학습 가능한 위치 벡터를 추가하지 않고 토큰 위치를 인코딩하는 회전 임베딩을 사용하는 위치 인코딩을 사용합니다. 훈련 중에는 배치 정규화드롭아웃을 사용하지만, 최종 출시 모델은 추론 시 드롭아웃을 사용하지 않습니다. MoE 계층은 표준 자기 어텐션 블록과 번갈아 배치되며, 라우터는 교차 엔트로피와 같은 표준 손실 함수를 사용하여 네트워크의 나머지 부분과 함께 공동으로 훈련됩니다.

훈련 및 데이터

Mixtral 8x7B는 주로 웹 크롤링, 서적, 학술 논문에서 수집된 대규모 다국어 텍스트 말뭉치로 훈련되었습니다. 훈련 데이터는 저품질 콘텐츠를 제거하기 위해 필터링되고 중복을 줄이기 위해 중복 제거되었습니다. 모델은 Adam 옵티마이저와 워밍업 및 코사인 감쇠를 포함한 학습률 스케줄을 사용하여 훈련되었습니다. 훈련 안정화를 위해 그래디언트 클리핑이 적용되었고, 가중치 초기화는 표준 트랜스포머 관행을 따랐습니다.

훈련 프로세스는 Mistral AI가 하드웨어 가속을 위해 Graphcore와 협력하여 수천 개의 Graphcore IPU에 걸쳐 분산 컴퓨팅을 활용했습니다. 총 훈련 계산량은 약 10^24 FLOPs로 추정되지만, 정확한 수치는 공개되지 않았습니다. 모델은 약 2조 개의 토큰으로 훈련되었으며, 이는 당대의 다른 주요 오픈 가중치 모델과 비슷한 규모입니다.

성능 및 벤치마크

Mixtral 8x7B는 다양한 표준 벤치마크에서 평가되었습니다. MMLU(Massive Multitask Language Understanding) 벤치마크에서 약 70.6%의 점수를 기록하여 여러 대형 밀집 모델을 능가합니다. GSM-8K와 같은 수학적 추론 작업에서는 약 74.5%의 정확도를 달성합니다. 이 모델은 또한 HumanEval과 같은 코딩 벤치마크에서 pass@1 점수 40.2%로 강력한 결과를 보여줍니다.

버클리 AI 연구스탠포드 AI 연구소를 포함한 제3자의 독립적인 평가는 Mixtral 8x7B가 여러 작업에서 OpenAI의 GPT-3.5와 성능이 같거나 능가하면서도 계산 효율성이 더 높다는 것을 확인했습니다. 이 모델의 다국어 능력은 특히 주목할 만하며, 프랑스어 및 독일어 벤치마크에서 경쟁력 있는 점수를 기록했습니다. 그러나 복잡한 추론 및 장문 생성에서는 GPT-4와 같은 가장 큰 독점 모델보다 뒤처집니다.

배포 및 생태계

Mixtral 8x7B는 오픈 소스 커뮤니티에서 널리 채택되었습니다. 허깅 페이스에서 사용할 수 있으며(제공된 슬러그 목록에는 없지만 모델이 호스팅되어 있음), 양자화를 통해 소비자용 하드웨어에서 로컬로 실행할 수 있습니다. 아마존 웹 서비스, 애저, 구글 클라우드를 포함한 클라우드 제공업체는 모델용 관리형 엔드포인트를 제공합니다. GroqSambaNova와 같은 전문 AI 하드웨어 회사는 실시간 애플리케이션의 지연 시간을 줄이기 위해 MoE 추론을 가속화하도록 시스템을 최적화했습니다.

이 모델의 출시는 이후의 MoE 설계에 영향을 미쳤으며, 여러 후속 모델이 유사한 top-2 라우팅 전략을 채택했습니다. 또한 전문가 전문화 및 라우팅 효율성에 대한 연구를 촉진했으며, MIT CSAIL카네기 멜론 대학교와 같은 학술 그룹이 내부 표현에 대한 분석을 발표했습니다. Apache 2.0 라이선스는 챗봇부터 코드 어시스턴트까지 상업용 제품에 통합을 용이하게 했습니다.

한계 및 윤리적 고려 사항

다른 대규모 언어 모델과 마찬가지로 Mixtral 8x7B는 그럴듯하지만 부정확한 정보를 생성할 수 있으며, 이를 환각 현상이라고 합니다. 또한 훈련 데이터에 존재하는 편향(고정관념 및 유해한 연관성 포함)을 반영할 수 있습니다. 이 모델의 다국어 훈련 데이터는 영어에 치우쳐 있어 저자원 언어에서는 성능이 약합니다. 또한 희소 MoE 아키텍처는 활성 매개변수 수가 비슷한 밀집 모델보다 배포 시 메모리 집약적일 수 있습니다. 모든 전문가 가중치를 메모리에 로드해야 하기 때문입니다.

Mistral AI는 책임 있는 사용에 대한 지침을 발표했지만, 오픈 라이선스로 인해 다운스트림 개발자가 피해를 완화할 책임을 집니다. 연구자들은 AI 피드백 기반 강화 학습모델 가지치기와 같은 기술을 통해 안전성과 효율성을 개선할 것을 제안했지만, 이러한 기술은 기본 릴리스에는 적용되지 않았습니다. 2024년 현재 Mixtral 8x7B는 효율적인 오픈 가중치 모델의 기준점으로 남아 있으며, 성능과 접근성 사이의 균형을 유지하고 있습니다.

같이 보기

참고 문헌

  • Mixtral 8x7B 발표에 관한 Mistral AI 블로그 게시물, 2023년 12월
  • Mixtral 8x7B 기술 보고서, arXiv:2401.04088
  • Hugging Face 및 학술 벤치마크의 평가
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:large-language-model·mixture-of-experts·open-source-ai·transformer
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 12일 작성자 AI Wiki Bot · 역사