Mixtral 8x7B는 2023년 12월 Mistral AI가 공개한 희소 혼합 전문가(MoE) 대규모 언어 모델이다. 디코더 전용 트랜스포머 아키텍처를 채택하며 총 467억 개의 매개변수를 보유하지만, 각 레이어의 8개 피드포워드 모듈 중 2개 전문가를 선택하는 라우팅 메커니즘을 통해 입력 토큰당 129억 개의 매개변수만 활성화한다. 이 설계는 추론 비용을 낮추면서도 훨씬 더 큰 밀집 모델과 견줄 만하거나 이를 능가하는 성능을 달성하게 한다. 공개는 기본 모델과 지시어 따르기용 미세 조정 변형인 Mixtral 8x7B Instruct를 포함했으며, 가중치는 Apache 2.0 라이선스로 공개되었다.
이 모델은 2023년 12월 11일 블로그 게시물과 토렌트 링크를 통해 발표되었으며, 이는 오픈 가중치 생성형 AI 환경에서 중요한 이정표가 되었다. 이는 2023년 OpenAI와 Google DeepMind 출신 연구자들이 설립한 파리 기반 스타트업인 Mistral AI가 개발했다. 이번 출시는 Mixtral 8x7B를 OpenAI의 GPT-3.5 및 Anthropic의 Claude 2와 같은 독점 모델의 직접적인 경쟁자로 자리매김했으며, Meta 및 다른 연구소의 오픈 모델의 지배력에도 도전장을 내밀었다. 혼합 전문가 아키텍처는 노키아 벨 연구소와 Google DeepMind의 조건부 계산에 대한 초기 연구를 바탕으로 했지만, 오픈소스 릴리스에서 이전에는 볼 수 없었던 규모로 적용되었다.
아키텍처 및 설계
Mixtral 8x7B는 트랜스포머의 각 표준 피드포워드 네트워크를 대체하는 희소 MoE 레이어를 사용한다. 각 레이어에는 8개의 전문가 네트워크가 있으며, 게이팅 네트워크(종종 학습된 로짓에 대한 소프트맥스)가 각 토큰을 상위 2개 전문가로 라우팅한다. 이러한 희소 활성화는 토큰당 계산 비용을 약 129억 매개변수 밀집 모델 수준으로 줄이는 동시에 총 467억 개의 매개변수로 큰 지식 용량을 가능하게 한다. 이 모델은 32,768토큰의 컨텍스트 창을 사용하며 영어, 프랑스어, 독일어, 스페인어, 이탈리아어를 포함한 여러 언어를 지원한다.
라우팅 메커니즘은 보조 부하 분산 손실 없이 종단 간 학습되며, 자연스러운 미분을 통해 토큰을 전문가 간에 분배한다. 이는 명시적 균형 제약이 필요했던 초기 MoE 시스템과 대조적이다. 이 모델은 또한 추론 중 키-값 캐시 메모리 사용량을 줄이는 그룹 쿼리 어텐션이 포함된 다중 헤드 어텐션을 통합한다. 아키텍처는 2017년에 도입된 트랜스포머 프레임워크를 기반으로 하며, 희소 계산과 효율적인 확장을 위한 수정이 가해졌다.
훈련 및 데이터
훈련 세부 사항은 릴리스 발표에서 일부 공개되었다. Mixtral 8x7B는 공개 웹 코퍼스에서 수집한 데이터로 사전 훈련되었으며, 공식적으로 발표된 특정 규모나 구성 수치는 없다. 훈련에는 코사인 학습률 스케줄을 사용한 Adam 최적화 변형이 사용되었고, 안정성을 위해 그래디언트 클리핑과 레이어 정규화가 적용되었다. 지시어 튜닝 변형은 데모 데이터에 대한 지도 미세 조정과 AI 피드백 기반 강화 학습을 사용해 추가로 정제되었으며, 이는 RLHF와 유사하지만 AI 생성 선호 레이블을 사용하는 기법이다.
기본 모델은 일련의 다음 토큰을 예측하도록 표준 교차 엔트로피 손실 함수를 사용해 학습되었다. 지시 모델은 사용자 프롬프트를 따르고 유용한 응답을 생성하도록 최적화되었다. Mistral AI는 정확한 학습 토큰 수를 공개하지 않았지만, 벤치마크 성능과 유사한 규모의 모델과의 비교를 바탕으로 독립 분석에서는 모델이 1조 토큰 이상의 대규모 말뭉치에서 학습되었을 것으로 추정했다.
성능 및 벤치마크
Mixtral 8x7B는 다양한 표준 벤치마크에서 강력한 성능을 보여주었다. MMLU(대규모 다중 작업 언어 이해)에서 약 70.6%를 기록해 GPT-3.5와 Llama 2 70B를 능가했으며, HellaSwag 상식 추론 테스트에서 약 86.7%, WinoGrande 핵심 참조 해결 작업에서 약 81.2%를 달성했다. 모델은 수학 및 코드 생성에서도 뛰어난 성과를 보였으며, 기본 모델의 GSM-8K(수학적 추론) 점수는 약 74.5%, HumanEval(코드 완성)은 약 40.2%였고, Instruct 변형은 42.2%로 개선되었다.
직접 비교에서 Mixtral 8x7B는 대부분의 작업에서 Llama 2 70B의 성능과 일치하거나 이를 능가했으며, 추론 중 활성 매개변수는 약 6분의 1에 불과했다. 또한 MMLU 및 HellaSwag를 포함한 여러 벤치마크에서 더 큰 GPT-3.5를 능가했다. 모델의 효율성은 엣지 장치 및 비용에 민감한 환경에서의 배포를 매력적으로 만들었지만, FP16에서 약 90GB의 총 메모리 사용량은 여전히 상당한 하드웨어를 요구했다. 릴리스에는 24GB VRAM의 소비자 GPU에서 실행할 수 있는 4비트 양자화 버전도 포함되었다.
영향 및 수용
Mixtral 8x7B의 출시는 인공지능 커뮤니티와 주류 언론에서 널리 다루어졌다. 이는 API 비용 없이 고성능 언어 모델에 대한 접근성을 민주화한 것으로 평가받았으며, 연구자와 개발자가 모델을 미세 조정하고 로컬에서 배포할 수 있게 했다. 이 모델은 또한 희소 MoE 아키텍처에 대한 관심을 다시 불러일으켰으며, 이후 Alibaba의 Qwen-MoE 및 AI21 Labs의 Jamba와 같은 다른 연구소의 유사한 릴리스에 영향을 주었다. 독립 평가에서는 Mixtral 8x7B가 강력한 다국어 능력과 우수한 성능을 보여주었지만, 다른 오픈 모델과 유사한 편향 및 안전 제한 가능성도 지적되었다.
이 모델은 이후 Mixtral 8x7B의 명성을 더욱 공고히 했으며, 2024년 4월에 동일한 아키텍처를 더 큰 규모로 확장한 Mixtral 8x22B가 출시되었다. 성공적인 출시는 Mistral AI에 대한 투자자의 신뢰를 강화했으며, 회사는 2024년 6월 6억 4천만 달러의 자금 조달 라운드를 발표하여 기업 가치를 크게 높였다. Mixtral 8x7B는 또한 희소 전문가 모델과 오픈 가중치 릴리스의 발전에 기여한 공로로 인정받았다.
기술적 세부 사항
Mixtral 8x7B는 상업적 사용과 수정을 허용하는 Apache 2.0 라이선스로 출시되었다. 기본 모델과 Instruct 변형은 FP16 및 BF16 형식으로 제공되었으며, 커뮤니티 제작 양자화 버전도 사용 가능했다. 이 모델은 vLLM, TensorRT-LLM, Groq의 LPU 기반 시스템을 포함한 주요 추론 프레임워크에 통합되었으며, 후자는 모델의 희소 활성화로 인해 특히 낮은 지연 시간을 달성했다. 이 모델은 32,768토큰의 컨텍스트 길이를 지원하여 긴 문서 처리에 적합했다. Mixtral 8x7B의 오픈 가중치 특성과 Apache 2.0 라이선스는 실험과 상업적 배포를 장려했으며, Mistral AI의 후속 모델과 독립 연구자들의 여러 파생 프로젝트의 기반이 되었다.
기술 세부 사항 및 가용성
Mixtral 8x7B는 Apache 2.0 라이선스로 출시되어 상업적 사용과 수정이 허용되었다. 모델 가중치는 비트토렌트 링크와 Hugging Face를 통해 공개되었으며, 기본 모델과 Instruct 변형은 FP16 및 BF16 형식으로 제공되었다. 이 모델은 vLLM, TensorRT-LLM 및 Groq의 LPU 기반 하드웨어를 포함한 주요 추론 스택에 통합되었으며, 특히 낮은 지연 시간을 달성했다. 개발자에게는 32,768토큰의 컨텍스트 창, FP16에서 약 90GB 또는 4비트 양자화로 약 30GB의 메모리 요구 사항이 문서화되었으며, Mistral AI는 모델 카드, 예제 코드 및 중간 규모 추론 서버 배포 가이드를 제공했다.
Mixtral 8x7B는 2024년 4월에 같은 아키텍처를 1,410억 매개변수로 확장한 Mistral AI의 대형 모델 Mixtral 8x22B로 이어졌다. 이 모델의 성공은 Mistral AI의 기업 가치 상승에 기여했으며, 2024년 6월 발표된 자금 조달 라운드에서 64억 달러의 가치를 인정받았다. 또한 희소 구조는 효율성 기술 연구의 자연스러운 테스트베드 역할을 하며 모델 가지치기 및 지식 증류 연구에 기여했다.
기술적 세부 사항 및 배포
Mixtral 8x7B는 상업적 사용과 수정을 허용하는 Apache 2.0 라이선스로 출시되었다. 가중치는 Hugging Face 및 BitTorrent를 통해 배포되었다. 기본 모델과 Instruct 변형은 FP16 및 BF16 형식으로 제공되었으며, 저정밀 추론을 위한 양자화 버전도 커뮤니티에서 제공되었다. vLLM, TensorRT-LLM, Groq의 LPU 기반 하드웨어를 포함한 주요 추론 프레임워크가 이 모델에 대한 지원을 추가했으며, 희소 활성화 덕분에 특히 낮은 지연 시간을 달성했다.
기술 세부 사항 및 배포
Mixtral 8x7B는 Apache 2.0 라이선스로 배포되어 상업적 사용과 수정이 허용된다. 모델은 Hugging Face와 BitTorrent를 통해 제공되었으며, FP16 및 BF16 형식으로 제공되었다. 기본 모델과 Instruct 변형 모두 32,768 토큰의 컨텍스트 길이를 지원하므로 긴 문서 처리에 적합하다. 지시 모델은 채팅 템플릿을 사용하며, 다양한 모델 실행기 및 플랫폼과의 호환성이 보장되었다. 로컬 배포를 위해 모델은 약 90GB의 GPU 메모리(FP16) 또는 약 24GB(4비트 양자화)를 필요로 하며, 이는 단일 고급 GPU 또는 소비자급 하드웨어에서 실행 가능하다. 추론 서빙은 vLLM, TensorRT-LLM, Groq의 LPU 기반 하드웨어와 같은 인기 있는 도구에 통합되었으며, 희소 활성화 패턴으로 인해 특히 빠른 처리 속도를 보여준다.
같이 보기
- Mixtral 8x22B
- mixture of experts
- 오픈소스 AI 모델
- 트랜스포머
- 파라미터 효율적 미세 조정