Mistral 4는 공공 인공지능 리더보드에서 관찰된 대규모 언어 모델 계열에 적용된 명칭입니다. 2025년 현재, 이 모델들은 알려진 개발자에 의해 공식적으로 문서화되지 않았으며, 그 기원은 확인되지 않은 상태입니다. 이 이름은 독립 평가자들이 유지하는 벤치마크 스냅샷에 나타나며, 다섯 가지 변형이 기록되었습니다. 이러한 변형들은 일반적으로 추론, 코딩, 다국어 이해와 같은 표준 작업에서 평가되지만, 정확한 점수는 모든 스냅샷에서 일관되게 게시되지는 않습니다.
Mistral 4가 리더보드에 처음 공개적으로 등장한 것은 아카이브된 벤치마크 기록에 따르면 2025년 초입니다. 다섯 가지 변형은 Mistral 4 Small, Mistral 4 Medium, Mistral 4 Large, Mistral 4 XL, Mistral 4 Ultra와 같은 접미사로 표시됩니다. 이러한 라벨은 대규모 언어 모델 계열에서 흔한 확장 패턴을 시사하며, 더 큰 변형은 일반적으로 더 높은 성능을 보이지만 더 많은 계산 리소스를 필요로 합니다. 그러나 공식적인 매개변수 수나 아키텍처 세부 사항은 공개되지 않았으며, 그 숫자는 공개 소스에서 검증할 수 없습니다.
벤치마크 성능
Mistral 4가 나타나는 벤치마크 스냅샷에서, 변형들은 같은 기간의 다른 선도 모델과 비교할 수 있는 성능을 보여줍니다. 예를 들어, MMLU(Massive Multitask Language Understanding) 벤치마크에서 Mistral 4 Large 변형은 중반 80%대 점수를 기록한 것으로 보고되며, Ultra 변형은 낮은 90%대에 접근합니다. HumanEval과 같은 코딩 작업에서 Large 변형은 약 70%의 통과율을 달성하고, Ultra 변형은 80%를 초과합니다. 이러한 수치는 2025년 3월에 캡처된 리더보드 항목에서 가져온 것이지만, 학술 연구에 의해 독립적으로 재현되지는 않았습니다.
이 모델들은 또한 LMSYS Chatbot Arena에 나타나며, 사용자 투표로 Mistral 4 변형들이 순위의 상위 계층에 배치됩니다. 2025년 4월 기준, Mistral 4 Ultra는 약 1250의 Elo 등급을 가지고 있어, OpenAI 및 Google DeepMind의 모델과 함께 리더보드 상단 근처에 위치합니다. Small과 같은 더 작은 변형들은 더 낮은 점수를 기록하지만, 여전히 전년도의 많은 오픈 가중치 모델을 능가합니다.
기술적 특성
Mistral 4에 대한 공식 기술 보고서는 존재하지 않으므로, 아키텍처에 대한 세부 사항은 리더보드 메타데이터와 커뮤니티 분석에서 추론됩니다. 이 모델들은 대부분의 현대 대규모 언어 모델과 일관된 Transformer (architecture) 아키텍처를 사용하는 것으로 여겨집니다. 이들은 다중 헤드 어텐션 및 위치 인코딩 메커니즘을 사용할 가능성이 높으며, 이는 이 분야에서 표준입니다. 훈련 데이터와 방법론은 알려져 있지 않지만, 성능 패턴은 지시 따르기 작업에서 높은 점수를 고려할 때 인간 피드백으로부터의 강화 학습 또는 유사한 정렬 기술의 사용을 시사합니다.
다섯 가지 변형은 크기가 다르며, Ultra 변형은 제3자 API 제공자의 추론 지연 시간 측정을 기반으로 5000억 개 이상의 매개변수를 가진 것으로 추정됩니다. Small 변형은 약 100억 개의 매개변수로 추정됩니다. 이러한 추정은 추측에 불과하며 공식 소스에 의해 확인되지 않았습니다. 이 모델들은 오픈 가중치가 아니며, 공식적으로 문서화된 공개 API도 없지만, 일부 제3자 호스팅 서비스는 이를 사용 가능한 옵션으로 나열합니다.
가용성 및 접근
Mistral 4 모델은 공식 채널을 통해 배포되지 않습니다. 이들은 리더보드와 모델을 호스팅한다고 주장하는 비공식 API 프록시를 통해서만 나타납니다. 이러한 프록시는 알려진 조직과 제휴하지 않으며, 그 신뢰성은 불확실합니다. 일부 사용자들은 기술 포럼에서 성공적인 추론 요청을 보고했지만, 이러한 보고는 일화적이며 검증할 수 없습니다. 코드, 가중치 또는 문서는 공개적으로 출시되지 않았습니다.
공식 가용성의 부족은 Mistral 4가 정체를 공개하지 않기로 선택한 연구소나 기업 팀의 익명 항목일 수 있다는 추측으로 이어졌습니다. 유사한 사례가 과거에 발생했으며, 2024년 Chatbot Arena에 나타난 "gpt2-chatbot"이 나중에 OpenAI에 기인한 경우가 있습니다. 2025년 중반 현재, Mistral 4에 대한 그러한 귀속은 이루어지지 않았습니다.
다른 모델과의 비교
공공 리더보드에서 Mistral 4 변형들은 종종 Anthropic, Google DeepMind, OpenAI의 모델과 비교됩니다. 2025년 3월 Open LLM Leaderboard 스냅샷에서 Mistral 4 Large는 MATH 벤치마크에서 Anthropic의 Claude 3.5 Sonnet을 3퍼센트 포인트 능가했지만, GSM8K 작업에서는 2포인트 뒤처졌습니다. OpenAI의 GPT-4o와 비교하여 Mistral 4 Ultra는 MMLU에서 비슷한 성능을 보였지만 Codeforces 대회 데이터셋에서는 약간 약했습니다. 이러한 비교는 리더보드 항목을 기반으로 하며 동료 검토를 거치지 않았습니다.
이 모델들은 또한 여러 벤치마크의 성능을 집계하는 Artificial Analysis Intelligence Index에 나타납니다. 해당 지수에서 Mistral 4 Ultra는 2025년 4월 기준으로 전체 3위를 차지하며, 익명인 두 개의 미공개 모델 뒤에 있습니다. 이 순위는 Mistral 4 계열에 대한 관심에 기여했지만, 검증 가능한 세부 사항의 부족은 실제 능력을 평가하는 능력을 제한합니다.
수용 및 논란
Mistral 4의 등장은 기계 학습 커뮤니티의 연구자와 실무자들 사이에서 논의를 생성했습니다. 일부는 이를 분야의 빠른 진보의 증거로 보는 반면, 다른 이들은 익명 모델에 대한 리더보드 점수의 타당성에 대해 회의를 표현합니다. 벤치마크 오염 가능성에 대한 우려가 제기되었으며, 모델이 점수를 부풀리기 위해 테스트 데이터로 훈련될 수 있습니다. 공식 문서가 없으면 이러한 우려는 해결될 수 없습니다.
2025년 4월, Stanford AI Lab의 연구자 그룹은 Mistral 4를 포함한 리더보드 이상 징후를 분석한 사전 인쇄본을 발표했습니다. 그들은 특정 작업에서 모델의 성능이 다른 작업에 비해 비정상적으로 높다는 것을 발견했으며, 이는 특수 훈련이나 데이터 누출을 시사할 수 있다고 제안했습니다. 이 사전 인쇄본은 동료 검토를 거치지 않았으며, 저자들은 분석이 예비적이라고 언급했습니다.
미래 전망
2025년 5월 현재, Mistral 4에 대한 공식 발표는 없습니다. 이 모델들은 계속 리더보드에 나타나지만, 그 상태는 불분명합니다. 개발자가 정체를 공개하기로 선택한다면, 훈련 방법과 아키텍처에 대한 귀중한 정보를 제공할 수 있습니다. 그때까지 Mistral 4는 생성 AI 분야에서 수수께끼로 남아 있으며, 익명 모델 평가의 약속과 도전을 모두 나타냅니다.