MiniMax M2.5는 중국 인공지능 기업인 MiniMax가 개발한 대규모 언어 모델 제품군이다. 2025년 기준으로 이 모델은 공개 벤치마크 리더보드에서 관찰되었지만, 회사는 완전한 기술 문서나 가중치를 공개하지 않았다. 이 제품군에는 벤치마크 스냅샷에서 MiniMax M2.5 A, B, C로 언급되는 세 가지 알려진 변형이 포함되지만, 공식 명명 규칙은 확인되지 않았다. 모델이 미공개 상태이거나 익명 아레나 항목이므로, 공개적으로 검증 가능한 사실은 리더보드 등장과 일반적인 성능 주장으로 제한된다.
리더보드 등장
MiniMax M2.5 변형들은 LMArena(이전 Chatbot Arena) 리더보드와 Open LLM 리더보드를 포함한 여러 공개 머신러닝 리더보드에 등장했다. 2025년 중반 스냅샷 데이터는 M2.5 제품군이 특정 작업, 특히 추론 및 코딩 벤치마크에서 상위 20위 안에 드는 것을 보여주었다. 예를 들어, 2025년 6월 스냅샷에서 MiniMax M2.5 B는 HumanEval 벤치마크에서 72.3점을, M2.5 C는 70.8점을 기록했다. 이 점수들은 모델을 오픈 가중치 모델의 평균 이상으로, 그러나 OpenAI의 GPT-4.1 및 Anthropic의 Claude 3.7과 같은 선도적 독점 모델 아래에 위치시킨다.
이 모델은 또한 MMLU 벤치마크에 등장했으며, 2025년 7월 스냅샷에서 M2.5 A는 85.4, M2.5 B는 86.1, M2.5 C는 85.9를 기록했다. 이 수치는 많은 최첨단 모델과 경쟁력이 있지만, 정확한 방법론과 테스트 조건은 독립적으로 검증되지 않았다.
기술적 특성
벤치마크 메타데이터에 기반하여, MiniMax M2.5 변형들은 딥러닝에서 지배적인 아키텍처와 일치하는 트랜스포머 기반 모델일 가능성이 높다. 파라미터 수는 공개되지 않았지만, 일부 리더보드 항목은 모델 크기를 1000억에서 2000억 파라미터 범위로 나열하며, 이는 추정치일 수 있다. 이 모델은 일부 아레나 항목에서 표시된 대로 최대 128,000 토큰의 컨텍스트 창을 지원하는 것으로 보이며, 이는 확장된 컨텍스트 기능을 가진 대규모 언어 모델 범주에 위치시킨다.
공식 논문이나 기술 보고서가 발표되지 않았으므로, 신경망 레이어, 멀티 헤드 어텐션 메커니즘, 또는 위치 인코딩 방법에 대한 세부 사항은 알려지지 않았다.
다른 모델과의 비교
공개 리더보드에서 MiniMax M2.5는 Google DeepMind의 모델(예: Gemini 1.5), Anthropic의 Claude 3, 그리고 OpenAI의 GPT-4와 비교되었다. MMLU 및 ARC와 같은 일반 추론 작업에서 M2.5 점수는 최고 독점 모델보다 약간 낮지만, Llama 3.1 405B와 같은 일부 오픈 가중치 모델과는 비슷하다. 코딩 벤치마크에서 M2.5는 강점을 보여주며, 동일한 파라미터 범위의 많은 모델을 능가한다.
M2.5 A에 대한 익명 아레나 항목은 2025년 5월에 기록되었으며, Elo 등급 1120을 달성하여 테스트된 모델 중 95번째 백분위수에 위치했다. 그러나 항목의 익명성 때문에 검증이 어렵다.
현재 상태 및 가용성
2025년 말 기준으로 MiniMax는 M2.5의 공개 출시를 발표하지 않았다. API 액세스나 다운로드 링크는 제공되지 않았으며, 공식 MiniMax 웹사이트는 MiniMax-Text-01과 같은 이전 모델만 나열한다. M2.5 제품군은 내부 또는 실험적 출시로 보이며, 내부 인공지능 연구에 사용될 가능성이 있다. 모델이 미공개 상태이므로 공식 문서, 모델 가지치기 세부 사항, 또는 데이터 증강 사항은 없다.
리더보드 등장은 MiniMax가 모델을 적극적으로 개발 중임을 시사하지만, 회사는 공개 가용성에 대한 일정을 제공하지 않았다. 그때까지 모든 주장은 제3자 벤치마크 관찰에 기반한다.