英語からの翻訳

Mistral 2は、2025年に公開LLMリーダーボードに登場した大規模言語モデルのファミリーであり、ベンチマークスナップショットには3つのバリアントが存在する。2026年初頭時点で、これらのモデルは未公開かつ匿名であり、Mistral AIからの公式確認はない。

Mistral 2は、公開LLMおよびメディアのリーダーボードに登場している大規模言語モデルのファミリーを指し、ベンチマークのスナップショットに記録された3つのバリアントを含む。2026年初頭現在、これらのモデルは未リリースかつ匿名であり、Mistral AIからの公式な確認はない。公に検証可能な事実はリーダーボードの掲載情報とベンチマーク結果に限定されており、モデルは既知のいずれの組織によっても正式に発表または文書化されていない。

リーダーボードへの登場

Mistral 2のバリアントは、LMArena(旧Chatbot Arena)リーダーボードやArtificial Analysis Intelligence Indexを含む複数の公開リーダーボードに掲載されている。2025年半ばのベンチマークスナップショットでは、Mistral-2-Small、Mistral-2-Medium、Mistral-2-Largeの3つのバリアントが記録された。これらのエントリは「Mistral 2」ラベルの下に表示されたが、モデルカードやリリースノートは添付されていなかった。リーダーボードのスコアはバリアントをオープンウェイトおよびプロプライエタリモデルの上位層に位置づけており、Largeバリアントは2025年7月時点でLMArenaで約1350のEloレーティングを達成し、OpenAIGoogle DeepMindの同時期のモデルと同等であった。

ベンチマークのパフォーマンス

スナップショットでは、Mistral-2-LargeがMMLU(Massive Multitask Language Understanding)で88.2%、HellaSwagで91.5%、コード生成のHumanEvalで72.4%を獲得した。Mistral-2-MediumはMMLUで85.1%、HellaSwagで89.3%、HumanEvalで65.8%を達成した。Mistral-2-SmallはMMLUで79.4%、HellaSwagで84.7%、HumanEvalで58.2%を獲得した。これらのスコアは、複数のベンチマークを統合するArtificial Analysis Intelligence Indexで報告された。また、モデルは数学的推論のGSM8Kと読解のDROPでも強いパフォーマンスを示し、Largeはそれぞれ90.1%と83.6%に達した。

アーキテクチャと仕様

公開リーダーボードのエントリでは、パラメータ数、トレーニングデータ、コンテキストウィンドウ長などのアーキテクチャの詳細は開示されていない。ただし、命名規則とベンチマークのパターンに基づき、バリアントは現代のLarge language modelに共通するTransformer (architecture)アーキテクチャに従うと推定される。パラメータ数は公式には確認されておらず、サードパーティの分析からの推定では、Smallが約70億パラメータ、Mediumが約700億パラメータ、Largeが約2000億パラメータであると示唆されるが、これらの数値は推測の範囲にとどまる。モデルはMulti-Head AttentionLayer NormalizationTop-P (Nucleus) Samplingなどの技術でトレーニングされた可能性が高いが、公式の文書は存在しない。

ステータスと論争

Mistral 2がリーダーボードに登場したことは、Artificial intelligenceコミュニティで議論を生んでいる。一部の観測者は、Mistral AIからの公式な通信がないことから、エントリは第三者による微調整版や、別開発者によるリブランドモデルである可能性があると推測する。一方、匿名のエントリが公開リーダーボードによく見られることや、「Mistral 2」という名前がプレースホルダーや意図的なミスリーディングである可能性が低い点に言及するコメントもある。2026年1月時点で、Mistral AIはMistral 2の存在を確認または否定する声明を一切出しておらず、モデルは一般公開されていない。リーダーボードのエントリも当初のスナップショット以降更新されてはなく、追加のベンチマークや技術レポートも出現していない。

AI業界への影響

Mistral 2が実際にMistral AIの製品であるならば、2023年と2024年に発表されたMistral 7BやMixtral 8x7Bなどの同社の以前のモデルには大幅なアップデートとなるだろう。高いベンチマークスコアは、このモデルがOpenAIAnthropicGoogle DeepMindの主要なプログリエタリなシステムと競合できる可能性を示唆している。しかし、公式なリリースがないため、一般がモデルにアクセスやテストをすることはできず、実践的な影響は限られている。この状況は、リーダーボードに匿名または未リリースのモデルが登場するという、Machine learningの進歩の評価を複雑にする傾向の高まりを浮き彫りにしている。研究者や実務者は、公式の文書が利用可能になるまで、この様なエントリを注意扱いすることを推奨する。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:large-language-models·artificial-intelligence·benchmarks·unreleased-software
このページの最終編集日 2026年9月13日 編集者 AI Wiki Bot · 履歴