Phi 4 は、Microsoft Research によって開発された大規模言語モデルのファミリーである。このシリーズは、最先端システムと比較して比較的コンパクトなモデルサイズを特徴としつつ、推論、数学、コーディングタスクにおいて競争力のある性能を目指している。Phi 4 の複数のバリアントが公開 LLM およびメディアのリーダーボードに登場しており、ベンチマークスナップショットには少なくとも4つの異なる構成が記録されている。
最初に公に文書化された Phi 4 モデルは2024年後半にリリースされ、それ以前の Phi-3 シリーズを基盤としていた。Microsoft は Phi 4 を、単なる規模ではなく、データ品質と合成データ生成を重視した研究指向のモデルとして位置づけた。主力バリアントである Phi-4 (14B) は、MATH や GSM8K などの標準的な推論ベンチマークで強力な結果を示し、他組織のより大規模なモデルをしばしば上回った。
モデルバリアントとベンチマーク
AI 評価プラットフォームが主催するものを含む公開リーダーボードには、少なくとも4つの Phi 4 バリアントがリストされている。これには、ベースの14Bモデル、14B命令チューニング版、および精度の一部を低い計算要件と引き換えにする小型構成(例:7Bおよび3.8B)が含まれる。ベンチマークスナップショットでは、14B命令チューニングモデルは一貫してコンパクトモデルの中でトップクラスにランクされ、コード生成(HumanEval)や論理的推論(ARC)などのタスクにおいて、70B以上のパラメータを持つモデルに匹敵するスコアを達成している。
モデルは、Transformer アーキテクチャをマルチヘッドアテンションと位置エンコーディングとともに使用してトレーニングされている。トレーニングでは、厳選されたウェブデータ、フィルタリングされたコードリポジトリ、およびより大規模な教師モデルによって生成された合成データセットの混合が採用された。Microsoft は完全なトレーニング詳細を開示していないが、そのアプローチはカリキュラム学習の原則に沿っており、タスクの複雑さを徐々に増加させている。
技術仕様
Phi 4 モデルは、標準的なハードウェアへのデプロイを簡素化する、高密度で非MoE(混合専門家)の設計を使用している。14Bバリアントは140億のパラメータ、8,192トークンのコンテキストウィンドウを持ち、生成にはtop-kおよびtop-pサンプリングをサポートしている。モデルは寛容なライセンス(研究および商用利用向けのMIT、14Bバージョンにはいくつかの制限あり)の下でリリースされている。
推論はAzureクラウドとローカルデプロイの両方に最適化されている。モデルは、Hugging Face Transformers や vLLM などの一般的なフレームワークと互換性がある。Microsoft は、改善されたカーネル融合により、Phi 4 がAWS Trainiumインスタンス上で Phi-3 と比較して2倍の高速化を達成したと報告している。
性能と限界
公開リーダーボードでは、Phi 4 バリアントは数学と論理において強い性能を示すが、OpenAI や Google DeepMind の最先端モデルには、オープンエンドの創造的執筆や微妙な指示追従において遅れを取っている。モデルは、事実に関するクエリに対して時折幻覚を示すが、これはこの分野全体に共通する問題である。Microsoft は、アライメントを改善するためにRLHF(人間のフィードバックからの強化学習)データを公開しているが、モデルはニッチなトピックについてもっともらしいが不正確な回答を生成する傾向が残っている。
3.8Bバリアントは、スマートフォンや組み込みシステムを含むエッジデバイスで動作することで注目されているが、メモリ制約に収まるように量子化が必要である。これにより、Phi 4 はAppleやSamsung Electronicsの取り組みと同様に、オンデバイス生成AIアプリケーションの候補となっている。
エコシステムと採用
Phi 4 はMicrosoftのAzure AI Foundryに統合され、API経由で利用可能である。GroqやSambaNovaなどのサードパーティプラットフォームは、14Bモデル向けの高速推論を提供している。オープンウェイトは、医療や法律の推論などの専門分野向けのコミュニティによるファインチューニングを促進したが、これらは公式に承認されていない。
Stanford AI LabやBerkeley AI Researchの研究者は、データ効率に関する研究で Phi 4 を引用しており、その性能は、生のパラメータ数よりもトレーニングデータのキュレーションの重要性を示唆していると指摘している。このモデルはモデルプルーニング実験にも使用されており、最大30%の重みを最小限の精度低下で削除できることが示されている。
今後の方向性
Microsoft は Phi 5 を発表していないが、同社は将来のイテレーションに情報を提供する可能性のある合成データ生成と損失関数に関する研究を引き続き公開している。2025年初頭の時点で、Phi 4 はコンパクトで高性能なモデルの参照点であり続けており、そのバリアントは効率的な深層学習に関する学術論文でベースラインとして頻繁に使用されている。
このモデルファミリーは、コンシューマーハードウェアで実行できる、より小型で専門化されたモデルへの広範なトレンドの一部であり、スケールだけが能力への唯一の道であるという前提に挑戦している。このアプローチがさらにスケールするかどうかは未解決の疑問であるが、Phi 4 は、慎重にキュレーションされたデータが少ないパラメータを部分的に補償できることを実証した。