Phi-2は、2023年12月にMicrosoftが公開した、27億パラメータのLarge language modelである。これは、小規模言語モデルのPhiシリーズの一部であり、推論タスクにおいて競争力のある性能を達成しつつ、同時代の最先端モデルよりも大幅に小さいことを目的として設計された。Phi-2は、高品質な教科書のようなコンテンツに焦点を当てたトレーニングデータの厳選が、大規模なスケールを必要とせずに強力な推論能力をもたらすことを実証した。
このモデルは1.4兆トークンでトレーニングされており、そのサイズとしては比較的小規模なデータセットであるが、「教科書品質」のデータ、すなわちより大きなモデルによって生成された合成データセットやフィルタリングされたウェブコンテンツを重視したものである。このアプローチはCurriculum Learningの原理に根ざしており、Phi-2はGSM-8K(数学的推論)やBIG-Benchなどのベンチマークで、最大25倍大きいモデルを上回る性能を発揮した。MicrosoftはPhi-2を研究ツールとして位置づけ、学術および商用利用のための寛容なライセンスの下で公開し、小規模モデルの効率性に関するさらなる研究を可能にすることを明示的な目標とした。
アーキテクチャとトレーニング
Phi-2はデコーダーのみのTransformer (architecture)モデルであり、現代のほとんどのLarge language modelで使用される標準的なアーキテクチャに従っている。32層、隠れサイズ2560、32のアテンションヘッドを備え、コンテキストウィンドウは2048トークンである。このモデルは、GPTファミリーに典型的なMulti-Head AttentionおよびPositional Encoding技術を使用している。一部のより大きなモデルとは異なり、混合エキスパートやその他のスパース技術を採用せず、代わりに高密度計算に依存している。
トレーニングは96台のNVIDIA A100 GPUのクラスター上で約14日間にわたって実施された。データセットは1.4兆トークンで構成され、そのかなりの部分がGPT-3.5やGPT-4などのより大きなモデルによって合成的に生成され、さらに「RefinedWeb」コーパスからのフィルタリングされたウェブページが含まれていた。合成データは段階的な推論を教えるように設計され、ウェブデータは一般的な知識を提供した。MicrosoftはAdam (Optimizer)とGradient Clippingを用いた学習率スケジュールを使用し、安定性のためにLayer Normalizationを適用した。合成生成プロセス以外のData Augmentationは使用されなかった。
性能とベンチマーク
Phi-2は標準的な推論ベンチマークで顕著な結果を達成した。GSM-8Kでは56.7%の精度を記録し、70億パラメータのLlama-2や130億パラメータのLlama-2を上回り、GPT-3.5のようなはるかに大きなモデルの性能に近づいた。BIG-Bench Hardスイートでは57.4%を記録し、再びその数倍のサイズのモデルを凌駕した。コーディングタスクでは、HumanEvalで48.4%のpass@1を達成し、StarCoder-15Bのようなモデルと競争力のある性能を示した。
これらの結果は、アーキテクチャの革新ではなく、トレーニングデータの品質に起因するものとされた。Microsoftの研究者らは、Phi-2の推論タスクにおける性能がそのサイズに対して「驚くほど強力」であり、Neural networkの容量が効率的に利用されていることを示唆していると述べた。しかし、このモデルは事実知識と長文生成において限界を示し、これはその小規模さと焦点を絞ったトレーニングデータと一致している。
リリースとアクセシビリティ
Phi-2は2023年12月12日に、Hugging Faceモデルハブを通じてMITライセンスの下で公開された。この寛容なライセンスは、商用アプリケーションを含む無制限の使用を許可しており、当時のその能力を持つモデルとしては異例であった。Microsoftはまた、Phi-2をMicrosoft Azureクラウドプラットフォームに統合し、Azure AI StudioおよびAzure Machine Learningを通じたデプロイを可能にした。このモデルはファインチューニングと推論に利用可能であり、CPUとGPUの両方での実行をサポートしていた。
このリリースは、AI研究を民主化するというMicrosoftのより広範な戦略の一部であり、消費者向けハードウェアで実行できる、より大きなモデルに代わる軽量な選択肢を提供した。Phi-2の小規模さ(FP16で約5.4GB)は、GPT-4やClaudeのようなモデルのリソース要件とは対照的に、個人の開発者や研究者にとってアクセスしやすいものとなった。
影響と遺産
Phi-2は、効率的なMachine learningと小規模モデル設計におけるその後の研究に影響を与えた。その成功は、データの量よりも質の重要性を強調し、スケールが能力の主要な推進力であるという一般的な前提に挑戦した。このアプローチは、Google DeepMindやAnthropicを含む他の組織に、その小規模モデル向けの同様のデータキュレーション戦略を探求することを促した。
Microsoft内では、Phi-2はPhi-3ファミリーの前身として機能し、Phi-3は同じ原則をより大きなパラメータ数(最大140億)と改善された性能で拡張した。このモデルはまた、AIの環境影響に関する議論にも貢献し、そのトレーニングは大規模モデルよりも大幅に少ない計算を必要とし、持続可能性の目標と一致した。2024年現在、Phi-2はモデルサイズ、データ品質、推論能力の間のトレードオフを研究する研究者にとっての参照点であり続けている。
限界
その強みにもかかわらず、Phi-2には既知の限界があった。その知識カットオフは2023年後半であり、リアルタイム情報にアクセスできなかった。このモデルは、特にそのトレーニング分布外の領域において、もっともらしいが不正確な回答を生成することがあった。そのコンテキストウィンドウは2048トークンであり、多くの同時代のモデルよりも短く、長文ドキュメントタスクでの使用を制限した。さらに、推論に優れている一方で、創造的な文章作成や微妙な事実想起には苦労し、これはトレーニングデータの焦点の狭さを反映していた。
Microsoftはユーザーに対し、Phi-2を本番環境対応システムではなく研究用の成果物として扱い、特定のアプリケーションにはファインチューニングを推奨するよう助言した。このモデルは安全性のために調整されておらず、プロンプトが与えられると偏ったまたは有害なコンテンツを生成する可能性があり、これはその時代のモデルに共通する問題であった。