Phi 4 est une famille de grands modèles de langage développée par Microsoft Research. La série se caractérise par des tailles de modèles relativement compactes par rapport aux systèmes de pointe, tout en visant des performances compétitives sur les tâches de raisonnement, de mathématiques et de codage. Plusieurs variantes de Phi 4 sont apparues sur les classements publics de LLM et dans les médias, avec au moins quatre configurations distinctes enregistrées dans les instantanés de référence.
Le premier modèle Phi 4 documenté publiquement a été publié fin 2024, s'appuyant sur la série précédente Phi-3. Microsoft a positionné Phi 4 comme un modèle orienté recherche, mettant l'accent sur la qualité des données et la génération de données synthétiques plutôt que sur la simple échelle. La variante phare, Phi-4 (14B), a démontré de solides résultats sur des références de raisonnement standard telles que MATH et GSM8K, surpassant souvent des modèles plus grands d'autres organisations.
Variantes de modèles et références
Les classements publics, y compris ceux hébergés par des plateformes d'évaluation IA, listent au moins quatre variantes de Phi 4. Celles-ci incluent le modèle de base 14B, une version 14B ajustée par instructions, et des configurations plus petites (par exemple, 7B et 3.8B) qui échangent une partie de la précision contre des exigences de calcul réduites. Dans les instantanés de référence, le modèle 14B ajusté par instructions se classe régulièrement parmi les meilleurs modèles compacts, atteignant des scores comparables à des modèles avec 70B paramètres ou plus sur des tâches telles que la génération de code (HumanEval) et la déduction logique (ARC).
Les modèles sont entraînés en utilisant une architecture Transformer avec attention multi-têtes et encodages positionnels. L'entraînement a utilisé un mélange de données web organisées, de dépôts de code filtrés et de jeux de données synthétiques générés par des modèles enseignants plus grands. Microsoft n'a pas divulgué tous les détails de l'entraînement, mais l'approche s'aligne sur les principes de apprentissage curriculaire, augmentant progressivement la complexité des tâches.
Spécifications techniques
Les modèles Phi 4 utilisent une conception dense, non-MoE (mélange d'experts), ce qui simplifie le déploiement sur du matériel standard. La variante 14B possède 14 milliards de paramètres, une fenêtre de contexte de 8 192 jetons, et prend en charge l'échantillonnage top-k et top-p pour la génération. Les modèles sont publiés sous une licence permissive (MIT pour la recherche et l'usage commercial, avec certaines restrictions sur la version 14B).
L'inférence est optimisée pour le cloud Azure et le déploiement local. Les modèles sont compatibles avec des frameworks populaires comme Hugging Face Transformers et vLLM. Microsoft a rapporté que Phi 4 atteint une accélération de 2x par rapport à Phi-3 sur les instances Trainium d'AWS grâce à une meilleure fusion des noyaux.
Performances et limites
Sur les classements publics, les variantes de Phi 4 montrent de fortes performances en mathématiques et en logique, mais elles sont en retard sur les modèles de pointe d'OpenAI et de Google DeepMind en matière d'écriture créative ouverte et de suivi nuancé des instructions. Les modèles présentent des hallucinations occasionnelles sur les requêtes factuelles, un problème courant dans le domaine. Microsoft a publié des données RLHF (apprentissage par renforcement à partir de retours humains) pour améliorer l'alignement, mais les modèles restent sujets à générer des réponses plausibles mais incorrectes sur des sujets de niche.
La variante 3.8B est notable pour fonctionner sur des appareils de périphérie, y compris les smartphones et les systèmes embarqués, bien qu'elle nécessite une quantification pour tenir dans les contraintes de mémoire. Cela fait de Phi 4 un candidat pour les applications IA générative sur appareil, similaire aux efforts d'Apple et de Samsung Electronics.
Écosystème et adoption
Phi 4 a été intégré dans Microsoft Azure AI Foundry et est disponible via API. Des plateformes tierces comme Groq et SambaNova offrent une inférence accélérée pour le modèle 14B. Les poids ouverts ont stimulé des ajustements fins communautaires pour des domaines spécialisés, y compris le raisonnement médical et juridique, bien que ceux-ci ne soient pas officiellement approuvés.
Les chercheurs du Stanford AI Lab et du Berkeley AI Research ont cité Phi 4 dans des études sur l'efficacité des données, notant que ses performances suggèrent l'importance de la curation des données d'entraînement plutôt que du nombre brut de paramètres. Le modèle a également été utilisé dans des expériences de élagage de modèles, montrant que jusqu'à 30 % des poids peuvent être supprimés avec une perte de précision minimale.
Directions futures
Microsoft n'a pas annoncé de Phi 5, mais l'entreprise continue de publier des recherches sur la génération de données synthétiques et les fonctions de perte qui pourraient informer les itérations futures. Début 2025, Phi 4 reste un point de référence pour les modèles compacts et performants, et ses variantes sont fréquemment utilisées comme bases de référence dans les articles académiques sur l'apprentissage profond efficace.
La famille de modèles fait partie d'une tendance plus large vers des modèles plus petits et spécialisés pouvant fonctionner sur du matériel grand public, remettant en question l'hypothèse selon laquelle l'échelle est la seule voie vers la capacité. Que cette approche puisse être étendue davantage reste une question ouverte, mais Phi 4 a démontré que des données soigneusement organisées peuvent partiellement compenser un nombre réduit de paramètres.