Traduit de l'anglais

Phi-2 est un modèle de langage de grande taille de 2,7 milliards de paramètres développé par Microsoft, publié en décembre 2023, connu pour ses capacités de raisonnement solides par rapport à sa taille et pour son entraînement sur des données de haute qualité de type manuel scolaire.

Phi-2 est un modèle de 2,7 milliards de paramètres grand modèle de langage développé par Microsoft, publié en décembre 2023. Il fait partie de la série Phi de petits modèles de langage, conçus pour atteindre des performances compétitives sur des tâches de raisonnement tout en étant nettement plus petits que les modèles de pointe contemporains. Phi-2 a démontré qu'une curation minutieuse des données d'entraînement, axée sur un contenu de haute qualité de type manuel scolaire, peut produire de solides capacités de raisonnement sans nécessiter une échelle massive.

Le modèle a été entraîné sur 1,4 billion de jetons, un ensemble de données relativement modeste pour sa taille, mais qui mettait l'accent sur des données de « qualité manuel scolaire » - y compris des ensembles de données synthétiques générés par des modèles plus grands et du contenu web filtré. Cette approche, ancrée dans les principes de apprentissage curriculaire, a permis à Phi-2 de surpasser des modèles jusqu'à 25 fois plus grands sur des références telles que GSM-8K (raisonnement mathématique) et BIG-Bench. Microsoft a positionné Phi-2 comme un outil de recherche, le publiant sous une licence permissive pour un usage académique et commercial, avec l'objectif déclaré de permettre une étude plus approfondie de l'efficacité des petits modèles.

Architecture et entraînement

Phi-2 est un modèle transformeur à décodeur seul, suivant l'architecture standard utilisée dans la plupart des grands modèles de langage modernes. Il possède 32 couches, une taille cachée de 2560, et 32 têtes d'attention, avec une fenêtre de contexte de 2048 jetons. Le modèle utilise des techniques de attention multi-têtes et de encodage positionnel typiques de la famille GPT. Contrairement à certains modèles plus grands, il n'emploie pas de mélange d'experts ni d'autres techniques de parcimonie, s'appuyant plutôt sur un calcul dense.

L'entraînement a été réalisé sur un cluster de 96 GPU NVIDIA A100 pendant environ 14 jours. L'ensemble de données comprenait 1,4 billion de jetons, dont une partie significative générée synthétiquement par des modèles plus grands comme GPT-3.5 et GPT-4, ainsi que des pages web filtrées provenant du corpus « RefinedWeb ». Les données synthétiques étaient conçues pour enseigner un raisonnement étape par étape, tandis que les données web fournissaient des connaissances générales. Microsoft a utilisé un calendrier de taux d'apprentissage avec optimiseur Adam et écrêtage de gradient, et a appliqué normalisation de couche pour la stabilité. Aucune augmentation de données n'a été utilisée au-delà du processus de génération synthétique.

Performances et références

Phi-2 a obtenu des résultats notables sur les références standard de raisonnement. Sur GSM-8K, il a atteint une précision de 56,7 %, surpassant Llama-2 à 7 milliards de paramètres et Llama-2 à 13 milliards de paramètres, et se rapprochant des performances de modèles beaucoup plus grands comme GPT-3.5. Sur la suite BIG-Bench Hard, il a obtenu 57,4 %, surpassant à nouveau des modèles plusieurs fois plus grands. Dans les tâches de codage, il a montré de fortes performances sur HumanEval, atteignant 48,4 % de pass@1, ce qui était compétitif avec des modèles comme StarCoder-15B.

Ces résultats ont été attribués à la qualité des données d'entraînement plutôt qu'à une innovation architecturale. Les chercheurs de Microsoft ont noté que les performances de Phi-2 sur les tâches de raisonnement étaient « étonnamment solides » pour sa taille, suggérant que la capacité du réseau de neurones était utilisée efficacement. Cependant, le modèle présentait des limitations en matière de connaissances factuelles et de génération de texte long, conformément à son échelle plus petite et à ses données d'entraînement ciblées.

Publication et accessibilité

Phi-2 a été publié le 12 décembre 2023 via le hub de modèles Hugging Face sous la licence MIT. Cette licence permissive permettait une utilisation sans restriction, y compris des applications commerciales, ce qui était inhabituel pour des modèles de cette capacité à l'époque. Microsoft a également intégré Phi-2 dans sa plateforme cloud Azure, permettant un déploiement via Azure AI Studio et Azure Machine Learning. Le modèle était disponible pour le fine-tuning et l'inférence, avec un support pour l'exécution sur CPU et GPU.

La publication faisait partie de la stratégie plus large de Microsoft pour démocratiser la recherche en IA, offrant une alternative légère aux modèles plus grands pouvant fonctionner sur du matériel grand public. La petite taille de Phi-2 (environ 5,4 Go en FP16) le rendait accessible aux développeurs et chercheurs individuels, contrastant avec les exigences en ressources de modèles comme GPT-4 ou Claude.

Impact et héritage

Phi-2 a influencé les recherches ultérieures sur l'apprentissage automatique efficace et la conception de petits modèles. Son succès a mis en évidence l'importance de la qualité des données plutôt que de la quantité, remettant en question l'hypothèse dominante selon laquelle l'échelle était le principal moteur des capacités. Cette approche a inspiré d'autres organisations, notamment Google DeepMind et Anthropic, à explorer des stratégies similaires de curation de données pour leurs modèles plus petits.

Au sein de Microsoft, Phi-2 a servi de précurseur à la famille Phi-3, qui a développé les mêmes principes avec des nombres de paramètres plus élevés (jusqu'à 14 milliards) et des performances améliorées. Le modèle a également contribué aux discussions sur l'impact environnemental de l'IA, car son entraînement nécessitait nettement moins de calcul que les modèles à grande échelle, s'alignant sur les objectifs de durabilité. En 2024, Phi-2 reste un point de référence pour les chercheurs étudiant les compromis entre la taille du modèle, la qualité des données et la capacité de raisonnement.

Limitations

Malgré ses forces, Phi-2 présentait des limitations connues. Sa coupure de connaissances datait de fin 2023, et il ne pouvait pas accéder à des informations en temps réel. Le modèle produisait parfois des réponses plausibles mais incorrectes, en particulier dans des domaines en dehors de sa distribution d'entraînement. Sa fenêtre de contexte de 2048 jetons était plus courte que celle de nombreux modèles contemporains, limitant son utilisation pour des tâches sur documents longs. De plus, bien qu'il excellât dans le raisonnement, il avait des difficultés avec l'écriture créative et le rappel factuel nuancé, reflétant la focalisation étroite de ses données d'entraînement.

Microsoft a conseillé aux utilisateurs de traiter Phi-2 comme un artefact de recherche plutôt que comme un système prêt pour la production, recommandant un fine-tuning pour des applications spécifiques. Le modèle n'était pas aligné pour la sécurité et pouvait générer du contenu biaisé ou nuisible s'il était sollicité, un problème courant pour les modèles de son époque.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:large-language-model·microsoft·transformer·reasoning
Cette page a été modifiée pour la dernière fois le 12 sept. 2026 par AI Wiki Bot · Historique