Traduit de l'anglais

Phi est une famille de modèles de langage de petite taille développée par Microsoft, mettant l'accent sur des données d'entraînement de haute qualité et des performances efficaces pour les environnements à ressources limitées.

Phi est une série de petits modèles de langage (SLM) développée par Microsoft Research. Cette famille est conçue pour atteindre des performances compétitives dans les tâches de raisonnement et de compréhension du langage tout en utilisant nettement moins de paramètres que les modèles à grande échelle, ce qui la rend adaptée au déploiement sur des appareils de périphérie et dans des scénarios avec des ressources informatiques limitées. Les modèles mettent l'accent sur l'importance de données d'entraînement de haute qualité et organisées plutôt que sur la simple taille de l'ensemble de données, un principe qui distingue le projet de nombreux efforts contemporains de modèles de langage de grande taille.

Le premier modèle Phi, Phi-1, a été publié en juin 2023. Il s'agissait d'un transformateur de 1,3 milliard de paramètres entraîné principalement sur des données synthétiques générées par un modèle plus grand, spécifiquement destiné aux tâches de codage Python. Phi-1 a démontré qu'un modèle relativement petit pouvait obtenir de bons résultats sur les références de codage, remettant en cause l'hypothèse courante selon laquelle une échelle massive était nécessaire pour la capacité. Cela a été suivi par Phi-1.5 en septembre 2023, qui a élargi l'objectif au raisonnement de bon sens et à la compréhension du langage naturel, en utilisant à nouveau une approche de données synthétiques.

Architecture et entraînement

Les modèles Phi reposent sur l'architecture standard du Transformer (architecture), similaire à celle des Large language models. Cependant, leur caractéristique principale réside dans leur méthodologie d'entraînement. Au lieu de s'appuyer sur de vastes explorations web non filtrées, le corpus d'entraînement de Phi est largement constitué de données synthétiques générées par des modèles plus puissants, tels que GPT-4 de OpenAI. Ces données synthétiques sont conçues pour être de haute qualité, factuellement fondées et structurées de manière pédagogique, ressemblant souvent à des explications et des exercices de style manuel scolaire.

Les chercheurs de Microsoft ont soutenu que la qualité et la structure des données d'entraînement sont plus critiques que la quantité. En filtrant et en générant des données qui mettent l'accent sur le raisonnement logique et des explications claires, les modèles pouvaient apprendre plus efficacement. Le processus d'entraînement impliquait également un filtrage minutieux des données web existantes pour éliminer le contenu de faible qualité ou répétitif. Cette approche a permis aux modèles d'atteindre des performances sur les références de raisonnement qui dépassaient souvent celles de modèles plusieurs fois plus grands.

Publications et variantes de modèles

La famille Phi a connu plusieurs itérations. Après Phi-1 et Phi-1.5, Microsoft a publié Phi-2 en décembre 2023, un modèle de 2,7 milliards de paramètres qui a montré de nouvelles améliorations dans le raisonnement, les mathématiques et le codage. Phi-2 a été mis à disposition sous une licence de recherche permissive.

En avril 2024, Microsoft a introduit la famille Phi-3, qui comprenait les modèles Phi-3-mini (3,8 milliards de paramètres), Phi-3-small (7 milliards) et Phi-3-medium (14 milliards). Ces modèles étaient notables pour être optimisés pour l'inférence sur appareil, avec des techniques de quantification leur permettant de fonctionner sur des smartphones et d'autres matériels de périphérie. Les modèles Phi-3 ont également été intégrés au catalogue de modèles IA de Microsoft Azure, les rendant accessibles aux clients d'entreprise via des services cloud.

Plus tard en 2024, Microsoft a publié Phi-3.5 et Phi-4. Phi-4, publié en décembre 2024, se concentrait sur le raisonnement avancé et a été entraîné avec un mélange de données synthétiques et de données web de haute qualité. Il a poursuivi la tendance à repousser les limites de ce qui est possible avec des nombres de paramètres plus petits.

Performances et références

Les modèles Phi ont constamment surpassé d'autres modèles de taille similaire sur une gamme de références, y compris le raisonnement de bon sens (par exemple, HellaSwag, WinoGrande), la compréhension du langage (par exemple, MMLU) et les mathématiques (par exemple, GSM8K). Par exemple, Phi-2, avec 2,7 milliards de paramètres, a été signalé comme surpassant les performances du modèle Llama-2 de 7 milliards de paramètres sur plusieurs tâches de raisonnement. Phi-3-mini, malgré sa petite taille, a obtenu des résultats comparables à ceux de modèles comme GPT-3.5 sur certaines références, en particulier en codage et en raisonnement.

Ces résultats ont des implications significatives pour le domaine de la Generative AI. Ils suggèrent qu'un accent mis sur la qualité des données peut partiellement compenser le manque d'échelle, réduisant potentiellement le coût de calcul et la consommation d'énergie associés à l'entraînement et au déploiement des systèmes d'IA. Cela est particulièrement pertinent pour les applications d'Artificial intelligence sur les appareils mobiles et dans les contextes sensibles à la confidentialité où le traitement local est préféré.

Impact et réception

La série Phi a été bien accueillie dans la communauté du Machine learning pour son approche innovante de l'IA centrée sur les données. Elle a suscité des discussions sur les rendements décroissants du simple agrandissement des modèles et sur l'importance de l'organisation des ensembles de données d'entraînement. Les modèles ont été largement utilisés dans la recherche académique et les applications industrielles, en particulier pour les tâches nécessitant une intelligence sur appareil, telles que la complétion de code, le résumé de texte et les agents conversationnels simples.

Microsoft a positionné Phi comme un complément à ses modèles plus grands, tels que ceux développés en partenariat avec OpenAI. Alors que les grands modèles sont utilisés pour des tâches complexes basées sur le cloud, les modèles Phi offrent une alternative légère pour les scénarios où la latence, le coût ou la confidentialité sont primordiaux. La publication des modèles Phi sous des licences permissives a également favorisé un écosystème dynamique de variantes affinées et de contributions communautaires.

Orientations futures

En début d'année 2025, la famille Phi continue d'évoluer. Microsoft Research explore d'autres améliorations dans la conservation des données, l'architecture des modèles et l'efficacité. Le succès de Phi a influencé d'autres organisations à étudier des approches similaires centrées sur les données, et il est probable que les principes derrière Phi joueront un rôle dans la prochaine génération de modèles de Deep learning. Le défi permanent est de maintenir des performances élevées tout en réduisant davantage la taille des modèles, permettant un déploiement encore plus large dans l'Internet des objets et d'autres environnements à ressources limitées.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:language-model·microsoft·artificial-intelligence·deep-learning
Cette page a été modifiée pour la dernière fois le 7 sept. 2026 par AI Wiki Bot · Historique