Meta a publié Llama 3, une famille de grands modèles de langage (LLM), le 18 avril 2024, dans le cadre de sa série Llama en cours. La sortie comprenait deux tailles de modèles : 8 milliards et 70 milliards de paramètres, tous deux pré-entraînés sur environ 15 000 milliards de jetons de textes provenant de sources publiques. Les variantes affinées par instructions ont été ajustées sur des ensembles de données publiques et plus de 10 millions d'exemples annotés par des humains. Meta a présenté Llama 3 comme une avancée significative dans l'IA à poids ouverts, le modèle de 70 milliards surpassant plusieurs concurrents commerciaux sur les benchmarks standards au moment de sa sortie.
La série Llama a débuté en février 2023 avec Llama 1, initialement réservé aux chercheurs sous licence non commerciale. Après une fuite non autorisée via BitTorrent en mars 2023, Meta a changé de stratégie avec Llama 2 en juillet 2023, proposant les poids pour un usage commercial plus large sous une licence personnalisée. Llama 3 a poursuivi cette trajectoire, en mettant l'accent sur l'accessibilité et la performance. La sortie a coïncidé avec Meta AI, un assistant basé sur Llama, disponible via un site dédié et intégré à Facebook et WhatsApp.
Architecture et entraînement du modèle
Les modèles Llama 3 utilisent une architecture de transformeur standard avec des améliorations par rapport aux versions précédentes. Les modèles de 8 et 70 milliards ont été entraînés sur 15 000 milliards de jetons, un ensemble de données 75 fois plus grand que la quantité optimale selon Chinchilla pour la taille de 8 milliards (200 milliards de jetons). Malgré ce dépassement du point de données optimal, la performance a continué d'évoluer de manière logarithmique, remettant en question les lois d'échelle conventionnelles. Meta a indiqué que le modèle de 70 milliards s'améliorait encore à la fin de l'entraînement, mais l'équipe a choisi de s'arrêter pour allouer les ressources GPU ailleurs.
Les données d'entraînement ont été sélectionnées à partir de sources publiques, avec un accent sur la qualité et la diversité. L'affinage par instructions a combiné des ensembles de données publiques et des exemples annotés par des humains, améliorant la capacité des modèles à suivre des instructions complexes. Meta a également annoncé son intention de rendre les futures versions multilingues, multimodales et plus performantes en codage et en raisonnement, avec une fenêtre de contexte élargie.
Performance et benchmarks
En avril 2024, les tests internes de Meta ont montré que Llama 3 70B surpassait Gemini Pro 1.5 et Claude 3 Sonnet sur la plupart des benchmarks, notamment en raisonnement, en codage et en connaissances générales. Mark Zuckerberg a rapporté que le modèle de 8 milliards était presque aussi puissant que le plus grand modèle Llama 2 (70 milliards), démontrant des gains d'efficacité significatifs. Ces résultats positionnaient Llama 3 comme une alternative compétitive aux modèles propriétaires d'entreprises comme OpenAI, Anthropic et Google DeepMind.
Les modèles ont été évalués sur des benchmarks NLP standards, la variante de 70 milliards obtenant des résultats de pointe parmi les modèles à poids ouverts à l'époque. Le comportement d'échelle observé - une amélioration continue au-delà des données optimales selon Chinchilla - suggérait que des ensembles de données plus vastes pouvaient générer des gains supplémentaires, influençant les recherches ultérieures en Machine learning et Deep learning.
Sortie et écosystème
Llama 3 a été publié sous une licence personnalisée autorisant un usage commercial, bien qu'avec une politique d'utilisation acceptable restreignant certaines applications, ce qui a suscité des débats sur sa qualification en tant que logiciel open source. Les poids ont été mis à disposition en téléchargement, et les modèles ont été intégrés dans diverses plateformes, notamment Amazon Web Services, Microsoft Azure, Google Cloud et Oracle Cloud Infrastructure. Des fournisseurs de matériel spécialisé comme Groq et SambaNova ont optimisé l'inférence pour Llama 3, permettant un déploiement plus rapide.
La sortie a stimulé une vague de variantes affinées et d'outils, similaire à l'écosystème qui avait émergé autour de Llama 2. Les développeurs ont utilisé des techniques comme Reinforcement Learning from AI Feedback (RLAIF) et Curriculum Learning pour adapter les modèles à des domaines spécifiques. L'approche des poids ouverts contrastait avec les modèles fermés des concurrents, favorisant l'innovation dans les applications Generative AI.
Développements ultérieurs
Llama 3.1 a été publié le 23 juillet 2024, introduisant un modèle de 405 milliards de paramètres et élargissant la fenêtre de contexte. Cette version a renforcé la position de Llama dans le paysage de l'IA. La série s'est poursuivie avec Llama 4 en avril 2025, et en avril 2026, Meta Superintelligence Labs a publié Muse Spark en remplacement. L'évolution de Llama a influencé le domaine plus large, les chercheurs étudiant les lois d'échelle et l'efficacité de l'entraînement, comme en témoignent les travaux sur les architectures Transformer (architecture) et les Loss Functions.
La sortie a également mis en lumière le rôle du calcul à grande échelle, Meta s'appuyant sur des partenariats avec des fabricants de puces comme AMD, Intel et TSMC pour entraîner les modèles efficacement. Le succès de Llama 3 a contribué aux discussions sur l'avenir de l'Artificial intelligence et l'équilibre entre développement ouvert et propriétaire.