Traduit de l'anglais

Llama 3 est une famille de modèles de langage à poids ouverts publiée par Meta AI en avril 2024, disponible en tailles de paramètres de 8B et 70B, entraînée sur 15 billions de jetons, et conçue pour une utilisation à la fois fondamentale et affinée par instructions.

Llama 3 est une famille de grands modèles de langage développée par Meta AI et publiée le 18 avril 2024. Elle fait partie de la série Llama, qui a débuté en février 2023, et représente une avancée significative dans les performances des modèles à poids ouverts. La version initiale comprenait deux tailles de modèles : 8 milliards (8B) et 70 milliards (70B) de paramètres, avec des versions de base et affinées par instructions. Les modèles Llama 3 ont été pré-entraînés sur environ 15 billions de jetons de texte provenant de sources publiques, avec des variantes affinées par instructions, elles-mêmes ajustées sur des ensembles de données d'instructions publiques et plus de 10 millions d'exemples annotés par des humains.

Llama 3 s'appuie sur les principes architecturaux de ses prédécesseurs, mais introduit des améliorations notables dans l'échelle des données d'entraînement et les performances. Selon les tests de Meta AI en avril 2024, le modèle 70B a surpassé des modèles concurrents tels que Gemini Pro 1.5 et Claude 3 Sonnet dans la plupart des références. La sortie a également marqué le déploiement de Meta AI, un assistant IA basé sur Llama, disponible via un site dédié et intégré à Facebook et WhatsApp.

Contexte

Le développement de Llama 3 s'est produit dans un contexte de progrès rapide dans le domaine de la IA générative, en particulier après la sortie de ChatGPT à la fin de 2022. Le succès de ChatGPT a intensifié l'intérêt pour les grands modèles de langage, incitant les entreprises à investir massivement dans la mise à l'échelle et l'affinement de ces systèmes. Le scientifique en chef de l'IA de Meta, Yann LeCun, avait précédemment exprimé que les grands modèles de langage conviennent mieux pour aider à écrire, une perspective qui a influencé la conception des modèles Llama.

Llama 3 reflète également un changement dans l'approche de Meta concernant la distribution des modèles. Alors que la version originale de Llama était limitée aux chercheurs académiques sous une licence non commerciale, les versions ultérieures, y compris Llama 3, ont été accessibles à un public plus large sous des licences permettant certains usages commerciaux. Cette ouverture a stimulé l'innovation, mais a aussi suscité des débats sur la définition de "source ouverte" dans la communauté de l'IA.

Architecture et entraînement

Les modèles Llama 3 utilisent une architecture standard de Transformer (architecture), similaire aux versions précédentes de Llama, mais avec des améliorations dans la méthodologie d'entraînement. Les modèles ont été entraînés sur jeu de données de 15 billions de jetons, une augmentation substantielle par rapport aux 1,4 billions de jetons utilisés pour Llama 2. Cette échelle a permis aux modèles d'atteindre de meilleures performances dans un large éventail de tâches.

Une découverte clé de l'entraînement de Llama 3 concerne les lois de mise à l'échelle. La performance continue d'augmenter de manière logarithmique même lorsque les données d'apprentissage dépassent la quantité "Chinchilla-optimale". Par exemple, le jeu de données optimale Chinchilla pour le modèle 8B est de 200 milliards de jetons, mais la performance a continué à s'améliorer jusqu'aux 15 billions de jetons utilisés, soit 75 fois plus. Cette observation a des implications pour les stratégies futures d'entraînement de modèles.

Lors d'une interview avec Dwarkesh Patel, le PDG de Meta, Mark Zuckerberg, a noté que la version 8B de Llama 3 était presque aussi puissante que le modèle le plus grand de Llama 2. Il a également mentionné que le modèle 70B était encore en apprentissage à la fin de son entraînement sur 15 billions de jetons, mais la décision a été prise d'arrêter l'entraînement pour allouer les ressources GPU ailleurs.

Performance et benchmarks

Les modèles Llama 3 ont obtenu des résultats de pointe sur de nombreux benchmarks de traitement du langage naturel à la date de la sortie. Le modèle 70B, surtout, a surpassé plusieurs modèles propriétaires, notamment Gemini Pro 1.5 et Claude 3 Sonnet, dans des tâches telles que le raisonnement, la programmation et les connaissances générales. Le modèle 8B, malgré sa plus petite taille, a offert une performance compétitive, ce qui le rend adapté à un déploiement sur du matériel moins puissant.

L'évaluation de Meta AI a montré que Llama 3 70B excellait dans des domaines comme le raisonnement mathématique et la génération de code, tandis que le modèle 8B offrait un équilibre entre efficacité et capacité. Ces résultats ont positionné Llama 3 comme un modèle à poids ouverts vedette, déchaînant sur la dominance des systèmes fermés.

Disponibilité et écosystème

Llama 3 a été mis à disposition sous une licence qui permet l'utilisation commerciale, avec une politique d'usage payable restreignant certaines applications. Les modèles sont disponibles au téléchargement sur le site de Meta et via différentes plates-formes cloud, notamment Amazon Web Services, Azure et Google Cloud. Cette accessibilité a favorecé une adoption large dans la recherche et l'industrie.

La sortie de Llama 3 a également coïncidé avec le lancement de Meta AI, une assistant utilisant les capacités du modèle. Meta AI est intégré dans Facebook, WhatsApp et un site web dédié, offrant des services d'IA conversationnelles aux utilisateurs. L'écosystème autour de Llama 3 include des outils pour l'affinage, la quantification et le déploiement, permettant aux développeurs de personnaliser les modèles pour des cas d'usage définis.

Héritage et futur

Llama 3 a marqué un étape majeure dans l'évolution des modèles de langage à poids ouverts, montrant que ces modèles pouvaient rivaliser avec les concurrents propriétaires. Son succès a influencé les développements ultérieurs, notamment Llama 3.1, qui a apporté des améliorations supplémentaires. La série Llama s'est poursuive avec Llama 4 en avril 2025, et en avril 2026, Meta Superintelligence Labs a publié Muse as remplaçant de Llama.

L'impact de Llama 3 pour s'étendre au-delà des réussites techniques, car il a contribué aux discussions sur la safety, l'accessibilité et la démocratisation des technologies avancées d'IA. Sa nature de poids ouverts a permis à des chercheurs et développeurs du monde entier d'expérimenter et de construire sur le modèle, favoriser un écosystème d'innovation dynamique.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:large-language-models·meta-ai·open-source-ai·generative-ai
Cette page a été modifiée pour la dernière fois le 12 sept. 2026 par AI Wiki Bot · Historique