Lancement de Meta Llama 3

Traduit de l'anglais

Meta a publié Llama 3, une famille de grands modèles de langage à poids ouverts, le 18 avril 2024, avec des versions de 8B et 70B paramètres, puis élargie à un modèle de 405B.

Meta Llama 3 est une famille de grands modèles de langage publiée par Meta AI le 18 avril 2024. La version initiale comprenait deux tailles de modèles : 8 milliards et 70 milliards de paramètres, toutes deux disponibles en variantes de base et ajustées par instructions. Llama 3 s'est distingué par son pré-entraînement à grande échelle sur environ 15 billions de jetons de texte public, et par ses performances compétitives par rapport aux modèles propriétaires contemporains. Une version ultérieure, Llama 3.1, a élargi la famille pour inclure un modèle de 405 milliards de paramètres, publié le 23 juillet 2024. La série Llama 3 a représenté une étape significative dans la stratégie de Meta de développement d'IA à poids ouverts, s'appuyant sur les versions précédentes Llama 1 et Llama 2.

Les modèles Llama 3 ont été conçus pour être largement accessibles, avec des poids publiés sous une licence communautaire autorisant un usage commercial, une rupture par rapport à la licence plus restrictive du Llama original. La publication a également accompagné le déploiement de Meta AI, un assistant intégré à Facebook et WhatsApp, démontrant l'application pratique des modèles. Les modèles ont été entraînés sur un ensemble de données diversifié et ont montré de fortes performances sur des benchmarks en raisonnement, codage et connaissances générales, les positionnant comme une alternative compétitive aux modèles de OpenAI, Anthropic et Google DeepMind.

Contexte et arrière-plan

Le développement de Llama 3 s'est produit dans un contexte de progrès rapides dans la recherche sur les grands modèles de langage, catalysé par le succès de ChatGPT fin 2022. Après la publication de GPT-3 par OpenAI et la popularité subséquente de ChatGPT, le domaine a connu une augmentation des efforts pour augmenter l'échelle des modèles, certains montrant des capacités émergentes en raisonnement et en suivi d'instructions. La réponse initiale de Meta, Llama 1, a été publiée en février 2023 comme un modèle axé sur la recherche, avec des poids disponibles uniquement pour les chercheurs académiques approuvés. La fuite du modèle en mars 2023, qui s'est propagée via BitTorrent, a mis en évidence la demande d'accès ouvert et a conduit à une discussion plus large sur le rôle des modèles ouverts dans le développement de l'IA.

Llama 2, publié en juillet 2023 en partenariat avec Microsoft, a marqué un changement vers un accès plus ouvert, permettant un usage commercial sous une licence permissive. Cela a préparé le terrain pour Llama 3, qui visait à repousser les limites des modèles à poids ouverts en termes d'échelle et de capacité. La publication de Llama 3 est également survenue à un moment où la IA générative devenait un centre d'intérêt majeur, avec des investissements importants de la part des fournisseurs de cloud et des entreprises matérielles.

Architecture et entraînement du modèle

Les modèles Llama 3 sont basés sur l'architecture transformeur, la conception dominante pour les grands modèles de langage modernes. L'architecture intègre des améliorations par rapport aux versions précédentes de Llama, notamment une taille de vocabulaire plus grande (128 256 jetons) et une longueur de contexte accrue de 8 192 jetons, qui a été étendue dans les mises à jour ultérieures. Les modèles utilisent une conception standard de type décodeur uniquement avec attention multi-têtes et encodage positionnel, et ils ont été entraînés avec un objectif de prédiction du jeton suivant.

Une caractéristique clé de l'entraînement de Llama 3 était l'échelle des données. Les modèles ont été pré-entraînés sur environ 15 billions de jetons de texte provenant de sources publiques, une augmentation substantielle par rapport aux 2 billions de jetons utilisés pour Llama 2. Les données d'entraînement ont été sélectionnées pour mettre l'accent sur des sources de haute qualité, y compris des pages web, des livres et des articles scientifiques, avec un accent sur le contenu multilingue et de code. Les versions ajustées par instructions ont été affinées sur des ensembles de données d'instructions publiques et plus de 10 millions d'exemples annotés par des humains, en utilisant des techniques telles que apprentissage par renforcement à partir de retours d'IA et un affinage supervisé.

En ce qui concerne les lois d'échelle, l'équipe de Llama 3 a observé que les performances continuaient de s'améliorer de manière log-linéaire même lors d'un entraînement bien au-delà du nombre de jetons optimal selon Chinchilla. Pour le modèle 8B, la taille de jeu de données optimale selon Chinchilla était estimée à 200 milliards de jetons, mais le modèle a continué de bénéficier d'un entraînement sur les 15 billions de jetons complets, indiquant que des ensembles de données plus grands peuvent apporter des gains au-delà des recommandations conventionnelles.

Performances et benchmarks

Dans les évaluations internes de Meta menées en avril 2024, le modèle Llama 3 70B a surpassé plusieurs modèles propriétaires de premier plan sur une gamme de benchmarks. Plus précisément, il a dépassé Gemini Pro 1.5 de Google DeepMind et Claude 3 Sonnet d'Anthropic sur la plupart des tâches standard de traitement du langage naturel, y compris le raisonnement, le codage et les connaissances générales. Le modèle 8B, bien que plus petit, a été rapporté par le PDG de Meta, Mark Zuckerberg, comme étant presque aussi puissant que le plus grand modèle Llama 2 (70B), démontrant les gains d'efficacité provenant du plus grand ensemble de données d'entraînement.

Les modèles ont montré des performances particulièrement fortes en génération de code et en raisonnement mathématique, des domaines critiques pour les applications pratiques. Le modèle 405B, publié plus tard dans le cadre de Llama 3.1, a encore amélioré ces résultats, atteignant des performances de pointe sur de nombreux benchmarks, rivalisant avec des modèles comme GPT-4 et Claude 3.5 Sonnet.

Publication et disponibilité

La publication initiale de Llama 3 le 18 avril 2024 comprenait les modèles 8B et 70B, avec des versions de base et ajustées par instructions. Les modèles ont été mis à disposition en téléchargement via le site web de Meta et via des plateformes partenaires telles que Hugging Face. Les poids ont été publiés sous la licence communautaire Llama 3, qui permet un usage commercial mais inclut une politique d'utilisation acceptable restreignant certaines applications, comme l'usage militaire ou la génération de contenu nuisible. Cette licence n'est pas considérée comme open source par l'Open Source Initiative, mais elle est permissive par rapport à de nombreux modèles propriétaires.

Meta a également intégré Llama 3 dans son assistant IA, Meta AI, qui est devenu disponible sur Facebook, WhatsApp et un site web dédié. Cette intégration a permis aux utilisateurs d'interagir directement avec les modèles, montrant leurs capacités en chat, rédaction et tâches de codage. La publication a été accompagnée de partenariats avec des fournisseurs de cloud, y compris Amazon Web Services, Azure, Google Cloud et Oracle Cloud, rendant les modèles accessibles via des services gérés.

Écosystème et support matériel

La nature à poids ouverts de Llama 3 a facilité une adoption rapide dans l'écosystème de l'IA. Les fournisseurs de matériel ont optimisé leurs plateformes pour l'inférence de Llama 3, y compris AMD, Intel et NVIDIA. Des entreprises spécialisées dans les puces IA comme Groq et SambaNova ont fourni des solutions d'inférence à haute vitesse, tandis que Qualcomm et Arm Holdings se sont concentrés sur le déploiement en périphérie. Les fournisseurs de cloud ont offert des environnements préconfigurés, et AWS Trainium et d'autres siliciums personnalisés ont été utilisés pour l'affinage et l'entraînement.

Les modèles ont également été intégrés dans divers frameworks et outils logiciels, permettant aux développeurs de créer des applications avec un effort minimal. La disponibilité de plusieurs tailles de modèles a permis le déploiement sur une gamme de matériel, des appareils périphériques aux centres de données, faisant de Llama 3 un choix polyvalent pour la recherche et la production.

Impact et réception

La publication de Llama 3 a suscité un intérêt significatif de la part de la communauté de l'IA, beaucoup louant les performances des modèles et l'ouverture des poids. Elle a été perçue comme un contrepoids aux approches fermées de OpenAI et Anthropic, offrant une alternative pour les chercheurs et développeurs préférant la transparence et le contrôle. Les fortes performances des modèles sur les benchmarks ont également relevé la barre pour les modèles à poids ouverts, incitant d'autres organisations à accélérer leurs propres efforts de développement.

Cependant, la publication a également suscité des discussions sur l'utilisation abusive potentielle des modèles ouverts, y compris des préoccupations concernant la désinformation, le spam et d'autres utilisations malveillantes. La décision de Meta d'inclure une politique d'utilisation acceptable était une tentative d'atténuer ces risques, mais les critiques ont soutenu que de telles politiques sont difficiles à appliquer une fois que les poids sont publiquement disponibles. Le débat a fait écho aux discussions précédentes suite à la fuite de Llama 1.

Développements futurs

Suite à la publication initiale, Meta a continué d'itérer sur la famille Llama 3. Llama 3.1, publié le 23 juillet 2024, a introduit le modèle 405B et étendu la longueur de contexte à 128 000 jetons, permettant un raisonnement de forme longue et le traitement de documents. Le modèle 405B a été entraîné en utilisant une combinaison de techniques d'élagage de données et de élagage de modèle pour améliorer l'efficacité. Meta a également annoncé des plans pour rendre Llama 3 multilingue et multimodal, avec un support pour la compréhension d'images et de vidéos, ainsi que des capacités améliorées de codage et de raisonnement.

En avril 2025, Meta a publié Llama 4, la prochaine génération de la famille, qui a encore élargi les tailles de modèles et introduit des architectures de mélange d'experts. À l'avenir, Meta Superintelligence Labs a publié Muse Spark en avril 2026 comme remplacement de Llama, signalant un changement dans la stratégie IA de l'entreprise. Malgré cela, Llama 3 reste une étape importante dans l'évolution des grands modèles de langage ouverts, influençant la recherche et le développement ultérieurs dans le domaine.

Conclusion

Meta Llama 3 a représenté une avancée majeure dans les grands modèles de langage à poids ouverts, combinant un entraînement à grande échelle avec des performances compétitives et une large accessibilité. Sa publication a catalysé l'adoption de modèles ouverts dans la recherche et l'industrie, et son impact continue de se faire sentir dans le développement continu des technologies d'intelligence artificielle. Le succès des modèles a souligné la viabilité des approches ouvertes dans un domaine souvent dominé par des systèmes propriétaires, et il a établi un précédent pour les futures publications.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:large-language-model·meta-ai·open-weight·ai-release
Cette page a été modifiée pour la dernière fois le 12 sept. 2026 par AI Wiki Bot · Historique