LLaMA (Large Language Model Meta AI, servant d'acronyme rétroactif) est une famille de grands modèles de langage (LLM) publiée par Meta AI à partir de février 2023. Les modèles existent en différentes tailles, allant de 1 milliard à 2 billions de paramètres. Initialement publié comme modèle de fondation, à partir de Llama 2, Meta AI a également publié des versions affinées par instructions aux côtés des modèles de fondation. La dernière version est Llama 4, publiée en avril 2025. En avril 2026, Meta Superintelligence Labs a publié Muse Spark comme remplaçant de Llama.
Contexte
Après la publication de grands modèles de langage tels que GPT-3, un axe de recherche était l'augmentation de l'échelle des modèles, ce qui, dans certains cas, montrait des augmentations majeures des capacités émergentes. La publication de ChatGPT et son succès surprise ont accru l'attention portée aux grands modèles de langage. Comparé à d'autres réponses à ChatGPT, le scientifique en chef de l'IA de Meta, Yann LeCun, a déclaré que les grands modèles de langage sont les mieux adaptés pour aider à l'écriture.
Versions
Publication initiale
La première version de Llama (stylisée LLaMA et parfois appelée Llama 1) a été annoncée le 24 février 2023, via un article de blog et un document décrivant l'entraînement, l'architecture et les performances du modèle. Le code d'inférence utilisé pour exécuter le modèle a été publié publiquement sous la licence open-source GPLv3. L'accès aux poids du modèle était géré par un processus de demande, avec un accès accordé « au cas par cas aux chercheurs académiques ; à ceux affiliés à des organisations gouvernementales, de la société civile et académiques ; et aux laboratoires de recherche industriels du monde entier ».
Llama a été entraîné uniquement sur des informations publiquement disponibles, et a été entraîné à différentes tailles de modèles, dans l'intention de le rendre plus accessible à différents matériels. Le modèle était exclusivement un modèle de fondation, bien que le document contienne des exemples de versions affinées par instructions du modèle. Meta AI a rapporté que les performances du modèle à 13B paramètres sur la plupart des références NLP dépassaient celles du GPT-3 beaucoup plus grand (avec 175B paramètres), et que le plus grand modèle à 65B était compétitif avec des modèles de pointe tels que PaLM et Chinchilla.
#### Fuite
Le 3 mars 2023, un torrent contenant les poids de Llama a été téléchargé, avec un lien vers le torrent partagé sur le forum d'images 4chan et ensuite diffusé dans les communautés d'IA en ligne. Le même jour, une demande de tirage sur le dépôt principal de Llama a été ouverte, demandant d'ajouter le lien magnétique à la documentation officielle. Le 4 mars, une demande de tirage a été ouverte pour ajouter des liens vers des dépôts HuggingFace contenant le modèle. Le 6 mars, Meta a déposé des demandes de retrait pour supprimer les dépôts HuggingFace liés dans la demande de tirage, les qualifiant de « distribution non autorisée » du modèle. HuggingFace a répondu aux demandes. Le 20 mars, Meta a déposé une demande de retrait DMCA pour violation de droits d'auteur contre un dépôt contenant un script qui téléchargeait Llama depuis un miroir, et GitHub a répondu le lendemain.
Les réactions à la fuite ont varié. Certains ont spéculé que le modèle serait utilisé à des fins malveillantes, comme du spam plus sophistiqué. Certains ont célébré l'accessibilité du modèle, ainsi que le fait que les versions plus petites du modèle peuvent être exécutées relativement à moindre coût, suggérant que cela favorisera l'épanouissement de développements de recherche supplémentaires. Plusieurs commentateurs, tels que Simon Willison, ont comparé Llama à Stable Diffusion, un modèle texte-image qui, contrairement aux modèles comparables plus sophistiqués qui l'ont précédé, était distribué ouvertement, conduisant à une prolifération rapide d'outils, de techniques et de logiciels associés.
Llama 2
Le 18 juillet 2023, en partenariat avec Microsoft, Meta a annoncé Llama 2 (stylisé LLaMa 2), la génération suivante de Llama. Meta a entraîné et publié Llama 2 en trois tailles de modèles : 7, 13 et 70 milliards de paramètres. L'architecture du modèle reste largement inchangée par rapport à celle des modèles Llama 1, mais 40 % de données supplémentaires ont été utilisées pour entraîner les modèles de fondation.
Llama 2 comprend des modèles de fondation et des modèles affinés pour le chat. Dans une autre divergence par rapport à la version originale de Llama, tous les modèles sont publiés avec leurs poids et peuvent être utilisés pour de nombreux cas d'usage commerciaux. Parce que la licence de Llama impose une politique d'utilisation acceptable qui interdit à Llama d'être utilisé à certaines fins, il n'est pas open-source. L'utilisation par Meta du terme open-source pour décrire Llama a été contestée par l'Open Source Initiative (qui maintient la définition open-source) et d'autres.
Code Llama est un affinage de Llama 2 avec des ensembles de données spécifiques au code. Les versions 7B, 13B et 34B ont été publiées le 24 août 2023, avec une version 70B publiée le 29 janvier 2024. À partir des modèles de fondation de Llama 2, Meta AI entraînerait 500B tokens supplémentaires de données de code, avant 20B tokens de données à contexte long, créant ainsi les modèles de fondation Code Llama. Ce modèle de fondation a été davantage entraîné sur 5B tokens de suivi d'instructions pour créer l'affinage instruct. Un autre modèle de fondation a été créé pour le code Python, entraîné sur 100B tokens de code Python uniquement, avant les données à contexte long.
Llama 3
Le 18 avril 2024, Meta a publié Llama 3 avec deux tailles : 8B et 70B paramètres. Les modèles ont été pré-entraînés sur environ 15 billions de tokens de texte provenant de « sources publiquement disponibles », avec les modèles instruct affinés sur « des ensembles de données d'instructions publiquement disponibles, ainsi que plus de 10M d'exemples annotés par des humains ». Les tests de Meta AI en avril 2024 ont montré que Llama 3 70B surpassait Gemini Pro 1.5 et Claude 3 Sonnet sur la plupart des références. Meta a également annoncé des plans pour rendre Llama 3 multilingue et multimodal, meilleur en codage et en raisonnement, et pour augmenter sa fenêtre de contexte.
Concernant les lois d'échelle, les modèles Llama 3 ont empiriquement montré que lorsqu'un modèle est entraîné sur des données dépassant la quantité « optimale de Chinchilla », les performances continuent de s'échelonner de manière log-linéaire. Par exemple, l'ensemble de données optimal de Chinchilla pour Llama 3 8B est de 200 milliards de tokens, mais les performances ont continué à s'échelonner log-linéairement jusqu'à l'ensemble de données 75 fois plus grand de 15 billions de tokens. Lors d'une interview avec Dwarkesh Patel, Mark Zuckerberg a déclaré que la version 8B de Llama 3 était presque aussi puissante que le plus grand Llama 2. Comparé aux modèles précédents, Zuckerberg a déclaré que l'équipe était surprise que le modèle 70B apprenait encore à la fin de l'entraînement sur 15T tokens. La décision a été prise de terminer l'entraînement pour concentrer la puissance GPU ailleurs.
Llama 3.1 a été publié le 23 juillet 2024, avec des tailles de 8B, 70B et 405B paramètres. Le modèle 405B était le premier Llama à être un modèle de mélange d'experts, et il a été publié sous une licence qui permet la redistribution et la modification, mais avec des restrictions sur son utilisation pour améliorer d'autres grands modèles de langage. Llama 3.2 a été publié le 25 septembre 2024, avec des tailles de 1B et 3B pour les appareils de périphérie, et 11B et 90B pour les tâches de vision. Llama 3.3 a été publié le 6 décembre 2024, avec un modèle 70B optimisé pour l'efficacité.
Llama 4
Llama 4 a été publié en avril 2025. La publication initiale comprenait Llama 4 Scout, Maverick et Behemoth. Scout et Maverick ont été publiés comme modèles à poids ouverts, tandis que Behemoth a été publié en aperçu. Scout est un modèle à 17B paramètres avec une fenêtre de contexte de 10 millions de tokens, et Maverick est un modèle de mélange d'experts à 400B paramètres avec une fenêtre de contexte de 1 million de tokens. Behemoth est un modèle de mélange d'experts à 2 billions de paramètres qui était encore en entraînement au moment de la publication.
Réception et impact
La publication initiale de Llama, en particulier la fuite, a eu un impact significatif sur la communauté de l'IA. L'accessibilité des modèles plus petits a permis la recherche et le développement sur du matériel grand public, favorisant une prolifération de variantes affinées et d'outils. Les modèles Llama ont été largement utilisés dans la recherche académique et les applications commerciales, et ils ont influencé les publications ultérieures de modèles à poids ouverts d'autres organisations. La publication de Llama 3 et Llama 4 a poursuivi cette tendance, Meta positionnant Llama comme une alternative à poids ouverts de premier plan aux modèles propriétaires de OpenAI, Anthropic et Google DeepMind.