La fuite de Llama fait référence à la distribution non autorisée des poids du modèle LLaMA (Large Language Model Meta AI) de Meta AI en mars 2023. Cet événement a marqué un tournant dans le développement des grands modèles de langage, car il a contourné la politique d'accès contrôlé de Meta et a rendu les poids disponibles au public via BitTorrent et HuggingFace. La fuite a accéléré la recherche en IA open-source en permettant à une communauté plus large de développeurs et de chercheurs d'expérimenter et de construire sur ces modèles, malgré les préoccupations initiales concernant leur mauvaise utilisation.
La fuite a eu lieu peu après que Meta a annoncé LLaMA le 24 février 2023, comme une famille de modèles de fondation allant de 1 milliard à 65 milliards de paramètres. Contrairement aux modèles contemporains comme le GPT-3 d'OpenAI, qui étaient fermés, les poids de LLaMA étaient destinés aux chercheurs académiques sous une licence non commerciale. La fuite a démocratisé l'accès, conduisant à une prolifération de variantes et d'outils affinés, et a influencé les sorties ultérieures de Meta, Llama 2 et Llama 3, qui ont été rendues plus ouvertement disponibles.
Contexte
Au début des années 2020, le domaine de l'intelligence artificielle a connu un regain d'intérêt après la sortie de ChatGPT d'OpenAI en novembre 2022. Cela a déclenché une course parmi les entreprises technologiques pour développer des grands modèles de langage plus puissants. Meta, sous sa division de recherche en IA Meta AI, a poursuivi une stratégie de recherche ouverte, mais avec des restrictions sur l'accès aux modèles. Le scientifique en chef de l'IA de Meta, Yann LeCun, a exprimé son scepticisme quant au battage médiatique, déclarant que les grands modèles de langage sont surtout utiles pour aider à l'écriture, et non pour atteindre une intelligence de niveau humain.
Le projet LLaMA visait à créer des modèles efficaces pouvant fonctionner sur du matériel grand public, contrairement à l'échelle massive de modèles comme GPT-3 (175 milliards de paramètres). Meta a entraîné LLaMA sur des données publiquement disponibles, en utilisant une architecture transformer, et a publié le code d'inférence sous une licence open-source, mais a gardé les poids sous restriction.
Sortie initiale et fuite
Le 24 février 2023, Meta AI a annoncé LLaMA via un article de blog et un document détaillant son entraînement et ses performances. Les modèles étaient disponibles en tailles de 7B, 13B, 33B et 65B paramètres. Meta a rapporté que le modèle 13B surpassait GPT-3 sur de nombreux benchmarks NLP, et que le modèle 65B était compétitif avec des modèles de pointe comme PaLM et Chinchilla. L'accès aux poids était accordé au cas par cas aux chercheurs académiques, aux gouvernements, à la société civile et aux laboratoires de recherche industrielle.
Le 3 mars 2023, un torrent contenant les poids a été téléchargé, avec le lien partagé sur 4chan et rapidement diffusé dans les communautés d'IA en ligne. Le même jour, une demande de tirage sur le dépôt officiel LLaMA a demandé l'ajout du lien magnétique à la documentation. Le 4 mars, une autre demande de tirage a ajouté des liens vers des dépôts HuggingFace hébergeant le modèle. Meta a répondu en déposant des demandes de retrait auprès de HuggingFace le 6 mars, qualifiant la distribution de non autorisée, et HuggingFace a obtempéré. Le 20 mars, Meta a déposé une demande de retrait DMCA contre un dépôt GitHub contenant un script de téléchargement, qui a été supprimé le lendemain.
La fuite a suscité des réactions mitigées. Certains craignaient une utilisation malveillante, comme du spam sophistiqué ou de la désinformation. D'autres célébraient l'accessibilité, notant que les modèles plus petits pouvaient fonctionner sur du matériel modeste, favorisant la recherche et l'innovation. Des commentateurs comme Simon Willison ont comparé LLaMA à Stable Diffusion, un modèle texte-image ouvert qui a stimulé une croissance rapide de l'écosystème. La fuite a effectivement forcé Meta à reconsidérer sa stratégie de sortie.
Llama 2
Le 18 juillet 2023, Meta, en partenariat avec Microsoft, a annoncé Llama 2, la génération suivante. Llama 2 a été publié en trois tailles : 7B, 13B et 70B paramètres. L'architecture était largement inchangée par rapport à Llama 1, mais les données d'entraînement ont été augmentées de 40 %. Contrairement à l'original, Llama 2 incluait à la fois des modèles de fondation et des versions affinées par instructions pour le chat. Tous les modèles ont été publiés avec leurs poids et autorisaient un usage commercial, sous réserve d'une politique d'utilisation acceptable. Cette licence, cependant, n'a pas été approuvée par l'Open Source Initiative, ce qui a conduit à des débats sur la question de savoir si Llama 2 pouvait être qualifié d'open source.
La sortie de Llama 2 a marqué un changement vers une distribution plus ouverte, en partie influencée par la fuite. Elle a permis une vague de modèles affinés et d'applications commerciales. Meta a également publié Code Llama, un affinage de Llama 2 pour la génération de code, avec des versions le 24 août 2023 (7B, 13B, 34B) et le 29 janvier 2024 (70B).
Llama 3
Le 18 avril 2024, Meta a publié Llama 3 avec des tailles de 8B et 70B paramètres. Ces modèles ont été pré-entraînés sur environ 15 billions de jetons de texte publiquement disponible, avec un affinage par instructions sur plus de 10 millions d'exemples annotés par des humains. Les benchmarks de Meta ont montré que Llama 3 70B surpassait Gemini Pro 1.5 et Claude 3 Sonnet sur de nombreuses tâches. Meta a annoncé des plans pour des capacités multilingues et multimodales, des fenêtres de contexte plus longues, et une amélioration du codage et du raisonnement.
Llama 3 a démontré que les performances continuent de s'échelonner log-linéairement même au-delà de la quantité de données d'entraînement optimale selon Chinchilla. Par exemple, l'ensemble de données optimal selon Chinchilla pour le modèle 8B était de 200 milliards de jetons, mais les performances se sont améliorées jusqu'à 15 billions de jetons. Lors d'une interview, Mark Zuckerberg a noté que le modèle 8B était presque aussi puissant que le plus grand Llama 2, et que le modèle 70B apprenait encore à la fin de l'entraînement, mais que l'entraînement a été arrêté pour allouer les ressources GPU ailleurs.
Llama 3.1 a été publié le 23 juillet 2024, avec des améliorations supplémentaires, y compris un modèle de 405B paramètres, et a poursuivi la tendance des sorties de poids ouverts.
Impact sur l'IA open-source
La fuite de Llama a catalysé le mouvement de l'IA open-source. Avant la fuite, l'accès aux LLM de pointe était largement limité à quelques organisations. La fuite a permis aux chercheurs indépendants et aux amateurs d'exécuter et d'affiner des modèles localement, conduisant à des innovations dans le élagage de modèles, l'augmentation de données et l'inférence efficace. Elle a également inspiré la création d'écosystèmes open-source, tels que les dépôts HuggingFace et des outils comme llama.cpp, qui ont permis l'inférence sur CPU.
La fuite a également poussé Meta à adopter des licences plus permissives pour les versions ultérieures, comme on l'a vu avec Llama 2 et Llama 3. Ce changement a influencé d'autres entreprises, comme Mistral AI, à publier des modèles à poids ouverts. Cependant, le débat sur ce qui constitue l'« open source » dans l'IA a continué, avec des organisations comme l'Open Source Initiative arguant que les restrictions sur l'utilisation et la redistribution violent la définition de l'open source.
Réactions et controverses
Les réactions à la fuite ont été polarisées. Les experts en sécurité ont averti d'une possible mauvaise utilisation, comme la génération d'e-mails de phishing ou de désinformation. Certains chercheurs ont célébré la démocratisation de l'IA, permettant des expériences qui seraient autrement impossibles. La fuite a également soulevé des questions sur l'éthique de la publication de modèles puissants, conduisant à des discussions sur le développement responsable de l'IA.
La réponse de Meta à la fuite a d'abord été juridique, mais l'entreprise a finalement embrassé l'ouverture. En 2024, Meta a positionné Llama comme une famille de modèles à poids ouverts de premier plan, en concurrence avec les modèles fermés d'OpenAI et de Google DeepMind. La fuite a également mis en évidence la difficulté de contrôler la distribution numérique, car une fois les poids publics, ils ne peuvent pas être entièrement retirés.
Héritage
La fuite de Llama est considérée comme un événement pivot dans l'histoire de l'IA. Elle a accéléré le développement des LLM open-source, conduisant à un écosystème diversifié de modèles et d'applications. Elle a également influencé les discussions politiques sur la réglementation de l'IA et l'équilibre entre ouverture et sécurité. En 2025, les modèles Llama sont largement utilisés dans la recherche et l'industrie, et Meta continue de publier de nouvelles versions, y compris Llama 4 en avril 2025. En avril 2026, Meta Superintelligence Labs a publié Muse Spark comme remplaçant de Llama, marquant le prochain chapitre du parcours de Meta dans l'IA.
La fuite a démontré que l'accès ouvert peut stimuler l'innovation, mais nécessite également une considération attentive des préjudices potentiels. Elle reste une étude de cas sur les défis de la gouvernance de la technologie de l'IA à l'ère numérique.