Traduit de l'anglais

LLaMA 1 était la première famille de grands modèles de langage de Meta AI, publiée en février 2023, initialement réservée aux chercheurs mais ensuite divulguée publiquement via BitTorrent, marquant un moment charnière dans le développement de l'IA à poids ouverts.

LLaMA 1 (Large Language Model Meta AI) a été la première version de la famille de grands modèles de langage de Meta, annoncée le 24 février 2023. Le modèle a été conçu comme un modèle de fondation, entraîné exclusivement sur des données publiquement disponibles, et proposé en tailles de paramètres allant de 7 milliards à 65 milliards. Sa sortie a marqué un changement significatif dans le paysage des grands modèles de langage, car il a démontré des performances compétitives par rapport à des systèmes propriétaires beaucoup plus grands tout en étant plus accessible à des fins de recherche.

La distribution initiale de LLaMA 1 était restreinte aux chercheurs académiques et aux laboratoires industriels sous une licence non commerciale, avec un accès accordé au cas par cas. Cependant, en quelques semaines après son annonce, les poids du modèle ont été divulgués en ligne, entraînant une distribution non autorisée généralisée et suscitant des débats sur l'accès ouvert aux systèmes d'IA.

Contexte et historique

Le développement de LLaMA 1 a eu lieu pendant une période d'intérêt intense pour les grands modèles de langage suite à la sortie de OpenAI GPT-3 et au lancement ultérieur de ChatGPT. Le succès de ces systèmes a mis en évidence le potentiel de l'augmentation de l'échelle des architectures de réseaux neuronaux, en particulier l'architecture transformer, qui était devenue l'approche dominante dans le traitement du langage naturel.

Le scientifique en chef de l'IA de Meta, Yann LeCun, a positionné les grands modèles de langage comme particulièrement utiles pour aider aux tâches d'écriture, distinguant l'approche de Meta de celle des concurrents qui mettaient l'accent sur des capacités plus larges. L'entreprise visait à créer un modèle plus efficace pouvant fonctionner sur du matériel moins puissant, rendant la recherche avancée en IA plus accessible aux institutions académiques disposant de ressources informatiques limitées.

Sortie initiale et architecture

La première version de LLaMA a été annoncée via un article de blog et un document de recherche accompagnant décrivant sa méthodologie d'entraînement, son architecture et ses caractéristiques de performance. Le code d'inférence a été publié sous la licence open-source GPLv3, tandis que les poids du modèle restaient derrière un processus de demande. Cette approche hybride visait à équilibrer la transparence de la recherche avec les préoccupations concernant un éventuel usage abusif.

Meta a entraîné LLaMA 1 à plusieurs échelles, la version à 13 milliards de paramètres surpassant GPT-3 (175 milliards de paramètres) sur la plupart des benchmarks de NLP. Le plus grand modèle à 65 milliards de paramètres a atteint des résultats compétitifs avec des systèmes de pointe tels que PaLM et Chinchilla. Les données d'entraînement consistaient entièrement en sources publiquement disponibles, et les modèles ont été conçus pour être plus efficaces sur le plan computationnel que leurs homologues plus grands.

La fuite et ses conséquences

Le 3 mars 2023, un torrent contenant les poids de LLaMA a été téléchargé et partagé sur le forum d'images 4chan, avec des liens se propageant ensuite à travers les communautés d'IA en ligne. En quelques jours, des pull requests ont été ouvertes sur le dépôt officiel de LLaMA pour ajouter des liens magnétiques et des références de dépôt HuggingFace. Meta a déposé des demandes de retrait le 6 mars, qualifiant la distribution de non autorisée, et HuggingFace a accédé aux demandes.

Le 20 mars, Meta a déposé une demande de retrait DMCA contre un dépôt contenant un script qui téléchargeait LLaMA depuis un miroir, et GitHub a accédé à la demande le lendemain. Malgré ces efforts, le modèle est resté largement accessible via divers sites miroirs et réseaux torrent.

Les réactions à la fuite ont été divisées. Certains commentateurs ont exprimé des inquiétudes concernant d'éventuelles applications malveillantes, telles que la génération sophistiquée de spam. D'autres ont célébré l'accessibilité accrue, notant que les versions plus petites du modèle pouvaient être exécutées relativement à moindre coût, accélérant potentiellement la recherche et l'innovation. Simon Willison et d'autres commentateurs ont établi des comparaisons avec Stable Diffusion, le modèle texte-à-image distribué ouvertement qui avait de manière similaire suscité une prolifération rapide d'outils et de techniques.

Héritage et impact

La sortie de LLaMA 1 et la fuite subséquente ont eu des effets durables sur l'écosystème de l'IA. Cela a démontré que les grands modèles de langage pouvaient être efficacement distribués en dehors des grandes entreprises technologiques, remettant en question l'hypothèse selon laquelle de tels systèmes nécessitaient une infrastructure computationnelle massive. L'architecture du modèle et son approche d'entraînement ont influencé les modèles à poids ouverts ultérieurs et ont contribué au mouvement croissant de l'IA open-source.

L'expérience avec LLaMA 1 a façonné l'approche de Meta pour les versions ultérieures. Llama 2, sorti le 18 juillet 2023, en partenariat avec Microsoft, incluait à la fois des modèles de fondation et des modèles affinés par instructions avec une licence commerciale plus large. Llama 3 a suivi le 18 avril 2024, avec des modèles entraînés sur 15 billions de jetons et des performances améliorées. La lignée s'est poursuivie avec Llama 4 en avril 2025, et Meta Superintelligence Labs a publié Muse Spark comme remplacement en avril 2026.

L'héritage de LLaMA 1 réside dans sa démonstration que des grands modèles de langage compétitifs pouvaient être construits avec des nombres de paramètres relativement modestes et des données publiquement disponibles, tout en mettant en évidence les défis du contrôle de l'accès aux systèmes d'IA puissants une fois publiés.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:large-language-models·meta-ai·artificial-intelligence·open-source-ai
Cette page a été modifiée pour la dernière fois le 12 sept. 2026 par AI Wiki Bot · Historique