Traduit de l'anglais

LLaMA 2 est une famille de modèles de langage de grande taille publiée par Meta AI le 18 juillet 2023, en partenariat avec Microsoft, disponible en tailles de paramètres 7B, 13B et 70B, avec des versions de base et des versions affinées pour le dialogue, notable pour sa licence d'utilisation commerciale.

LLaMA 2 est une famille de grands modèles de langage (LLM) publiée par Meta AI le 18 juillet 2023, en partenariat avec Microsoft. Elle représente la deuxième génération de la série LLaMA (Large Language Model Meta AI), succédant à la version initiale de février 2023. Les modèles ont été mis à disposition en trois tailles de paramètres - 7 milliards, 13 milliards et 70 milliards - et comprenaient à la fois des modèles de base et des versions affinées pour les applications de chat. Une différence clé par rapport à son prédécesseur résidait dans la licence : tous les modèles LLaMA 2 ont été publiés avec leurs poids et permettaient de nombreux cas d'utilisation commerciale, bien que la politique d'utilisation acceptable de la licence signifie qu'elle n'était pas considérée comme open source par l'Open Source Initiative.

La publication a marqué un changement significatif dans l'approche de Meta concernant la distribution des modèles d'IA. Alors que le premier modèle LLaMA était réservé aux chercheurs académiques au cas par cas, LLaMA 2 a été rendu accessible à un public plus large, y compris les entités commerciales. Cette décision s'inscrivait dans une tendance plus large de l'industrie vers des publications de modèles plus ouvertes, bien qu'elle ait également suscité un débat sur la définition de l'open source dans le contexte de l'IA. L'architecture du modèle est restée largement inchangée par rapport à LLaMA 1, mais les données d'entraînement ont été augmentées de 40 %, améliorant les performances sur divers benchmarks.

Contexte et contexte

Le développement de LLaMA 2 s'est produit dans un contexte de progrès rapide des grands modèles de langage. Après le succès de modèles comme GPT-3 et la popularité surprise de ChatGPT, la concurrence était intense parmi les entreprises technologiques pour produire des LLM capables. Le scientifique en chef de l'IA de Meta, Yann LeCun, avait déclaré publiquement que les grands modèles de langage étaient les mieux adaptés pour aider aux tâches d'écriture, positionnant l'approche de Meta dans le discours plus large sur les capacités de l'IA.

Le premier modèle LLaMA, annoncé le 24 février 2023, avait déjà démontré que des modèles plus petits pouvaient rivaliser avec des modèles beaucoup plus grands. La version à 13 milliards de paramètres surpassait GPT-3 (175 milliards de paramètres) sur la plupart des benchmarks NLP, tandis que le modèle à 65 milliards était compétitif avec des systèmes de pointe comme PaLM et Chinchilla. Cette efficacité était en partie due à l'entraînement sur des données publiquement disponibles et à l'utilisation de techniques avancées dans apprentissage profond et réseau neuronal.

Architecture du modèle et entraînement

L'architecture de LLaMA 2 était basée sur le cadre Transformer (architecture), qui était devenu la norme pour les grands modèles de langage. Les modèles ont été entraînés en utilisant des mécanismes attention multi-têtes et encodage positionnel, conformément à la conception de LLaMA 1. Le processus d'entraînement impliquait une augmentation de 40 % de l'ensemble de données par rapport à la première version, permettant aux modèles d'apprendre à partir d'un corpus de texte plus étendu.

Le modèle à 70 milliards de paramètres était le plus grand de la famille, conçu pour des applications haute performance, tandis que les versions à 7 et 13 milliards offraient des options plus accessibles pour les chercheurs et développeurs disposant de ressources computationnelles limitées. Tous les modèles ont été publiés à la fois comme modèles de base et versions affinées par instructions, ces dernières étant affinées pour les tâches de chat et de conversation. Cette double publication était une première pour la série LLaMA, qui avait initialement été exclusivement composée de modèles de base.

Licence et disponibilité commerciale

Une caractéristique déterminante de LLaMA 2 était son modèle de licence. Contrairement à LLaMA 1, qui était réservé aux chercheurs académiques sous une licence non commerciale, LLaMA 2 a été publié sous une licence permettant un usage commercial, sous réserve d'une politique d'utilisation acceptable. Cette politique interdisait certaines applications, telles que celles impliquant des activités illégales ou nuisibles, mais permettait une large gamme d'utilisations légitimes.

La caractérisation de LLaMA 2 comme "open source" par Meta a été contestée par l'Open Source Initiative, qui maintient la définition de l'open source. Les critiques ont soutenu que la politique d'utilisation acceptable et d'autres restrictions signifiaient que la licence ne répondait pas aux critères d'un véritable open source. Ce débat a mis en évidence les tensions persistantes dans la communauté de l'IA concernant ce qui constitue l'ouverture dans les publications de modèles.

La disponibilité commerciale de LLaMA 2 était significative pour les entreprises et les startups, leur permettant d'intégrer le modèle dans des produits sans avoir besoin de frais de licence coûteux de fournisseurs propriétaires. Cela a été perçu comme un contrepoids à la domination des modèles fermés de sociétés comme OpenAI et Anthropic.

Impact et réception

La publication de LLaMA 2 a suscité un intérêt considérable dans la communauté de l'IA. Ses performances, en particulier celles du modèle à 70 milliards, étaient compétitives avec d'autres modèles leaders de l'époque, et la licence permissive en faisait une option attrayante pour le déploiement tant en recherche qu'en commercial. La disponibilité de plusieurs tailles permettait aux utilisateurs de choisir un modèle correspondant à leurs capacités matérielles, des appareils de périphérie aux serveurs à grande échelle.

Après LLaMA 2, Meta a continué à développer la série, publiant Code Llama en août 2023 pour des tâches spécifiques au code, puis LLaMA 3 en avril 2024 avec des performances améliorées et des ensembles de données d'entraînement plus vastes. La famille LLaMA est devenue une pierre angulaire de la stratégie IA de Meta, culminant avec le développement de Meta AI, un assistant basé sur LLaMA, et la publication éventuelle de LLaMA 4 en avril 2025. En avril 2026, Meta Superintelligence Labs a introduit Muse Spark comme remplaçant de LLaMA, marquant la prochaine évolution des modèles IA de Meta.

Détails techniques et variantes

Les modèles LLaMA 2 ont été entraînés en utilisant des techniques courantes dans le développement moderne des LLM, y compris optimiseur Adam et programmes de taux d'apprentissage. Le processus d'entraînement employait également écrêtage de gradient et normalisation de couche pour stabiliser l'entraînement et améliorer la convergence. Ces méthodes étaient standard dans le domaine, reflétant l'état de l'art en apprentissage automatique à l'époque.

Code Llama, une variante spécialisée de LLaMA 2, a été affiné sur des ensembles de données spécifiques au code. Les versions à 7, 13 et 34 milliards ont été publiées le 24 août 2023, avec une version à 70 milliards suivant le 29 janvier 2024. L'entraînement impliquait 500 milliards de jetons supplémentaires de données de code, suivis de 20 milliards de jetons de données à contexte long, créant des modèles de base pour la génération générale de code. Un affinage supplémentaire sur 5 milliards de jetons de suivi d'instructions a produit les versions instruct, et un modèle distinct axé sur Python a été entraîné sur 100 milliards de jetons de code Python.

Ces développements techniques ont positionné LLaMA 2 comme une plateforme polyvalente pour diverses applications, du traitement du langage naturel au développement logiciel. La publication a également stimulé l'innovation dans l'écosystème plus large, avec des sociétés comme Amazon Web Services et Azure offrant LLaMA 2 sur leurs plateformes cloud, le rendant accessible à un plus large éventail d'utilisateurs.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:large-language-model·meta-ai·artificial-intelligence·machine-learning
Cette page a été modifiée pour la dernière fois le 12 sept. 2026 par AI Wiki Bot · Historique