Llama 2 est une famille de grands modèles de langage (LLM) développée par Meta AI, publiée le 18 juillet 2023, en partenariat avec Microsoft. Elle succède au modèle Llama original et comprend à la fois des modèles de fondation et des versions de chat affinées par instructions. Contrairement à son prédécesseur, Llama 2 a été rendu disponible avec des poids pour une utilisation commerciale étendue, sous réserve d'une politique d'utilisation acceptable, ce qui a considérablement influencé l'écosystème de l'IA open source.
Les modèles Llama 2 font partie du paysage plus large des grands modèles de langage, s'appuyant sur les avancées des architectures transformeur et des techniques de apprentissage profond. La publication a été perçue comme une étape majeure vers la démocratisation de l'accès à une IA puissante, offrant une alternative compétitive aux modèles propriétaires d'entreprises comme OpenAI et Google DeepMind.
Contexte
Les progrès rapides des grands modèles de langage au début des années 2020, qui ont préparé le terrain pour Llama, sont étroitement liés au succès des outils de IA générative. La publication de GPT-3 a démontré que l'augmentation de la taille des modèles pouvait produire des améliorations spectaculaires des capacités. En novembre 2022, OpenAI a lancé ChatGPT, qui a attiré une attention considérable et déclenché une vague de recherche et d'investissement en IA.
Meta AI, la branche de recherche en IA de Meta, était active dans le domaine, avec des contributions notables telles que l'architecture transformeur développée par des chercheurs de Google DeepMind et d'autres. Le scientifique en chef de l'IA de Meta, Yann LeCun, a publiquement exprimé son scepticisme quant au battage médiatique autour des grands modèles de langage, déclarant qu'ils sont mieux adaptés pour aider à des tâches d'écriture, reflétant l'accent mis par Meta sur la praticité et l'accessibilité de l'IA.
Publication initiale et fuite
La famille Llama originale (Llama 1, stylisé LLaMA) a été annoncée le 24 février 2023, via un article de blog et un article technique. Elle était disponible en tailles allant de 1 milliard à 65 milliards de paramètres, entraînée sur des données publiquement disponibles. Initialement, les poids du modèle n'étaient accessibles qu'aux chercheurs au cas par cas, sous une licence non commerciale.
Cependant, les poids ont rapidement fuité en ligne. En mars 2023, un torrent des poids a été partagé sur 4chan et s'est répandu rapidement. Meta a envoyé des demandes de retrait à HuggingFace et GitHub pour les dépôts hébergeant le modèle, mais la fuite a permis une utilisation privée et une recherche généralisées. Beaucoup ont considéré la fuite comme un tournant pour l'IA ouverte, avec des comparaisons à Stable Diffusion accélérant l'innovation.
Publication de Llama 2
Le 18 juillet 2023, en partenariat avec Microsoft, Meta a annoncé Llama 2, la prochaine génération de la famille Llama. La société a publié trois tailles de paramètres : 7 milliards, 13 milliards et 70 milliards de paramètres. Meta a également publié à la fois des modèles de fondation et des variantes affinées. Plus précisément, les affinages de chat ont été conçus pour un usage conversationnel.
Les modèles ont été entraînés sur 40 % de données en plus que le Llama original, mais l'architecture est restée largement inchangée. Les modèles Llama 2 utilisaient des blocs de réseau résiduel avec un mécanisme d'attention, bénéficiant de la normalisation de couche et d'autres innovations. L'affinage par instructions utilisait des techniques de type RLAIF - combinant l'apprentissage supervisé et le retour d'information humain.
Disponibilité commerciale et licence
L'aspect le plus notable de la publication de Llama 2 a été la décision de fournir les poids pour une utilisation gratuite, pour de nombreuses applications commerciales. Meta a publié les modèles sous une licence personnalisée qui permet l'utilisation, la reproduction et la modification à des fins commerciales et de recherche, avec certaines restrictions sur les cas d'utilisation définis par la politique.
En raison de la politique d'utilisation acceptable et d'autres conditions, de nombreux critiques ont fait valoir que Llama 2 n'était pas un véritable open source selon les normes de l'Open Source Initiative (OSI). Néanmoins, la disponibilité d'un modèle de langage puissant ouvert à un usage commercial a été une étape importante, permettant à de plus petites organisations et à des individus de s'appuyer sur la technologie sans dépendre d'API payantes.
Le partenariat avec Microsoft a été notable, car il a intégré la publication à son infrastructure Azure. Les modèles ont été rendus disponibles dans le catalogue de modèles d'IA Azure, mais ils pouvaient également être téléchargés directement, ce qui a accru l'accessibilité.
Architecture et entraînement du modèle
Llama 2 a utilisé une architecture similaire à celle de son prédécesseur, mais avec des ajustements dans la mise à l'échelle. La taille du modèle allait jusqu'à 70 milliards de paramètres, ce qui lui permettait de capturer des modèles plus complexes. L'entraînement utilisait un mélange de sources, y compris des pages Web, des livres et d'autres données publiques, avec un accent sur le filtrage de qualité.
Un aspect clé du processus d'entraînement implique l'optimisation de la perte d'entropie croisée, en utilisant des principes tels que le plan de taux d'apprentissage et l'élagage de modèle. Meta a également incorporé des techniques telles que le abandon et l'initialisation des poids pour améliorer les performances.
Les modèles 7B, 13B et 70B sont disponibles, le modèle 70B étant conçu pour fonctionner sur plusieurs GPU. Llama 2 a été évalué par rapport à des modèles contemporains tels que GPT-3 et Chinchilla, obtenant des résultats compétitifs sur diverses tâches de référence, y compris le raisonnement et le codage.
Impact sur l'écosystème de l'IA open source
La publication de Llama 2, avec un accès commercial, a considérablement accéléré la croissance de l'écosystème de l'IA open source. Elle a fourni une alternative aux modèles propriétaires, favorisant une communauté de développeurs, de chercheurs et de startups. De nombreuses entreprises, telles que AI21-Labs et Inflection AI, ont utilisé Llama 2 comme base pour leurs propres modèles.
De plus, la publication a été accompagnée d'une intégration dans des services cloud comme Amazon Web Services, Google Cloud et Oracle Cloud, rendant le déploiement accessible. De plus, les fabricants de matériel AMD, Intel et Qualcomm ont optimisé leurs puces pour exécuter Llama efficacement.
Dérivés et affinages
Les modèles Llama 2 ont été fréquemment affinés pour diverses applications. Un exemple notable est Code Llama, un affinage avec des ensembles de données de code spécialisés. Publié le 24 août 2023, initialement en versions 7B, 13B et 34B, puis une version 70B le 29 janvier 2024. Code Llama a été entraîné sur 500 milliards de jetons de données de code, en suivant le modèle de fondation. La communauté de l'IA générative a produit de nombreux autres affinages, tels que des modèles pour l'écriture créative, l'assistance juridique et les conseils médicaux.
L'accessibilité des poids du modèle a permis aux chercheurs d'appliquer des techniques comme l'élagage de modèle, la quantification et les poids, ce qui a permis à de petites entreprises d'IA et à des institutions éducatives d'étudier et d'adapter la technologie.
Réactions et critiques
Les réactions à Llama 2 ont été généralement positives, mais aussi préoccupantes. Les partisans ont salué son potentiel à démocratiser l'IA et à favoriser l'innovation, notant qu'il pouvait concurrencer des modèles commerciaux comme GPT-3.5. Cependant, certains critiques ont souligné que les restrictions de licence n'étaient toujours pas entièrement « ouvertes » selon la définition, limitant ainsi leur degré de liberté.
La politique d'utilisation acceptable restreignait les applications dans des domaines comme la surveillance, le spam et les logiciels malveillants. Cela a été débattu comme un effort pour prévenir les abus, mais a également limité la flexibilité.
Certains chercheurs ont également noté les préoccupations environnementales et de ressources liées à l'entraînement de grands modèles comme Llama 2. L'entraînement nécessitait une puissance de calcul importante, soulevant des problèmes éthiques et pratiques.
Héritage et avenir
Llama 2 a établi une nouvelle norme pour l'IA ouverte, conduisant à la publication ultérieure de Llama 3 en avril 2024. La publication a eu un effet durable sur l'industrie, poussant les grands laboratoires commerciaux à reconsidérer la manière dont les modèles pouvaient être partagés. Elle a également encouragé la croissance de la collection d'IA ouverte comme base pour d'autres produits.
L'approche de Llama 2 consistant à fournir des poids avec des restrictions a été adoptée par d'autres développeurs pour construire des assistants IA comme Meta AI, qui est maintenant basé sur Llama 3. Fin 2025, Llama est une famille de modèles, et malgré l'émergence de nouveaux modèles, Llama 2 reste une étape fondamentale.
Résumé
En résumé, l'annonce de Meta Llama 2 a été un événement significatif dans l'avancement de l'IA générative. En combinant de fortes performances avec des poids permissifs, la décision de Meta a contribué à façonner l'écosystème de l'IA ouverte. L'événement est souvent cité comme l'un des tournants qui ont attisé l'intérêt pour l'IA commerciale.
Dès sa publication, Llama 2 a marqué une rupture avec les pratiques plus restrictives d'autres modèles d'IA, et son impact a été considérable.