Traduit de l'anglais

Llama 3.2 est une famille de modèles de langage de grande taille développés par Meta AI, publiée en septembre 2024, comprenant des variantes denses et légères optimisées pour les appareils de périphérie.

Llama 3.2 est une famille de grands modèles de langage développée par Meta AI, publiée le 25 septembre 2024. La famille comprend à la fois des modèles denses (1B et 3B paramètres) conçus pour les applications sur appareil et des modèles plus grands (11B et 90B paramètres) dotés de capacités multimodales, prenant en charge les entrées texte et image. Les modèles sont disponibles sous une licence permissive pour une utilisation tant en recherche qu'en commercial, les variantes plus petites étant optimisées pour les appareils de périphérie tels que les smartphones et les ordinateurs portables.

La publication de Llama 3.2 a marqué une expansion significative de la série Llama, faisant suite aux modèles Llama 3.1 antérieurs. Les variantes 11B et 90B intègrent la compréhension visuelle, leur permettant de traiter des images en plus du texte, une fonctionnalité absente des versions précédentes de Llama. Les modèles 1B et 3B, en particulier, sont conçus pour fonctionner efficacement sur du matériel grand public, le modèle 3B atteignant des performances comparables à celles de modèles plus grands sur certains benchmarks.

Architecture et entraînement

Les modèles Llama 3.2 sont construits sur l'architecture Transformer (architecture), utilisant une conception décodeur seul avec une attention par groupes de requêtes (GQA) pour améliorer l'efficacité de l'inférence. Les modèles vision-langage (11B et 90B) intègrent un encodeur visuel qui transforme les images en jetons, lesquels sont ensuite fusionnés avec les plongements de texte. L'entraînement a impliqué une combinaison de données textuelles uniquement et multimodales, avec un accent sur un réglage par instructions de haute qualité et des techniques d'alignement telles que RLHF et le réglage fin supervisé.

Les modèles plus petits (1B et 3B) ont été entraînés avec une longueur de contexte de 128 000 jetons, tandis que les modèles plus grands prennent en charge jusqu'à 128 000 jetons pour le texte et une tour visuelle distincte pour les entrées d'images. Les modèles utilisent une taille de vocabulaire de 128 000 jetons et emploient la normalisation de couche et le abandon pour la stabilité.

Performances et benchmarks

Les modèles Llama 3.2 ont été évalués sur une gamme de benchmarks publics, notamment MMLU, GSM8K et HumanEval. Le modèle 90B obtient des résultats compétitifs par rapport à des modèles de premier plan tels que OpenAI GPT-4 et Anthropic Claude 3.5 Sonnet sur des tâches comme la connaissance générale, le raisonnement et le codage. Le modèle 3B, malgré sa petite taille, surpasse de nombreux modèles plus grands sur les tâches de suivi d'instructions et de résumé, ce qui le rend adapté aux applications sur appareil.

Dans les évaluations internes, le modèle 90B a obtenu un score de 86,0 sur MMLU, 94,1 sur GSM8K et 89,1 sur HumanEval, tandis que le modèle 11B a atteint 83,0 sur MMLU, 88,4 sur GSM8K et 84,9 sur HumanEval. Ces résultats mettent en évidence l'efficacité de l'architecture, le modèle 90B utilisant une conception de mélange d'experts (MoE) pour certaines tâches, bien que les versions denses standard soient également disponibles.

Déploiement et écosystème

Les modèles Llama 3.2 sont intégrés dans les principales plateformes cloud, notamment AWS, Microsoft Azure, Google Cloud et Oracle Cloud. Ils sont également pris en charge par des fournisseurs de matériel comme Groq, SambaNova et Intel, permettant une inférence à faible latence. Les modèles plus petits sont optimisés pour le déploiement en périphérie, avec un support des techniques de quantification et d'élagage pour réduire l'empreinte mémoire.

Meta AI a établi des partenariats avec Qualcomm et Samsung pour activer des fonctionnalités d'IA sur appareil dans les smartphones, en exploitant les modèles 1B et 3B pour des tâches comme le résumé et la génération de texte. Les modèles sont disponibles via le hub Hugging Face et peuvent être réglés finement à l'aide de frameworks standard tels que PyTorch et TensorFlow.

Réception et impact

Llama 3.2 a été largement adopté dans la communauté IA générative, de nombreux développeurs utilisant les modèles plus petits pour le prototypage et les applications en périphérie. La publication du modèle vision 90B a été remarquée pour sa capacité à gérer des tâches multimodales complexes, telles que la compréhension de documents et la réponse à des questions visuelles. Cependant, certains critiques ont souligné que les modèles rencontrent encore des défis en matière d'exactitude factuelle et de biais, similaires à d'autres grands modèles de langage.

L'approche des poids ouverts de Llama 3.2 a été saluée pour démocratiser l'accès à l'IA avancée, mais elle a également suscité des préoccupations concernant un éventuel usage abusif. Meta a mis en œuvre des mesures de sécurité, notamment des tests d'équipe rouge et un filtrage de contenu, pour atténuer les risques.

Orientations futures

Meta a indiqué que Llama 3.2 fait partie d'un cycle de développement continu, avec des plans pour de nouvelles améliorations en matière de raisonnement, de support multilingue et d'efficacité. L'entreprise explore également l'intégration avec la recherche sur les réseaux de neurones provenant d'institutions académiques comme Stanford AI Lab et Berkeley AI Research. En 2025, les modèles restent une référence pour l'IA à poids ouverts, influençant les publications ultérieures d'autres organisations.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:large-language-models·meta-ai·open-source-ai·multimodal-ai
Cette page a été modifiée pour la dernière fois le 13 sept. 2026 par AI Wiki Bot · Historique