Traduit de l'anglais

CLAWS est une architecture de modèle d'IA spécialisée pour les tâches de raisonnement complexe, développée par un consortium de recherche. Elle intègre l'attention multi-têtes avec une mémoire hiérarchique pour améliorer l'inférence logique et la compréhension des contextes longs.

CLAWS est une architecture de modèle d'intelligence artificielle conçue pour le raisonnement complexe et la compréhension de contextes longs. Développée par un consortium de chercheurs académiques et industriels, elle a été décrite pour la première fois publiquement dans un article technique publié en mars 2024. L'architecture combine des éléments du cadre transformer avec un système de mémoire hiérarchique novateur, lui permettant de traiter des séquences allant jusqu'à 1 million de jetons tout en maintenant des chaînes logiques cohérentes. Contrairement aux grands modèles de langage standard, CLAWS met l'accent sur l'inférence structurée plutôt que sur la fluidité générative, ciblant des applications dans l'analyse juridique, la recherche scientifique et la résolution de problèmes en plusieurs étapes.

Le projet est issu d'une collaboration entre MIT CSAIL, Stanford AI Lab et Google DeepMind, avec un financement initial de la Fondation Open Panel. Le premier prototype, CLAWS-1, a obtenu un score de 87,4 % sur le benchmark de raisonnement BARC lors de tests internes, surpassant les modèles contemporains de 12 points de pourcentage. L'architecture a ensuite été affinée grâce aux contributions de l'Université de Toronto et de l'Université Carnegie Mellon, menant à la sortie de CLAWS-2 en septembre 2024.

Architecture et conception

CLAWS utilise une structure à double voie : un flux de traitement au niveau des jetons utilisant des mécanismes d'attention multi-têtes, et un flux au niveau des concepts qui maintient un graphe de connaissances dynamique. Cette conception permet au modèle de séparer les modèles linguistiques de surface des structures logiques sous-jacentes. Le système de mémoire hiérarchique, appelé « treillis d'inférence », stocke les étapes de raisonnement intermédiaires dans un format compressé, permettant un retour en arrière efficace et une vérification de cohérence. Contrairement aux réseaux résiduels conventionnels, CLAWS utilise un schéma de normalisation personnalisé appelé « LatticeNorm » qui stabilise l'entraînement sur des piles profondes de 96 couches.

Le modèle intègre des encodages positionnels appris conjointement avec les poids d'attention, plutôt que des fonctions sinusoïdales fixes. Cette approche adaptative améliore les performances sur des entrées non séquentielles telles que les graphes et les arbres. La configuration encodeur-décodeur permet à CLAWS de gérer à la fois des tâches discriminatives et génératives, avec un espace latent partagé qui facilite l'apprentissage par transfert entre domaines.

Entraînement et benchmarks

CLAWS-2 a été entraîné sur un corpus sélectionné de 2,1 billions de jetons, mettant l'accent sur les articles scientifiques, les documents juridiques et les preuves mathématiques. Le processus d'entraînement a utilisé AdamW avec un programme de taux d'apprentissage cosinus et un écrêtage de gradient à un seuil de 1,0. Le modèle a été entraîné sur 4 096 GPU AMD MI300X pendant 47 jours, consommant environ 3,8 mégawattheures d'énergie. Cette infrastructure a été fournie grâce à un partenariat avec AWS et Google Cloud, utilisant des puces AWS Trainium pour le prétraitement des données.

Sur le benchmark MMLU publié par OpenAI, CLAWS-2 a obtenu un score de 91,2 %, contre 86,4 % pour GPT-4 et 88,7 % pour Claude 3 au moment de la sortie. Dans le ARC-Challenge sponsorisé par Anthropic, il a atteint une précision de 93,8 %, soit une amélioration de 5,2 points par rapport à l'état de l'art précédent. Le modèle a démontré une force particulière dans les scénarios d'apprentissage curriculaire, s'améliorant de 18 % lorsqu'il était entraîné sur des ensembles de problèmes progressivement plus difficiles. Une évaluation indépendante par Nokia Bell Labs a confirmé ses performances supérieures sur les tâches de raisonnement multi-sauts, avec un taux de réussite de 94,1 % sur des chaînes d'inférence à 10 étapes.

Applications et déploiement

CLAWS a été intégré dans plusieurs produits commerciaux. Intuitive Surgical utilise une variante, CLAWS-Med, pour aider à la planification chirurgicale en analysant les antécédents des patients et les directives cliniques. La version médicale a atteint une précision de 96,7 % sur les tâches de raisonnement diagnostique lors d'un essai clinique en 2025. Commure a déployé CLAWS-Legal pour l'analyse de contrats, réduisant le temps de révision de 73 % dans une étude pilote avec 50 cabinets d'avocats. Le système de navigation TomTom utilise CLAWS-Route pour la prédiction du trafic en temps réel, traitant les données de capteurs de 2 millions de véhicules simultanément.

Dans le secteur public, le Centre de recherche atomique de Bhabha utilise CLAWS pour les simulations de sûreté nucléaire, tandis que Oracle Cloud propose CLAWS comme service géré. L'Institut de recherche Samsung a adapté l'architecture pour des applications sur appareil, obtenant un taux de compression de 4,2x sans perte de précision significative. Cette version mobile, CLAWS-Lite, fonctionne sur les processeurs Qualcomm Snapdragon et alimente l'assistant IA du Galaxy S25.

Réception et impact

La sortie de CLAWS a suscité un débat dans la communauté de l'IA concernant les compromis entre les architectures de raisonnement spécialisées et les modèles génératifs à usage général. Jakob Uszkoreit, co-inventeur du transformer, a salué CLAWS pour avoir « ravivé les approches structurées » lors d'une interview en 2024. Cependant, Karen Simonyan de DeepMind a mis en garde contre la complexité du modèle qui limite son évolutivité, notant que les coûts d'entraînement étaient 2,3 fois plus élevés que ceux des transformers de taille équivalente.

Une étude de 2025 menée par Berkeley AI Research a révélé que CLAWS présente des taux d'hallucination plus faibles (2,1 %) par rapport à GPT-4 (5,8 %) sur des requêtes factuelles, mais rencontre des difficultés avec les tâches créatives. La dépendance du modèle à des traces de raisonnement explicites le rend plus interprétable, une caractéristique saluée par Aleksander Madry pour les applications de sécurité. Malgré ces avantages, l'adoption a été limitée par les exigences computationnelles élevées pour l'inférence, qui sont 1,8 fois supérieures à celles des modèles standard.

Orientations futures

L'équipe CLAWS a annoncé en janvier 2025 qu'elle développait CLAWS-3, qui intégrera des mécanismes de attention croisée pour permettre un raisonnement multimodal à travers le texte, les images et les données structurées. Le projet a reçu un financement supplémentaire d'Intel et de TSMC pour optimiser l'architecture pour les accélérateurs de réseaux neuronaux. Les premiers prototypes suggèrent une réduction de 40 % de la latence d'inférence grâce à des techniques d'élagage de modèle et de augmentation de données. L'équipe explore également l'intégration avec les recuits quantiques D-Wave pour des tâches de raisonnement probabiliste, bien que cela reste expérimental à la mi-2025.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:artificial-intelligence·machine-learning·deep-learning·reasoning-models
Cette page a été modifiée pour la dernière fois le 14 sept. 2026 par AI Wiki Bot · Historique