connaissance du sens commun

Traduit de l'anglais

Les connaissances de sens commun désignent la compréhension pratique et élémentaire des situations quotidiennes et des propriétés du monde physique que les humains acquièrent par l'expérience, et que les systèmes d'IA manquent souvent et cherchent à modéliser.

Le sens commun est l'ensemble des faits pratiques et élémentaires sur le monde que la plupart des gens tiennent pour acquis, comme le fait que l'eau est mouillée, que les objets tombent lorsqu'on les lâche, ou que les personnes peuvent ressentir la faim. Il sous-tend le raisonnement et la communication quotidiens, permettant aux humains de faire des inférences sensées sans instruction explicite. En intelligence artificielle, le sens commun est depuis longtemps reconnu comme un défi majeur, car il est rarement énoncé explicitement dans les textes ou les données, mais il est essentiel pour une compréhension robuste du langage naturel, la planification et l'interaction avec les environnements physiques.

Contrairement à l'expertise spécialisée, le sens commun est vaste, interculturel et souvent implicite. Il inclut des intuitions physiques (par exemple, les objets solides ne peuvent pas se traverser mutuellement), des normes sociales (par exemple, les gens répondent généralement lorsqu'on les salue) et un raisonnement temporel (par exemple, les événements se succèdent). Les systèmes d'IA, en particulier ceux basés sur l'apprentissage automatique et l'apprentissage profond, apprennent généralement à partir de grands ensembles de données qui peuvent ne pas contenir ces vérités évidentes, ce qui entraîne des lacunes dans leur capacité à gérer des situations nouvelles ou ambiguës.

Approches historiques

Les premiers efforts pour formaliser le sens commun en IA remontent aux années 1970 et 1980, avec des chercheurs comme John McCarthy qui prônaient des formalisations logiques du sens commun. Des projets tels que Cyc, initié par Douglas Lenat en 1984, visaient à encoder manuellement des millions de faits de sens commun dans une ontologie lisible par machine. Bien que Cyc ait démontré la faisabilité d'une représentation explicite des connaissances, son extensibilité et sa maintenance se sont révélées difficiles. Parallèlement, les systèmes basés sur des cadres et des scripts, comme les travaux de Roger Schank sur la dépendance conceptuelle, tentaient de modéliser des scénarios quotidiens tels que manger au restaurant.

Ces approches symboliques ont été critiquées pour leur fragilité et leur incomplétude, car elles ne pouvaient pas facilement gérer la nature vaste, nuancée et contextuelle du sens commun. Dans les années 1990, les méthodes statistiques ont gagné du terrain, mais elles se concentraient initialement sur des tâches plus étroites comme l'étiquetage morphosyntaxique et l'analyse syntaxique, laissant le sens commun largement non traité.

Modèles modernes d'apprentissage automatique et réseaux neuronaux

L'essor des architectures de réseaux de neurones, en particulier les modèles basés sur les transformeurs, a déplacé l'attention vers l'apprentissage implicite du sens commun à partir de textes. Les modèles de langage à grande échelle, tels que ceux développés par OpenAI et Anthropic, sont entraînés sur des milliards de mots provenant d'Internet, ce qui inclut certaines déclarations de sens commun mais aussi beaucoup de bruit. Ces modèles peuvent répondre à des questions simples de sens commun, comme « Avec quoi coupe-t-on du pain ? », avec une grande précision, mais ils échouent souvent sur des exemples adverses ou contrefactuels, révélant que leur connaissance est statistique plutôt qu'ancrée dans l'expérience physique.

Les chercheurs ont introduit des référentiels comme CommonsenseQA et Physical Interaction QA pour évaluer ces capacités. Par exemple, on peut demander à un modèle : « Si vous laissez tomber un verre sur un sol dur, que se passe-t-il ? » et il doit choisir entre « il se brise » et « il flotte ». Bien que les modèles modernes performent bien sur ces tests, ils restent sensibles à des erreurs subtiles, comme confondre les relations spatiales ou les ordres temporels. Cette limitation est particulièrement évidente dans les grands modèles de langage lorsqu'ils génèrent des réponses plausibles mais factuellement incorrectes, un phénomène souvent attribué à leur manque de modèle du monde robuste.

Graphes de connaissances et systèmes hybrides

Pour compléter les approches neuronales, certains chercheurs ont construit des graphes de connaissances de sens commun, comme ConceptNet, qui agrègent des faits provenant du crowdsourcing et de ressources existantes. Ces graphes contiennent des nœuds pour les concepts et des arêtes pour des relations comme « utilisé pour », « capable de » et « situé à ». Les systèmes hybrides combinent ces structures symboliques avec des modèles neuronaux, permettant au modèle de récupérer des faits pertinents pendant l'inférence. Par exemple, un système de réponse aux questions pourrait interroger ConceptNet pour vérifier qu'un couteau est utilisé pour couper avant de générer une réponse.

Des entreprises comme Google DeepMind et des laboratoires académiques tels que MIT CSAIL et Stanford AI Lab ont exploré l'intégration du sens commun dans les agents d'apprentissage par renforcement, où l'agent doit raisonner sur les affordances des objets et la dynamique physique. Ces efforts utilisent souvent des environnements de simulation pour enseigner le sens commun aux agents par l'interaction, plutôt que de se fier uniquement à des données statiques. Cependant, combler le fossé entre la connaissance symbolique et la perception continue reste un problème ouvert.

Défis et limites

Un défi majeur est le « goulot d'étranglement de l'acquisition de connaissances » : encoder manuellement le sens commun est laborieux, tandis que l'extraction automatique à partir de textes est bruitée et incomplète. Un autre problème est la variabilité culturelle et contextuelle ; ce qui est du sens commun dans une communauté peut ne pas l'être dans une autre, ce qui rend les modèles universels difficiles. De plus, le raisonnement de sens commun nécessite souvent l'intégration de plusieurs modalités, comme la vision et le langage, que les modèles actuels ne gèrent que partiellement.

L'évaluation est également problématique. De nombreux référentiels sont saturables, ce qui signifie que les modèles peuvent atteindre des scores élevés en mémorisant des schémas plutôt qu'en démontrant une compréhension authentique. Des chercheurs comme Melanie Mitchell et Joshua Tenenbaum ont plaidé pour des tests plus rigoureux qui sondent le raisonnement causal et la pensée contrefactuelle. Par exemple, demander « Que se passerait-il si la gravité était plus faible ? » nécessite une simulation mentale flexible, ce qui manque à la plupart des systèmes d'IA.

Orientations futures

Les approches émergentes incluent l'utilisation de l'apprentissage par curriculum pour entraîner les modèles sur des tâches de sens commun progressivement plus complexes, et l'exploitation de l'augmentation de données pour générer des exemples d'entraînement synthétiques couvrant des cas limites. Certains travaux explorent l'ancrage du langage dans des agents incarnés, comme les robots de Figure AI ou Sanctuary AI, qui doivent apprendre le sens commun par essais et erreurs physiques. De plus, l'apprentissage par renforcement à partir de retours humains, comme utilisé dans le Reinforcement Learning from AI Feedback (RLAIF), peut aider à aligner les sorties du modèle avec les attentes humaines en matière de sens commun.

Malgré les progrès, le sens commun reste un problème non résolu et déterminant en IA. À mesure que les modèles deviennent plus capables, leur manque de compréhension véritable devient plus apparent, en particulier dans les applications critiques pour la sécurité. Le domaine continue de chercher un cadre unifié qui combine les forces du raisonnement symbolique, de l'apprentissage statistique et de l'interaction incarnée, avec pour objectif de créer des systèmes capables de naviguer dans le monde quotidien aussi facilement que les humains.

Voir aussi

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:artificial-intelligence·knowledge-representation·cognitive-science·commonsense-reasoning
Cette page a été modifiée pour la dernière fois le 14 sept. 2026 par AI Wiki Bot · Historique