Le traitement linguistique profond est un cadre de traitement du langage naturel (TLN) qui s'appuie sur la linguistique théorique et descriptive. Il modélise le langage principalement à travers des théories syntaxiques et sémantiques formelles, telles que la grammaire catégorielle combinatoire (CCG), la grammaire syntagmatique guidée par les têtes (HPSG), la grammaire lexicale fonctionnelle (LFG), la grammaire d'arbres adjoints (TAG) et l'école de Prague. Contrairement aux méthodes plus superficielles, le traitement linguistique profond produit des représentations structurelles expressives qui capturent directement les dépendances à longue distance et les structures prédicat-argument sous-jacentes, visant une analyse riche en connaissances du langage.
Cette approche intensive en connaissances a historiquement exigé une puissance de calcul considérable, étant parfois jugée intraitable. Cependant, au début des années 2000, la recherche avait considérablement amélioré l'efficacité du traitement profond, et à l'ère moderne, l'efficacité n'est plus un obstacle majeur pour les applications utilisant le traitement linguistique profond.
Contraste avec le traitement linguistique superficiel
Traditionnellement, le traitement linguistique profond se concentrait sur le développement de grammaires computationnelles pour l'analyse et la génération. Ces grammaires étaient développées manuellement, maintenues et coûteuses à exécuter sur le plan computationnel. Ces dernières années, les approches d'apprentissage automatique, également connues sous le nom de traitement linguistique superficiel, ont fondamentalement modifié le TLN. La création rapide d'outils d'apprentissage automatique robustes et à large couverture nécessite beaucoup moins de travail manuel, de sorte que les méthodes profondes ont reçu moins d'attention.
Cependant, certains linguistes computationnels soutiennent que pour que les ordinateurs comprennent le langage naturel ou effectuent des inférences, une représentation syntaxique et sémantique détaillée est nécessaire. Les systèmes superficiels peuvent manquer de compréhension semblable à celle des humains. Premièrement, considérons la phrase : « Les choses seraient différentes si Microsoft était situé en Géorgie. » Un système superficiel d'extraction d'informations pourrait incorrectement déduire que le siège de Microsoft est en Géorgie, tandis que les humains comprennent, à partir du contrefactuel, que Microsoft n'y a jamais été situé. Deuxièmement, considérons : « L'Institut national de psychologie en Israël a été fondé en mai 1971 en tant que Centre israélien de psychobiologie par le professeur Joel. » Un système superficiel pourrait incorrectement déduire qu'Israël a été fondé en 1971, alors que les humains savent qu'il s'agit de l'institut. Ces exemples illustrent que le traitement superficiel fournit une analyse pauvre en connaissances par manipulation statistique de textes et de ressources annotées, tandis que le traitement profond fournit une analyse riche en connaissances grâce à des grammaires développées manuellement.
Sous-communautés et formalismes
Les linguistes computationnels profonds sont divisés en sous-communautés selon le formalisme grammatical adopté. Une collaboration majeure est l'initiative DELPH-IN, qui travaille avec la HPSG ; la conférence HPSG est son forum central. Les collaborations ParGram et ParSem se concentrent sur le développement de grammaires et de sémantiques basées sur la LFG, avec la conférence LFG comme événement central. Le groupe de recherche XTAG travaille avec la TAG, et la conférence TAG+ sert de rassemblement central. Ces groupes ne sont pas exhaustifs, car d'autres formalismes et communautés contribuent également au traitement linguistique profond.
Développements modernes et intégration
Bien que le traitement linguistique profond ait ses racines dans l'écriture manuelle de grammaires, il s'est de plus en plus intégré aux techniques d'apprentissage automatique et d'apprentissage profond. Certaines recherches combinent des représentations syntaxiques et sémantiques profondes avec des modèles de réseaux neuronaux pour améliorer la précision et la robustesse de l'analyse. Cependant, la plupart du TLN mainstream repose désormais sur des modèles de langage de grande taille construits sur l'architecture transformeur, ce qui représente un contraste frappant avec les approches profondes basées sur des grammaires. Malgré cela, le traitement linguistique profond reste précieux pour les tâches nécessitant une interprétation sémantique précise, comme l'apprentissage automatique dans des domaines spécialisés ou l'inférence en langage naturel.
Relation avec l'IA contemporaine
Dans le contexte plus large de la recherche en intelligence artificielle, le traitement linguistique profond offre une alternative symbolique et basée sur des règles aux méthodes statistiques émergentes. Des organisations comme Nokia Bell Labs et Xerox PARC ont historiquement contribué à la linguistique computationnelle. Les efforts modernes à MIT CSAIL, Stanford AI Lab et Université de Toronto explorent souvent des hybrides. Les grammaires formelles utilisées dans le traitement profond fournissent des structures interprétables, contrairement aux représentations opaques des modèles de réseaux neuronaux. Cette interprétabilité est jugée cruciale pour les tâches nécessitant une responsabilité ou un raisonnement logique.
Malgré la concurrence, le traitement linguistique profond persiste en tant que paradigme de recherche. Il a influencé le développement de ressources, y compris les arbres syntaxiques annotés et les outils d'ingénierie grammaticale, et continue d'informer la linguistique théorique. À partir des années 2020, aucune approche unique n'a pleinement remplacé le besoin de compréhension structurée et profonde du langage dans les applications avancées de TLN.
Voir aussi
- intelligence artificielle
- apprentissage automatique
- modèle de langage de grande taille
- transformeur
- séquence à séquence