La structuration de documents est une sous-tâche de la génération de langage naturel qui consiste à décider de l'ordre et du regroupement (par exemple en paragraphes) des phrases d'un texte généré. Elle est étroitement liée à la tâche de détermination du contenu en NLG, qui décide des informations à inclure. L'objectif est de produire un texte cohérent et bien organisé du point de vue du lecteur, plutôt qu'un simple agencement aléatoire de faits.
Par exemple, considérons quatre phrases sur une prévision de week-end : « Il pleuvra samedi », « Il fera soleil dimanche », « La température maximale sera de 10 °C samedi » et « La température maximale sera de 15 °C dimanche ». Il existe 24 (4 factoriel) ordres possibles pour ces messages. Certains ordres sont préférés par les lecteurs humains, comme regrouper les conditions météorologiques par jour (pluie et 10 °C samedi, puis soleil et 15 °C dimanche), plutôt que des séquences moins logiques. De même, pour tout ordre, il existe plusieurs façons de regrouper les phrases en paragraphes ; pour quatre phrases, il y a 8 (2 puissance 3) regroupements possibles. Les lecteurs préfèrent généralement les regroupements qui rassemblent les informations connexes, comme (12)(34) plutôt que (1)(23)(4).
Approches et algorithmes
Trois approches classiques de la structuration de documents existent : les schémas, les méthodes basées sur des corpus et les méthodes heuristiques. Les schémas sont des modèles qui spécifient explicitement l'ordre et le regroupement des phrases, généralement dérivés en analysant manuellement un corpus de textes écrits par des humains dans un genre cible. Ils fonctionnent bien pour les textes courts (cinq phrases ou moins) ou ceux ayant des structures standardisées, mais peinent avec des textes plus longs ou moins fixes.
La structuration basée sur des corpus utilise l'analyse statistique de corpus textuels pour construire automatiquement des modèles d'ordre et de regroupement. Cette technique est courante dans le résumé automatique, où les programmes génèrent des résumés de documents. En principe, elle pourrait s'appliquer à des textes générés à partir de données non linguistiques, mais ce travail reste naissant, en partie parce que les systèmes NLG sont censés produire des textes de haute qualité, ce que le résumé automatique ne fait souvent pas.
La structuration heuristique repose sur des règles dérivées de théories de la rhétorique, de modèles psycholinguistiques, ou de l'intuition et des retours des utilisateurs. Cette approche peut se concentrer sur ce qui est le mieux pour les lecteurs, contrairement aux schémas ou aux méthodes basées sur des corpus qui imitent les auteurs, mais elle est difficile à mettre en œuvre correctement car les heuristiques dépendent souvent d'informations sémantiques sur la façon dont les phrases se rapportent, qui peuvent ne pas être facilement disponibles.
Approches neuronales modernes
Les avancées récentes dans l'apprentissage profond et les grands modèles de langage ont déplacé la structuration de documents vers la génération neuronale de texte de bout en bout. Les systèmes basés sur des transformeurs et des réseaux neuronaux apprennent implicitement l'ordre et le regroupement à partir de grands corpus d'entraînement, plutôt que par des règles ou des modèles explicites. Cette approche, utilisée par des modèles d'organisations comme OpenAI, Anthropic et Google DeepMind, peut produire un texte fluide mais peut encore présenter des problèmes de cohérence et d'organisation du discours, tels que des sauts logiques ou des paragraphes mal regroupés.
Ces modèles utilisent souvent des techniques comme l'encodage positionnel et l'attention multi-têtes pour capturer les relations entre les phrases, mais la structuration de documents reste un défi car elle nécessite une cohérence globale au-delà des prédictions locales de mots. La recherche en intelligence artificielle continue d'explorer comment améliorer cela, certains travaux s'appuyant sur l'apprentissage par curriculum ou le apprentissage par renforcement avec retour d'IA pour optimiser l'organisation du texte.
Génération narrative
Le défi ultime de la structuration de documents est de générer un bon récit : un texte qui plante le décor, introduit un aperçu, décrit les événements clairement afin que les lecteurs voient comment ils se relient, et conclut par un résumé. Cela s'applique aux textes factuels ainsi qu'aux histoires. Les systèmes NLG actuels échouent souvent à cela, et c'est une source majeure de critiques des utilisateurs. Générer de bons récits est difficile dans tous les aspects de la NLG, mais la structuration de documents est sans doute l'obstacle le plus fondamental.
Évaluation et défis
L'évaluation de la structuration de documents implique généralement des jugements humains sur la cohérence et la lisibilité, car les lecteurs préfèrent certains ordres et regroupements à d'autres. Les métriques automatisées sont moins courantes car la cohérence est subjective et dépend du contexte. Les défis incluent la gestion de documents longs, l'adaptation à divers genres et la garantie que le texte généré répond aux attentes des lecteurs, surtout lorsque les données sources sont non linguistiques. Au début des années 2020, aucune approche unique ne résout complètement ces problèmes, et les méthodes hybrides combinant heuristiques et génération neuronale sont un domaine de recherche actif.