Dokumentstrukturierung ist eine Teilaufgabe der natürlichen Sprachgenerierung, die sich mit der Entscheidung über die Reihenfolge und Gruppierung (zum Beispiel in Absätze) von Sätzen in einem generierten Text befasst. Sie ist eng verwandt mit der NLG-Aufgabe der Inhaltsbestimmung, die festlegt, welche Informationen einbezogen werden sollen. Das Ziel ist es, aus Sicht des Lesers einen kohärenten und gut organisierten Text zu erzeugen, anstatt lediglich eine zufällige Anordnung von Fakten.
Betrachten wir zum Beispiel vier Sätze über eine Wochenendvorhersage: „Am Samstag wird es regnen“, „Am Sonntag wird es sonnig“, „Die Höchsttemperatur beträgt am Samstag 10 °C“ und „Die Höchsttemperatur beträgt am Sonntag 15 °C“. Es gibt 24 (4 Fakultät) mögliche Anordnungen dieser Nachrichten. Einige Anordnungen werden von menschlichen Lesern bevorzugt, wie etwa das Gruppieren der Wetterbedingungen nach Tagen (Regen und 10 °C am Samstag, dann Sonne und 15 °C am Sonntag), gegenüber weniger logischen Abfolgen. Ebenso gibt es für jede Anordnung mehrere Möglichkeiten, Sätze in Absätze zu gruppieren; für vier Sätze gibt es 8 (2 hoch 3) mögliche Absatzgruppierungen. Leser bevorzugen im Allgemeinen Gruppierungen, die zusammengehörige Informationen bündeln, wie (12)(34) gegenüber (1)(23)(4).
Ansätze und Algorithmen
Es gibt drei klassische Ansätze zur Dokumentstrukturierung: Schemata, korpusbasierte Methoden und heuristikbasierte Methoden. Schemata sind Vorlagen, die die Satzreihenfolge und -gruppierung explizit festlegen und typischerweise durch manuelle Analyse eines Korpus menschlich verfasster Texte in einem Zielgenre abgeleitet werden. Sie funktionieren gut für kurze Texte (fünf Sätze oder weniger) oder solche mit standardisierten Strukturen, haben jedoch Schwierigkeiten mit längeren oder weniger festgelegten Texten.
Korpusbasierte Strukturierung verwendet statistische Analysen von Textkorpora, um automatisch Modelle für Reihenfolge und Gruppierung zu erstellen. Diese Technik ist bei der automatischen Zusammenfassung verbreitet, bei der Programme Zusammenfassungen von Dokumenten generieren. Prinzipiell könnte sie auch auf Texte angewendet werden, die aus nicht-linguistischen Daten generiert werden, aber diese Arbeit steckt noch in den Kinderschuhen, teilweise weil von NLG-Systemen erwartet wird, qualitativ hochwertige Texte zu produzieren, was automatische Zusammenfassungen oft nicht leisten.
Heuristikbasierte Strukturierung stützt sich auf Regeln, die aus Rhetoriktheorien, psycholinguistischen Modellen oder Intuition und Nutzerfeedback abgeleitet sind. Dieser Ansatz kann sich darauf konzentrieren, was für Leser am besten ist, im Gegensatz zu Schemata oder Korpusmethoden, die Autoren nachahmen, aber er ist schwer gut umzusetzen, da Heuristiken oft von semantischen Informationen darüber abhängen, wie Sätze zusammenhängen, die möglicherweise nicht ohne Weiteres verfügbar sind.
Moderne neuronale Ansätze
Jüngste Fortschritte im Deep Learning und bei großen Sprachmodellen haben die Dokumentstrukturierung hin zur end-to-end neuronalen Textgenerierung verschoben. Systeme, die auf Transformatoren und neuronalen Netzen basieren, lernen Reihenfolge und Gruppierung implizit aus großen Trainingskorpora, anstatt durch explizite Regeln oder Vorlagen. Dieser Ansatz, der von Modellen von Organisationen wie OpenAI, Anthropic und Google DeepMind verwendet wird, kann fließende Texte erzeugen, weist jedoch möglicherweise weiterhin Probleme mit Kohärenz und Diskursorganisation auf, wie etwa logische Sprünge oder schlecht gruppierte Absätze.
Diese Modelle verwenden oft Techniken wie positionale Kodierung und Multi-Head-Attention, um Satzbeziehungen zu erfassen, aber die Dokumentstrukturierung bleibt eine Herausforderung, da sie globale Kohärenz über lokale Wortvorhersagen hinaus erfordert. Die Forschung in der künstlichen Intelligenz untersucht weiterhin, wie dies verbessert werden kann, wobei einige Arbeiten auf Curriculum-Lernen oder Verstärkungslernen aus KI-Feedback zurückgreifen, um die Textorganisation zu optimieren.
Narrative Generierung
Die ultimative Herausforderung der Dokumentstrukturierung ist die Generierung einer guten Erzählung: ein Text, der die Szene setzt, einen Überblick einführt, Ereignisse klar beschreibt, sodass Leser sehen, wie sie zusammenhängen, und mit einer Zusammenfassung abschließt. Dies gilt sowohl für faktische Texte als auch für Geschichten. Aktuelle NLG-Systeme scheitern oft daran, und dies ist eine Hauptquelle für Nutzerkritik. Gute Erzählungen zu generieren ist in allen NLG-Aspekten schwierig, aber die Dokumentstrukturierung ist wohl das grundlegendste Hindernis.
Evaluierung und Herausforderungen
Die Evaluierung der Dokumentstrukturierung umfasst typischerweise menschliche Urteile über Kohärenz und Lesbarkeit, da Leser bestimmte Anordnungen und Gruppierungen gegenüber anderen bevorzugen. Automatisierte Metriken sind weniger verbreitet, da Kohärenz subjektiv und kontextabhängig ist. Zu den Herausforderungen gehören der Umgang mit langen Dokumenten, die Anpassung an verschiedene Genres und die Sicherstellung, dass generierter Text den Erwartungen der Leser entspricht, insbesondere wenn Quelldaten nicht-linguistisch sind. Stand der frühen 2020er Jahre löst kein einzelner Ansatz diese Probleme vollständig, und hybride Methoden, die Heuristiken mit neuronaler Generierung kombinieren, sind ein aktives Forschungsgebiet.