文書構造化は、自然言語生成のサブタスクであり、生成されたテキスト内の文の順序とグループ化(例えば段落への分割)を決定することを伴う。これは、どの情報を含めるかを決定するコンテンツ決定NLGタスクと密接に関連している。目標は、単なる事実のランダムな配置ではなく、読者の視点から一貫性があり、よく整理されたテキストを生成することである。
例えば、週末の天気予報に関する4つの文を考えてみよう:「土曜日は雨が降る」「日曜日は晴れる」「土曜日の最高気温は10°C」「日曜日の最高気温は15°C」。これらのメッセージには24(4の階乗)通りの可能な順序がある。人間の読者は、天気条件を日ごとにグループ化する(土曜日に雨と10°C、次に日曜日に晴れと15°C)など、一部の順序を、より論理的でない順序よりも好む。同様に、どの順序でも、文を段落にグループ化する方法は複数あり、4つの文の場合、8(2の3乗)通りの可能な段落グループ化がある。読者は一般に、関連情報をまとめるグループ化、例えば(12)(34)を(1)(23)(4)よりも好む。
アプローチとアルゴリズム
文書構造化には3つの古典的なアプローチが存在する:スキーマ、コーパスベースの方法、およびヒューリスティックベースの方法。スキーマは、文の順序とグループ化を明示的に指定するテンプレートであり、通常、対象ジャンルの人間が書いたテキストのコーパスを手動で分析して導出される。これらは短いテキスト(5文以下)や標準化された構造を持つテキストにはうまく機能するが、より長いテキストや固定されていないテキストでは困難を伴う。
コーパスベースの構造化は、テキストコーパスの統計分析を使用して、順序とグループ化のモデルを自動的に構築する。この技術は自動要約で一般的であり、プログラムが文書の要約を生成する。原則として、非言語データから生成されたテキストにも適用できるが、この作業はまだ初期段階にあり、その理由の一部は、NLGシステムが高品質なテキストを生成することが期待される一方で、自動要約がしばしばそれを達成しないことにある。
ヒューリスティックベースの構造化は、修辞学の理論、心理言語学モデル、または直感とユーザーフィードバックから導出されたルールに依存する。このアプローチは、著者を模倣するスキーマやコーパス法とは異なり、読者にとって何が最善かに焦点を当てることができるが、ヒューリスティックは文がどのように関連するかについての意味情報に依存することが多く、それがすぐに利用可能でない場合があるため、実装が難しい。
現代のニューラルアプローチ
深層学習と大規模言語モデルの最近の進歩により、文書構造化はエンドツーエンドのニューラルテキスト生成へと移行している。トランスフォーマーとニューラルネットワークに基づくシステムは、明示的なルールやテンプレートではなく、大規模なトレーニングコーパスから順序とグループ化を暗黙的に学習する。OpenAI、Anthropic、Google DeepMindなどの組織のモデルで使用されるこのアプローチは、流暢なテキストを生成できるが、論理的な飛躍や段落のグループ化の不備など、一貫性や談話組織の問題を依然として示す可能性がある。
これらのモデルは、文の関係を捉えるために位置エンコーディングやマルチヘッドアテンションなどの技術をしばしば採用するが、文書構造化は、局所的な単語予測を超えた大域的な一貫性を必要とするため、依然として課題である。人工知能の研究はこれを改善する方法を探求し続けており、一部の研究はカリキュラム学習やAIフィードバックからの強化学習を利用してテキスト組織を最適化している。
ナラティブ生成
究極の文書構造化の課題は、良いナラティブを生成することである:場面を設定し、概要を導入し、読者がそれらのつながりを見られるようにイベントを明確に説明し、要約で結論付けるテキスト。これは事実テキストにも物語にも適用される。現在のNLGシステムはこれにしばしば失敗し、これはユーザー批判の主要な原因である。良いナラティブを生成することは、すべてのNLG側面で困難であるが、文書構造化はおそらく最も根本的なハードルである。
評価と課題
文書構造化の評価は、通常、読者が特定の順序やグループ化を他のものより好むため、一貫性と可読性の人間による判断を伴う。自動メトリクスは、一貫性が主観的で文脈依存であるため、あまり一般的ではない。課題には、長い文書の処理、多様なジャンルへの適応、およびソースデータが非言語的である場合に、生成されたテキストが読者の期待を満たすことの確保が含まれる。2020年代初頭の時点で、単一のアプローチがこれらの問題を完全に解決するものはなく、ヒューリスティックとニューラル生成を組み合わせたハイブリッド手法が活発な研究分野である。