문서 구조화는 생성된 텍스트에서 문장의 순서와 그룹화(예: 문단으로 묶기)를 결정하는 자연어 생성의 하위 작업입니다. 이는 포함할 정보를 결정하는 내용 결정 NLG 작업과 밀접하게 관련되어 있습니다. 목표는 단순히 사실을 무작위로 배열하는 것이 아니라 독자의 관점에서 일관되고 잘 조직된 텍스트를 생성하는 것입니다.
예를 들어, 주말 일기 예보에 관한 네 문장을 고려해 보십시오: "토요일에 비가 올 것입니다", "일요일은 맑을 것입니다", "토요일 최고 기온은 10°C입니다", "일요일 최고 기온은 15°C입니다". 이 메시지들의 가능한 순서는 24가지(4의 계승)입니다. 인간 독자는 날씨 조건을 요일별로 그룹화하는(토요일에는 비와 10°C, 그다음 일요일에는 맑음과 15°C) 순서를 덜 논리적인 순서보다 선호합니다. 마찬가지로, 어떤 순서에 대해서도 문장을 문단으로 그룹화하는 여러 방법이 있습니다. 네 문장의 경우 가능한 문단 그룹화는 8가지(2의 3승)입니다. 독자는 일반적으로 관련 정보를 묶는 그룹화, 예를 들어 (12)(34)를 (1)(23)(4)보다 선호합니다.
접근 방식 및 알고리즘
문서 구조화에는 세 가지 고전적 접근 방식이 있습니다: 스키마, 말뭉치 기반 방법, 휴리스틱 기반 방법. 스키마는 문장 순서와 그룹화를 명시적으로 지정하는 템플릿으로, 일반적으로 대상 장르의 인간 작성 텍스트 말뭉치를 수동으로 분석하여 파생됩니다. 이는 짧은 텍스트(다섯 문장 이하) 또는 표준화된 구조를 가진 텍스트에 잘 작동하지만, 더 길거나 덜 고정된 텍스트에는 어려움을 겪습니다.
말뭉치 기반 구조화는 텍스트 말뭉치의 통계적 분석을 사용하여 순서 및 그룹화 모델을 자동으로 구축합니다. 이 기술은 프로그램이 문서 요약을 생성하는 자동 요약에서 일반적입니다. 원칙적으로 비언어적 데이터에서 생성된 텍스트에도 적용될 수 있지만, 이 작업은 아직 초기 단계에 있으며, 부분적으로는 NLG 시스템이 자동 요약이 종종 제공하지 못하는 고품질 텍스트를 생성할 것으로 기대되기 때문입니다.
휴리스틱 기반 구조화는 수사학 이론, 심리언어학 모델, 또는 직관과 사용자 피드백에서 파생된 규칙에 의존합니다. 이 접근 방식은 저자를 모방하는 스키마나 말뭉치 방법과 달리 독자에게 가장 좋은 것에 초점을 맞출 수 있지만, 휴리스틱이 문장 간 관계에 대한 의미 정보에 의존하는 경우가 많아 쉽게 사용할 수 없기 때문에 구현하기 어렵습니다.
현대 신경망 접근 방식
딥러닝 및 대규모 언어 모델의 최근 발전은 문서 구조화를 종단 간 신경 텍스트 생성으로 전환했습니다. 트랜스포머 및 신경망 기반 시스템은 명시적 규칙이나 템플릿이 아닌 대규모 훈련 말뭉치에서 순서와 그룹화를 암시적으로 학습합니다. OpenAI, Anthropic, Google DeepMind와 같은 조직의 모델에서 사용되는 이 접근 방식은 유창한 텍스트를 생성할 수 있지만, 논리적 비약이나 잘못 그룹화된 문단과 같은 일관성 및 담화 조직 문제를 여전히 보일 수 있습니다.
이러한 모델은 종종 위치 인코딩 및 다중 헤드 어텐션과 같은 기술을 사용하여 문장 관계를 포착하지만, 문서 구조화는 로컬 단어 예측을 넘어서는 전역적 일관성을 요구하기 때문에 여전히 과제로 남아 있습니다. 인공지능 연구는 이를 개선하는 방법을 계속 탐구하고 있으며, 일부 작업은 커리큘럼 학습 또는 AI 피드백 기반 강화 학습을 활용하여 텍스트 구성을 최적화합니다.
내러티브 생성
궁극적인 문서 구조화 과제는 좋은 내러티브를 생성하는 것입니다: 장면을 설정하고, 개요를 소개하고, 독자가 연결 방식을 볼 수 있도록 사건을 명확히 설명하고, 요약으로 결론을 내리는 텍스트입니다. 이는 이야기뿐만 아니라 사실적 텍스트에도 적용됩니다. 현재 NLG 시스템은 종종 이에 실패하며, 이는 사용자 비판의 주요 원인입니다. 좋은 내러티브를 생성하는 것은 모든 NLG 측면에서 어렵지만, 문서 구조화는 틀림없이 가장 근본적인 장애물입니다.
평가 및 과제
문서 구조화 평가는 일반적으로 일관성과 가독성에 대한 인간 판단을 포함하며, 독자는 특정 순서와 그룹화를 다른 것보다 선호합니다. 일관성은 주관적이고 맥락에 의존적이기 때문에 자동화된 지표는 덜 일반적입니다. 과제에는 긴 문서 처리, 다양한 장르 적응, 특히 원본 데이터가 비언어적일 때 생성된 텍스트가 독자 기대를 충족하는지 보장하는 것이 포함됩니다. 2020년대 초 현재, 단일 접근 방식이 이러한 문제를 완전히 해결하지 못하며, 휴리스틱과 신경 생성을 결합한 하이브리드 방법이 활발한 연구 영역입니다.