Document AI(ドキュメントインテリジェンスとも呼ばれる)は、機械学習技術(自然言語処理など)を活用して、人間のレビューに類似した方法で文書を分析できるコンピュータモデルを開発する技術分野である。自然言語処理を通じて、コンピュータシステムは文書内容における関係性や文脈上のニュアンスを理解し、情報や洞察の抽出を容易にする。この技術は、文書自体の分類や整理も可能にする。応用範囲は、フォーム、表、レシート、請求書、税務フォーム、契約書、ローン契約書、財務報告書など、さまざまな半構造化文書の処理と解析に及ぶ。
Document AIは、人工知能の手法と文書固有のデータ構造を組み合わせる。深層学習アーキテクチャを活用して、文書のテキスト内容と空間的レイアウトの両方を処理し、単純なデータ抽出から複雑な文書理解や生成まで、幅広いタスクを可能にする。
主な特徴
Document AIでは、機械学習を利用して印刷文書とデジタル文書の両方から情報を抽出する。この技術は、さまざまな言語の画像、テキスト、文字を認識し、非構造化文書からの洞察抽出を支援する。この技術の使用は、文書分析における意思決定の速度と質を向上させることができる。データ抽出と検証の自動化は、文書分析プロセスの効率向上に貢献する。2020年代初頭以降、大規模言語モデルの統合により、Document AIは抽出を超えて、フォーム、契約書、文書要約の自動ドラフト作成などの生成タスクにも拡張されている。
データの次元とMLアーキテクチャ
データは通常、空間データと時系列データに区別される。空間データには画像、地図、グラフが含まれ、時系列データには株価や音声録音などの信号が含まれる。Document AIは、時間次元を持つテキストデータと、ビジネスレターにおける住所の位置などの空間的な他の種類のデータを組み合わせる。
歴史的には、空間データは畳み込みニューラルネットワークのようなニューラルネットワークアーキテクチャを用いて分析され、時間データはリカレントニューラルネットワークを用いて分析されていた。次元タイプに依存しないトランスフォーマーアーキテクチャの登場により、これら2つの異なるタイプの次元をより容易に組み合わせることができるようになった。Document AIはこの統合の一例であり、トランスフォーマーはトークンのシーケンスを処理すると同時に、レイアウト情報を捉える位置エンコーディングも組み込む。
例:ビジネスレターの分析
ビジネスレターには、テキスト形式の情報とともに、テキストの位置などの他の種類の情報が含まれる。例えば、典型的なレターには、本文の前に2つの住所が含まれる。最上部にあり、時には右寄せされる住所が差出人住所である。これに通常、執筆場所を伴うレターの日付が続く。その後、受取人住所が記載される。
差出人住所と受取人住所の区別は、ページ上の住所の位置のみによって伝えられる。住所の前に「差出人:」のようなテキスト表示はない。Document AIシステムは、この空間情報を学習してこれらのフィールドを正確に分類・抽出する必要があり、テキストデータとレイアウトデータの組み合わせの重要性を示している。
ベンチマーク
Document AIシステムを評価するために、いくつかの公開データセットが使用されている。FUNSD(ノイズのあるスキャン文書におけるフォーム理解)は、フォーム理解タスク用にトークンレベルとブロックレベルのラベルが付いた199の注釈付きフォームを含む。CORD(統合レシートデータセット)は、レシートからの主要情報抽出をサポートする。DocVQAは、レイアウトを考慮した視覚的質問応答のために、12,000の文書画像に対する約50,000の質問を含む。これらのベンチマークは、研究者が主要情報抽出、フォーム理解、文書ベースの質問応答などのタスクにおける異なるモデルの性能を比較するのに役立つ。
一般的な用途
Document AIシステムは、請求書やレシートの処理、データ入力の自動化、異常検知、住宅ローンの処理、ローン債権のモニタリング、信用リスク管理、偽造通貨や不正小切手などの不正検知を含む、ビジネスおよび金融ワークフローにおける文書処理と情報抽出を自動化する。また、法的・規制文書の変更評価を含む、規制順守や契約分析にも適用される。不動産分野では、Document AIは標準化された処理と分析のための文書分類と構造化情報抽出をサポートする。生成AIの採用により、Document AIシステムは自然言語プロンプトから契約書やビジネスフォームなどの構造化文書を生成・事前入力することもできる。