In Codice Ratioは、中世写本、特にバチカン秘密文書館に所蔵されているものの転写と分析にartificial-intelligenceおよびmachine-learningの技術を適用する学際的研究プロジェクトである。プロジェクト名はラテン語で「コード内の比率」を意味し、損傷や手書き、または従来の光学文字認識システムでは処理が困難な歴史文書を読み取り解釈するための計算手法を開発するという目標を反映している。
この取り組みは、コンピューター科学者、歴史家、文献学者を結集し、古代テキストのスキャン画像を検索可能なデジタル形式に変換する自動パイプラインを構築する。現代のdeep-learningモデルを活用することで、これまでアクセスが困難だった膨大な量のアーカイブ資料を解放し、新たな歴史研究と保存活動を可能にすることを目指している。
起源と動機
このプロジェクトは、手書きの歴史文書の大規模なコレクションをデジタル化する必要性の高まりから生まれた。印刷テキストとは異なり、中世写本は不規則な字形、略語、経年劣化を特徴とし、従来のソフトウェアにとって大きな課題となる。In Codice Ratioは、特定の書体スタイルの注釈付きサンプルでneural-networkモデルを訓練し、特定の写字生や時代の視覚的パターンをシステムに学習させることで、この問題に対処している。
この協力は当初、何世紀にもわたる教皇の書簡や行政記録を所蔵するバチカン秘密文書館に焦点を当てていた。資料の量は数百万ページに及び、手動での転写は非現実的であり、人間の専門家を置き換えるのではなく支援する半自動ツールの開発を動機付けた。
技術的アプローチ
In Codice Ratioは、その中核として、画像前処理、文字セグメンテーション、シーケンス認識の組み合わせを採用している。パイプラインは通常、いくつかの段階を含む。まず、デジタル化されたページがノイズを減らすためにクリーニングおよび正規化され、次に、行と個々の文字が検出され、最後に、recurrent-neural-networkまたはtransformerベースのモデルが記号のシーケンスを現代ラテン語またはイタリア語のテキストに転写する。
特徴的な点は、合成データ拡張の使用である。ラベル付きの歴史データが不足しているため、チームは現代のフォントをインクのにじみ、羊皮紙の質感、不規則な間隔などのシミュレートされた劣化でレンダリングして人工的な訓練例を生成する。この「データ拡張」戦略は、モデルの堅牢性を向上させ、広範な手動注釈の必要性を減らす。
プロジェクトはまた、より単純でクリーンな文書から始めて、徐々に困難な資料を導入するcurriculum-learningも組み込んでいる。この段階的な訓練は、モデルが多様な書体バリアントにうまく一般化するのに役立つ。さらに、推論中にはbeam-searchデコードを使用して、複数の可能な文字シーケンスを考慮することで、より一貫性のある転写出力を生成する。
主な成果と協力関係
In Codice Ratioは、中世ラテン語写本のテストセットで高い精度を示すいくつかの概念実証研究を発表している。チームは、特定の明確に定義された書体ファミリーで5パーセント未満の文字誤り率を報告しており、これは歴史的手書き認識にとって注目すべき結果である。これらの発見は、デジタル人文学会議や査読付きジャーナルで発表され、計算古学に関する成長する文献に貢献している。
プロジェクトは、バチカン古文書学校やさまざまなヨーロッパの大学などの機関と積極的なパートナーシップを維持している。関与する研究者には、コンピュータービジョンと自然言語処理を専門とするコンピューター科学者、および注釈と検証のための専門知識を提供する中世史家が含まれる。この協力は、近世の法的文書やルネサンス人文主義者の書簡など、他のアーカイブコレクションへの拡張も探求している。
デジタル人文学への影響
In Codice Ratioは、現代のAI手法が古代の書体に適応できることを実証することで、より広範なデジタル人文学の取り組みに影響を与えてきた。ノイズの多い手書き入力を処理するその技術は、世界中のアーカイブに関連しており、プロジェクトは、再現とさらなる研究を促進するために、注釈付きデータセットとモデルコードの一部をオープンライセンスで公開している。
学者たちは、プロジェクトの出力を使用して、教皇外交、経済史、言語進化に関する研究を支援してきた。数百万の転写文書を検索および相互参照する能力は、まだ初期段階にある定量的歴史分析の新たな道を開く。
現在の状況と将来の方向性
2020年代初頭の時点で、In Codice Ratioはモデルの改良を続けており、文脈認識の修正と意味検索のためのlarge-language-modelコンポーネントの統合に関する進行中の作業がある。チームはまた、注釈コストをさらに削減するために、教師なしおよび弱教師あり手法を調査している。
将来の計画には、ゴシック体やカロリング小文字などの他の書体ファミリーへの拡張、および技術的な専門家ではない学者向けのユーザーフレンドリーなインターフェースの開発が含まれる。プロジェクトはまた、歴史的文脈における手書き認識システムを評価するための標準を確立することを目指しており、これは異なる研究グループ間の進捗をベンチマークするのに役立つだろう。
AI開発の急速なペースを考えると、プロジェクトはgenerative-aiおよびtransformerアーキテクチャからの進歩を組み込むのに適した位置にあり、手動セグメンテーションなしで文書全体のエンドツーエンド転写を可能にする可能性がある。そのような画期的な進歩は、世界のアーカイブ遺産のデジタル化を大幅に加速するだろう。