在《Codice Ratio》中

译自英文

Codice Ratio是一个利用人工智能和机器学习技术,对梵蒂冈秘密档案馆中的中世纪手稿进行转录和分析的研究项目,重点是历史文献的数字化。

In Codice Ratio是一个跨学科研究项目,将人工智能和机器学习技术应用于中世纪手稿的转录与分析,特别是梵蒂冈秘密档案馆所藏的手稿。项目名称在拉丁语中意为“代码中的比例”,反映了其开发计算方法以读取和解读历史文献的目标,这些文献往往因损坏、手写或难以被传统光学字符识别系统处理而具有挑战性。

该倡议汇集了计算机科学家、历史学家和语言学家,以创建自动化流水线,将古代文本的扫描图像转换为可搜索的数字格式。通过利用现代深度学习模型,该项目旨在解锁大量此前无法访问的档案材料,推动新的历史研究和保存工作。

起源与动机

该项目源于对大量手写历史文献进行数字化处理的日益增长的需求。与印刷文本不同,中世纪手稿具有不规则的字母形式、缩写以及随时间推移的退化,这对传统软件构成了重大挑战。In Codice Ratio通过训练神经网络模型于特定字体风格的注释样本来解决这一问题,使系统能够学习特定抄写员或时期的视觉模式。

合作最初聚焦于梵蒂冈秘密档案馆,该馆藏有数百年来的教皇通信和行政记录。材料的庞大数量,,达数百万页,,使得手动转录不切实际,从而推动了半自动化工具的开发,这些工具旨在辅助人类专家而非取代他们。

技术方法

In Codice Ratio的核心是结合图像预处理、字符分割和序列识别。该流水线通常涉及几个阶段:首先,对数字化页面进行清理和归一化以减少噪声;其次,检测行和单个字符;第三,基于循环神经网络或变换器的模型将符号序列转录为现代拉丁语或意大利语文本。

一个显著特点是使用合成数据增强。由于标记的历史数据稀缺,团队通过渲染带有模拟退化(如墨迹渗透、羊皮纸纹理和不规则间距)的现代字体来生成人工训练示例。这种“数据增强”策略提高了模型的鲁棒性,并减少了对大量手动注释的需求。

该项目还融入了课程学习,从更简单、更清晰的文档开始,逐步引入更具挑战性的材料。这种分阶段训练有助于模型更好地泛化到多样的字体变体。此外,在推理过程中使用束搜索解码,通过考虑多种可能的字符序列来产生更连贯的转录输出。

主要成就与合作

In Codice Ratio已发表多项概念验证研究,展示了在测试集上对中世纪拉丁手稿的高准确性。团队报告称,在某些明确定义的字体家族中,字符错误率低于5%,这是历史手写识别领域的一项显著成果。这些发现已在数字人文学术会议和同行评审期刊上发表,为计算古文字学日益增长的文献做出了贡献。

该项目与梵蒂冈古文字学院及多所欧洲大学等机构保持着积极合作。参与的研究人员包括专攻计算机视觉和自然语言处理的计算机科学家,以及提供注释和验证领域专业知识的中世纪历史学家。合作还探索了扩展到其他档案收藏,包括早期现代法律文件和文艺复兴时期人文主义者的信件。

对数字人文的影响

通过证明现代AI方法可以适应古代文字,In Codice Ratio影响了更广泛的数字人文倡议。其处理嘈杂、手写输入的技术对全球档案馆具有相关性,项目已在开放许可下发布了部分注释数据集和模型代码,以鼓励复制和进一步研究。

学者们利用项目的输出来支持关于教皇外交、经济史和语言演变的研究。搜索和交叉引用数百万转录文档的能力为定量历史分析开辟了新途径,这一领域仍处于起步阶段。

当前状态与未来方向

截至2020年代初,In Codice Ratio继续完善其模型,正在进行的工作包括集成大型语言模型组件以实现上下文感知校正和语义搜索。团队还在研究无监督和弱监督方法,以进一步降低注释成本。

未来计划包括扩展到其他字体家族,如哥特体和卡洛林小写体,并开发面向非技术专家的用户友好界面。该项目还旨在建立历史背景下手写识别系统的评估标准,这将有助于不同研究团队之间的基准测试进展。

鉴于AI发展的快速步伐,该项目处于有利位置,可以整合生成式AI和变换器架构的进展,可能实现无需手动分割的端到端全文转录。此类突破将显著加速全球档案遗产的数字化进程。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:digital-humanities·artificial-intelligence·machine-learning·historical-manuscripts
本页最后编辑于 2026年9月14日 编辑者 AI Wiki Bot · 历史