In Codice Ratio ist ein interdisziplinäres Forschungsprojekt, das Techniken der künstlichen Intelligenz und des maschinellen Lernens auf die Transkription und Analyse mittelalterlicher Handschriften anwendet, insbesondere jener im Vatikanischen Geheimarchiv. Der Projektname, lateinisch für „im Code-Verhältnis", spiegelt das Ziel wider, computergestützte Methoden zur Lesung und Interpretation historischer Dokumente zu entwickeln, die oft beschädigt, handgeschrieben oder für herkömmliche Systeme zur optischen Zeichenerkennung schwer zu verarbeiten sind.
Die Initiative bringt Informatiker, Historiker und Philologen zusammen, um automatisierte Pipelines zu erstellen, die gescannte Bilder antiker Texte in durchsuchbare digitale Formate umwandeln. Durch den Einsatz moderner Deep-Learning-Modelle zielt das Projekt darauf ab, große Mengen bisher unzugänglichen Archivmaterials zu erschließen und so neue historische Forschungen und Erhaltungsmaßnahmen zu ermöglichen.
Ursprünge und Motivation
Das Projekt entstand aus dem wachsenden Bedarf, große Sammlungen handschriftlicher historischer Dokumente zu digitalisieren. Im Gegensatz zu gedruckten Texten weisen mittelalterliche Handschriften unregelmäßige Buchstabenformen, Abkürzungen und altersbedingte Schäden auf, die für herkömmliche Software erhebliche Herausforderungen darstellen. In Codice Ratio begegnet diesem Problem, indem neuronale Netzwerke an annotierten Proben bestimmter Schriftstile trainiert werden, sodass das System die visuellen Muster bestimmter Schreiber oder Epochen erlernen kann.
Die Zusammenarbeit konzentrierte sich zunächst auf das Vatikanische Geheimarchiv, das Jahrhunderte päpstlicher Korrespondenz und Verwaltungsunterlagen umfasst. Die schiere Menge des Materials - im Umfang von Millionen Seiten - machte eine manuelle Transkription unpraktikabel und motivierte die Entwicklung halbautomatischer Werkzeuge, die menschliche Experten unterstützen statt ersetzen sollten.
Technischer Ansatz
Im Kern verwendet In Codice Ratio eine Kombination aus Bildvorverarbeitung, Zeichensegmentierung und Sequenzerkennung. Die Pipeline umfasst typischerweise mehrere Stufen: Zuerst werden digitalisierte Seiten gereinigt und normalisiert, um Rauschen zu reduzieren; zweitens werden Zeilen und einzelne Zeichen erkannt; und drittens transkribiert ein Modell auf Basis eines rekurrenten neuronalen Netzwerks oder eines Transformers die Sequenz von Symbolen in modernen lateinischen oder italienischen Text.
Ein charakteristisches Merkmal ist die Verwendung synthetischer Datenaugmentierung. Da annotierte historische Daten rar sind, erzeugt das Team künstliche Trainingsbeispiele, indem moderne Schriftarten mit simulierter Alterung wie Tintenverlauf, Pergamentstruktur und unregelmäßigem Abstand gerendert werden. Diese „Datenaugmentierungs"-Strategie verbessert die Robustheit der Modelle und reduziert den Bedarf an umfangreicher manueller Annotation.
Das Projekt integriert außerdem Curriculum-Lernen, beginnend mit einfacheren, klareren Dokumenten und schrittweise anspruchsvolleres Material einführend. Dieses gestufte Training hilft Modellen, besser auf verschiedene Schriftvarianten zu verallgemeinern. Zusätzlich wird während der Inferenz Beam-Search-Dekodierung verwendet, um durch die Berücksichtigung mehrerer möglicher Zeichensequenzen kohärentere Transkriptionsausgaben zu erzeugen.
Wichtige Erfolge und Kooperationen
In Codice Ratio hat mehrere Machbarkeitsstudien veröffentlicht, die eine hohe Genauigkeit bei Testsätzen mittelalterlicher lateinischer Handschriften demonstrieren. Das Team berichtet Zeichenfehlerraten unter 5 Prozent für bestimmte klar definierte Schriftfamilien, ein bemerkenswertes Ergebnis für die Erkennung historischer Handschriften. Diese Ergebnisse wurden auf Konferenzen der Digital Humanities und in begutachteten Fachzeitschriften präsentiert und tragen zu einer wachsenden Literatur zur computergestützten Paläographie bei.
Das Projekt unterhält aktive Partnerschaften mit Institutionen wie der Vatikanischen Schule für Paläographie und verschiedenen europäischen Universitäten. Zu den beteiligten Forschern gehören Informatiker mit Schwerpunkt Computer Vision und natürlicher Sprachverarbeitung sowie mittelalterliche Historiker, die Fachwissen für Annotation und Validierung liefern. Die Zusammenarbeit hat auch Erweiterungen auf andere Archivsammlungen untersucht, darunter frühneuzeitliche Rechtsdokumente und humanistische Briefe der Renaissance.
Auswirkungen auf die Digital Humanities
Indem es demonstriert, dass moderne KI-Methoden an antike Schriften angepasst werden können, hat In Codice Ratio breitere Initiativen der Digital Humanities beeinflusst. Seine Techniken zur Verarbeitung verrauschter, handschriftlicher Eingaben sind für Archive weltweit relevant, und das Projekt hat Teile seiner annotierten Datensätze und Modellcodes unter offenen Lizenzen veröffentlicht, um Replikation und weitere Forschung zu fördern.
Wissenschaftler haben die Ergebnisse des Projekts zur Unterstützung von Studien zu päpstlicher Diplomatie, Wirtschaftsgeschichte und sprachlicher Entwicklung genutzt. Die Möglichkeit, Millionen transkribierter Dokumente zu durchsuchen und zu referenzieren, eröffnet neue Wege für quantitative historische Analysen, ein Feld, das noch in den Kinderschuhen steckt.
Aktueller Stand und zukünftige Richtungen
Seit den frühen 2020er Jahren verfeinert In Codice Ratio weiterhin seine Modelle, mit laufender Arbeit zur Integration von Large-Language-Model-Komponenten für kontextbewusste Korrektur und semantische Suche. Das Team untersucht außerdem unüberwachte und schwach überwachte Methoden, um Annotationskosten weiter zu senken.
Zukünftige Pläne umfassen die Erweiterung auf andere Schriftfamilien wie gotische und karolingische Minuskel sowie die Entwicklung benutzerfreundlicher Schnittstellen für Wissenschaftler ohne technische Spezialisierung. Das Projekt strebt auch die Etablierung von Standards zur Bewertung von Handschriftenerkennungssystemen in historischen Kontexten an, was den Fortschritt verschiedener Forschungsgruppen vergleichbar machen würde.
Angesichts des rasanten Tempos der KI-Entwicklung ist das Projekt gut positioniert, um Fortschritte aus dem Bereich generativer KI und Transformer-Architekturen zu übernehmen, möglicherweise eine End-to-End-Transkription ganzer Dokumente ohne manuelle Segmentierung zu ermöglichen. Solche Durchbrüche würden die Digitalisierung des globalen Archivkulturerbes erheblich beschleunigen.