In Codice Ratio es un proyecto de investigación interdisciplinar que aplica técnicas de inteligencia artificial y aprendizaje automático a la transcripción y análisis de manuscritos medievales, particularmente aquellos custodiados en el Archivo Secreto Vaticano. El nombre del proyecto, que en latín significa 'en la proporción del código', refleja su objetivo de desarrollar métodos computacionales para leer e interpretar documentos históricos que a menudo están dañados, escritos a mano o resultan difíciles de procesar para los sistemas tradicionales de reconocimiento óptico de caracteres.
La iniciativa reúne a informáticos, historiadores y filólogos para crear procesos automatizados que conviertan imágenes escaneadas de textos antiguos en formatos digitales buscables. Al aprovechar modelos modernos de aprendizaje profundo, el proyecto busca desbloquear grandes cantidades de material archivístico previamente inaccesible, habilitando nuevos esfuerzos de investigación histórica y preservación.
Orígenes y Motivación
El proyecto surgió de la creciente necesidad de digitalizar grandes colecciones de documentos históricos manuscritos. A diferencia de los textos impresos, los manuscritos medievales presentan formas de letras irregulares, abreviaturas y degradación con el tiempo, lo que plantea desafíos significativos para el software convencional. In Codice Ratio aborda esto entrenando modelos de red neuronal con muestras anotadas de estilos de escritura específicos, permitiendo que el sistema aprenda los patrones visuales de escribas o períodos particulares.
La colaboración se centró inicialmente en el Archivo Secreto Vaticano, que contiene siglos de correspondencia papal y registros administrativos. El volumen de material - que alcanza millones de páginas - hacía impracticable la transcripción manual, motivando el desarrollo de herramientas semiautomatizadas que pudieran asistir a expertos humanos en lugar de reemplazarlos.
Enfoque Técnico
En su núcleo, In Codice Ratio emplea una combinación de preprocesamiento de imágenes, segmentación de caracteres y reconocimiento de secuencias. El proceso típicamente involucra varias etapas: primero, las páginas digitalizadas se limpian y normalizan para reducir el ruido; segundo, se detectan líneas y caracteres individuales; y tercero, un modelo basado en red neuronal recurrente o transformador transcribe la secuencia de símbolos a texto latino o italiano moderno.
Una característica distintiva es el uso de aumento de datos sintéticos. Debido a que los datos históricos etiquetados son escasos, el equipo genera ejemplos de entrenamiento artificiales renderizando fuentes modernas con degradación simulada, como sangrado de tinta, textura de pergamino y espaciado irregular. Esta estrategia de 'aumento de datos' mejora la robustez del modelo y reduce la necesidad de anotación manual extensiva.
El proyecto también incorpora aprendizaje curricular, comenzando con documentos más simples y limpios e introduciendo progresivamente material más desafiante. Este entrenamiento por etapas ayuda a que los modelos generalicen mejor a diversas variantes de escritura. Además, se utiliza decodificación búsqueda de haz durante la inferencia para producir transcripciones más coherentes al considerar múltiples secuencias de caracteres posibles.
Logros Clave y Colaboraciones
In Codice Ratio ha publicado varios estudios de prueba de concepto que demuestran alta precisión en conjuntos de prueba de manuscritos latinos medievales. El equipo ha reportado tasas de error de carácter por debajo del 5 por ciento en ciertas familias de escritura bien definidas, un resultado notable para el reconocimiento de escritura histórica. Estos hallazgos se han presentado en conferencias de humanidades digitales y en revistas revisadas por pares, contribuyendo a una literatura creciente sobre paleografía computacional.
El proyecto mantiene asociaciones activas con instituciones como la Escuela Vaticana de Paleografía y varias universidades europeas. Los investigadores involucrados incluyen informáticos especializados en visión por computador y procesamiento de lenguaje natural, así como historiadores medievales que proporcionan experiencia de dominio para la anotación y validación. La colaboración también ha explorado extensiones a otras colecciones archivísticas, incluidos documentos legales de la era moderna temprana y cartas humanistas del Renacimiento.
Impacto en las Humanidades Digitales
Al demostrar que los métodos modernos de IA pueden adaptarse a escrituras antiguas, In Codice Ratio ha influido en iniciativas más amplias de humanidades digitales. Sus técnicas para manejar entrada manuscrita ruidosa son relevantes para archivos en todo el mundo, y el proyecto ha liberado partes de sus conjuntos de datos anotados y código de modelo bajo licencias abiertas para fomentar la replicación y la investigación adicional.
Los académicos han utilizado los resultados del proyecto para apoyar estudios sobre diplomacia papal, historia económica y evolución lingüística. La capacidad de buscar y referenciar cruzadamente millones de documentos transcritos abre nuevas vías para el análisis histórico cuantitativo, un campo que aún está en sus inicios.
Estado Actual y Direcciones Futuras
A principios de la década de 2020, In Codice Ratio continúa refinando sus modelos, con trabajo en curso sobre la integración de componentes de modelo de lenguaje grande para corrección consciente del contexto y búsqueda semántica. El equipo también está investigando métodos no supervisados y débilmente supervisados para reducir aún más los costos de anotación.
Los planes futuros incluyen expandirse a otras familias de escritura, como la minúscula gótica y carolingia, y desarrollar interfaces amigables para académicos que no son especialistas técnicos. El proyecto también busca establecer estándares para evaluar sistemas de reconocimiento de escritura en contextos históricos, lo que ayudaría a comparar el progreso entre diferentes grupos de investigación.
Dado el rápido ritmo del desarrollo de IA, el proyecto está bien posicionado para incorporar avances de IA generativa y arquitecturas transformadoras, potencialmente habilitando la transcripción de extremo a extremo de documentos completos sin segmentación manual. Tales avances acelerarían significativamente la digitalización del patrimonio archivístico global.