In Codice Ratio é um projeto de pesquisa interdisciplinar que aplica técnicas de inteligência artificial e aprendizado de máquina à transcrição e análise de manuscritos medievais, particularmente aqueles mantidos nos Arquivos Secretos do Vaticano. O nome do projeto, em latim para 'na razão do código', reflete seu objetivo de desenvolver métodos computacionais para ler e interpretar documentos históricos que frequentemente estão danificados, escritos à mão ou são difíceis para sistemas tradicionais de reconhecimento óptico de caracteres processarem.
A iniciativa reúne cientistas da computação, historiadores e filólogos para criar pipelines automatizados que convertem imagens digitalizadas de textos antigos em formatos digitais pesquisáveis. Ao aproveitar modelos modernos de aprendizado profundo, o projeto visa desbloquear grandes quantidades de material arquivístico anteriormente inacessível, permitindo novas pesquisas históricas e esforços de preservação.
Origens e Motivação
O projeto surgiu da necessidade crescente de digitalizar grandes coleções de documentos históricos manuscritos. Diferentemente de textos impressos, manuscritos medievais apresentam formas de letras irregulares, abreviações e degradação ao longo do tempo, o que representa desafios significativos para software convencional. In Codice Ratio aborda isso treinando modelos de rede neural em amostras anotadas de estilos específicos de escrita, permitindo que o sistema aprenda os padrões visuais de escribas ou períodos particulares.
A colaboração inicialmente focou nos Arquivos Secretos do Vaticano, que contêm séculos de correspondência papal e registros administrativos. O volume massivo de material - chegando a milhões de páginas - tornou a transcrição manual impraticável, motivando o desenvolvimento de ferramentas semiautomatizadas que pudessem auxiliar especialistas humanos em vez de substituí-los.
Abordagem Técnica
Em seu núcleo, In Codice Ratio emprega uma combinação de pré-processamento de imagem, segmentação de caracteres e reconhecimento de sequências. O pipeline tipicamente envolve várias etapas: primeiro, páginas digitalizadas são limpas e normalizadas para reduzir ruído; segundo, linhas e caracteres individuais são detectados; e terceiro, um modelo baseado em rede neural recorrente ou Transformer (architecture) transcreve a sequência de símbolos em texto latino ou italiano moderno.
Uma característica distintiva é o uso de aumento de dados sintéticos. Como dados históricos rotulados são escassos, a equipe gera exemplos de treinamento artificiais renderizando fontes modernas com degradação simulada, como sangramento de tinta, textura de pergaminho e espaçamento irregular. Essa estratégia de 'aumento de dados' melhora a robustez do modelo e reduz a necessidade de anotação manual extensiva.
O projeto também incorpora aprendizado curricular, começando com documentos mais simples e limpos e progressivamente introduzindo material mais desafiador. Esse treinamento em etapas ajuda os modelos a generalizarem melhor para variantes diversas de escrita. Além disso, a decodificação por busca em feixe é usada durante a inferência para produzir saídas de transcrição mais coerentes, considerando múltiplas sequências possíveis de caracteres.
Principais Conquistas e Colaborações
In Codice Ratio publicou vários estudos de prova de conceito demonstrando alta precisão em conjuntos de teste de manuscritos latinos medievais. A equipe relatou taxas de erro de caractere abaixo de 5 por cento em certas famílias de escrita bem definidas, um resultado notável para reconhecimento de escrita histórica. Essas descobertas foram apresentadas em conferências de humanidades digitais e em periódicos revisados por pares, contribuindo para uma literatura crescente sobre paleografia computacional.
O projeto mantém parcerias ativas com instituições como a Escola Vaticana de Paleografia e várias universidades europeias. Os pesquisadores envolvidos incluem cientistas da computação especializados em visão computacional e processamento de linguagem natural, bem como historiadores medievais que fornecem expertise de domínio para anotação e validação. A colaboração também explorou extensões para outras coleções arquivísticas, incluindo documentos legais do início da era moderna e cartas humanistas renascentistas.
Impacto nas Humanidades Digitais
Ao demonstrar que métodos modernos de IA podem ser adaptados a escritas antigas, In Codice Ratio influenciou iniciativas mais amplas de humanidades digitais. Suas técnicas para lidar com entrada manuscrita ruidosa são relevantes para arquivos em todo o mundo, e o projeto liberou partes de seus conjuntos de dados anotados e código de modelo sob licenças abertas para incentivar replicação e pesquisa adicional.
Estudiosos usaram os resultados do projeto para apoiar estudos sobre diplomacia papal, história econômica e evolução linguística. A capacidade de pesquisar e cruzar referências de milhões de documentos transcritos abre novos caminhos para análise histórica quantitativa, um campo que ainda está em sua infância.
Status Atual e Direções Futuras
A partir do início dos anos 2020, In Codice Ratio continua refinando seus modelos, com trabalho em andamento na integração de componentes de modelo de linguagem de grande escala para correção sensível ao contexto e busca semântica. A equipe também está investigando métodos não supervisionados e fracamente supervisionados para reduzir ainda mais os custos de anotação.
Planos futuros incluem expandir para outras famílias de escrita, como minúscula gótica e carolíngia, e desenvolver interfaces amigáveis para estudiosos que não são especialistas técnicos. O projeto também visa estabelecer padrões para avaliar sistemas de reconhecimento de escrita em contextos históricos, o que ajudaria a medir o progresso entre diferentes grupos de pesquisa.
Dado o ritmo acelerado do desenvolvimento de IA, o projeto está bem posicionado para incorporar avanços de IA generativa e arquiteturas Transformer (architecture), potencialmente permitindo transcrição de ponta a ponta de documentos inteiros sem segmentação manual. Tais avanços acelerariam significativamente a digitalização do patrimônio arquivístico global.