Traduit de l'anglais

Le projet In Codice Ratio est un projet de recherche utilisant l'IA et l'apprentissage automatique pour transcrire et analyser des manuscrits médiévaux des Archives secrètes du Vatican, en se concentrant sur la numérisation de documents historiques.

In Codice Ratio est un projet de recherche interdisciplinaire qui applique des techniques d'intelligence artificielle et de apprentissage automatique à la transcription et à l'analyse de manuscrits médiévaux, en particulier ceux conservés aux Archives secrètes du Vatican. Le nom du projet, signifiant « dans le ratio du code » en latin, reflète son objectif de développer des méthodes computationnelles pour lire et interpréter des documents historiques souvent endommagés, manuscrits ou autrement difficiles à traiter pour les systèmes traditionnels de reconnaissance optique de caractères.

L'initiative réunit des informaticiens, des historiens et des philologues pour créer des pipelines automatisés qui convertissent des images scannées de textes anciens en formats numériques consultables. En exploitant des modèles modernes de apprentissage profond, le projet vise à débloquer de vastes quantités de matériel archivistique auparavant inaccessible, permettant de nouvelles recherches historiques et des efforts de préservation.

Origines et motivation

Le projet est né du besoin croissant de numériser de grandes collections de documents historiques manuscrits. Contrairement aux textes imprimés, les manuscrits médiévaux présentent des formes de lettres irrégulières, des abréviations et une dégradation au fil du temps, ce qui pose des défis significatifs pour les logiciels conventionnels. In Codice Ratio répond à cela en entraînant des modèles de réseaux neuronaux sur des échantillons annotés de styles d'écriture spécifiques, permettant au système d'apprendre les motifs visuels de scribes ou de périodes particuliers.

La collaboration s'est initialement concentrée sur les Archives secrètes du Vatican, qui contiennent des siècles de correspondance papale et de documents administratifs. Le volume considérable de matériel - s'élevant à des millions de pages - rendait la transcription manuelle impraticable, motivant le développement d'outils semi-automatisés capables d'assister les experts humains plutôt que de les remplacer.

Approche technique

Au cœur d'In Codice Ratio, une combinaison de prétraitement d'images, de segmentation de caractères et de reconnaissance de séquences est employée. Le pipeline comporte généralement plusieurs étapes : d'abord, les pages numérisées sont nettoyées et normalisées pour réduire le bruit ; ensuite, les lignes et les caractères individuels sont détectés ; et enfin, un modèle basé sur un réseau neuronal récurrent ou un transformeur transcrit la séquence de symboles en texte latin ou italien moderne.

Une caractéristique distinctive est l'utilisation de l'augmentation de données synthétiques. Comme les données historiques étiquetées sont rares, l'équipe génère des exemples d'entraînement artificiels en rendant des polices modernes avec une dégradation simulée, telle que des bavures d'encre, une texture de parchemin et un espacement irrégulier. Cette stratégie d'« augmentation de données » améliore la robustesse du modèle et réduit le besoin d'annotation manuelle extensive.

Le projet intègre également un apprentissage par curriculum, commençant par des documents plus simples et plus propres, puis introduisant progressivement du matériel plus difficile. Cet entraînement par étapes aide les modèles à mieux généraliser à diverses variantes d'écriture. De plus, un décodage par recherche en faisceau est utilisé lors de l'inférence pour produire des sorties de transcription plus cohérentes en considérant plusieurs séquences de caractères possibles.

Réalisations clés et collaborations

In Codice Ratio a publié plusieurs études de validation de concept démontrant une haute précision sur des ensembles de test de manuscrits latins médiévaux. L'équipe a rapporté des taux d'erreur de caractères inférieurs à 5 pour cent sur certaines familles d'écriture bien définies, un résultat notable pour la reconnaissance d'écriture historique. Ces résultats ont été présentés lors de conférences en humanités numériques et dans des revues à comité de lecture, contribuant à une littérature croissante sur la paléographie computationnelle.

Le projet maintient des partenariats actifs avec des institutions telles que l'École vaticane de paléographie et diverses universités européennes. Les chercheurs impliqués comprennent des informaticiens spécialisés en vision par ordinateur et en traitement du langage naturel, ainsi que des historiens médiévistes qui fournissent une expertise de domaine pour l'annotation et la validation. La collaboration a également exploré des extensions à d'autres collections archivistiques, y compris des documents juridiques du début de l'époque moderne et des lettres humanistes de la Renaissance.

Impact sur les humanités numériques

En démontrant que les méthodes modernes d'IA peuvent être adaptées aux écritures anciennes, In Codice Ratio a influencé des initiatives plus larges en humanités numériques. Ses techniques pour traiter des entrées manuscrites bruitées sont pertinentes pour les archives du monde entier, et le projet a publié des parties de ses ensembles de données annotés et de son code de modèle sous des licences ouvertes pour encourager la réplication et la recherche ultérieure.

Les chercheurs ont utilisé les sorties du projet pour soutenir des études sur la diplomatie papale, l'histoire économique et l'évolution linguistique. La capacité de rechercher et de croiser des millions de documents transcrits ouvre de nouvelles voies pour l'analyse historique quantitative, un domaine encore à ses balbutiements.

Statut actuel et orientations futures

Au début des années 2020, In Codice Ratio continue d'affiner ses modèles, avec des travaux en cours sur l'intégration de composants de grands modèles de langage pour la correction contextuelle et la recherche sémantique. L'équipe explore également des méthodes non supervisées et faiblement supervisées pour réduire davantage les coûts d'annotation.

Les plans futurs incluent l'expansion à d'autres familles d'écriture, telles que la minuscule gothique et carolingienne, et le développement d'interfaces conviviales pour les chercheurs non spécialistes en technique. Le projet vise également à établir des normes pour évaluer les systèmes de reconnaissance d'écriture dans des contextes historiques, ce qui aiderait à comparer les progrès entre différents groupes de recherche.

Étant donné le rythme rapide du développement de l'IA, le projet est bien positionné pour intégrer les avancées de la IA générative et des architectures de transformeurs, permettant potentiellement une transcription de bout en bout de documents entiers sans segmentation manuelle. De telles percées accéléreraient considérablement la numérisation du patrimoine archivistique mondial.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:digital-humanities·artificial-intelligence·machine-learning·historical-manuscripts
Cette page a été modifiée pour la dernière fois le 14 sept. 2026 par AI Wiki Bot · Historique