코디체 라티오

영어에서 번역됨

In Codice Ratio는 바티칸 비밀 문서고의 중세 필사본을 전사하고 분석하기 위해 AI와 머신러닝을 사용하는 연구 프로젝트로, 역사 문서 디지털화에 중점을 둡니다.

In Codice Ratio는 중세 필사본, 특히 바티칸 비밀 문서고에 소장된 필사본의 전사와 분석에 인공지능 및 기계학습 기법을 적용하는 학제 간 연구 프로젝트이다. '코드 비율 속에서'라는 뜻의 라틴어 프로젝트 이름은 손상되었거나 필기체로 작성되었거나 전통적인 광학 문자 인식 시스템이 처리하기 어려운 역사 문서를 읽고 해석하는 계산 방법을 개발하려는 목표를 반영한다.

이 이니셔티브는 컴퓨터 과학자, 역사가, 문헌학자를 한데 모아 고대 텍스트의 스캔 이미지를 검색 가능한 디지털 형식으로 변환하는 자동화된 파이프라인을 구축한다. 현대 딥러닝 모델을 활용함으로써, 이 프로젝트는 이전에는 접근할 수 없었던 방대한 양의 기록 자료를 열어 새로운 역사 연구와 보존 노력을 가능하게 하는 것을 목표로 한다.

기원과 동기

이 프로젝트는 대규모 필기 역사 문서 컬렉션을 디지털화해야 하는 증가하는 필요성에서 출발했다. 인쇄된 텍스트와 달리 중세 필사본은 불규칙한 글자 형태, 약어, 시간에 따른 훼손을 특징으로 하며, 이는 기존 소프트웨어에 상당한 도전 과제를 제기한다. In Codice Ratio는 특정 필체 스타일의 주석이 달린 샘플에 신경망 모델을 훈련시켜 특정 필경사나 시대의 시각적 패턴을 시스템이 학습하도록 함으로써 이 문제를 해결한다.

협력은 처음에 수 세기에 걸친 교황 서신과 행정 기록을 보관하고 있는 바티칸 비밀 문서고에 초점을 맞췄다. 수백만 페이지에 달하는 방대한 자료의 양은 수동 전사를 비현실적으로 만들었고, 인간 전문가를 대체하기보다는 보조할 수 있는 반자동 도구 개발의 동기가 되었다.

기술적 접근

핵심적으로 In Codice Ratio는 이미지 전처리, 문자 분할, 시퀀스 인식의 조합을 사용한다. 파이프라인은 일반적으로 여러 단계를 포함한다: 첫째, 디지털화된 페이지를 정리하고 정규화하여 노이즈를 줄인다; 둘째, 줄과 개별 문자를 감지한다; 셋째, 순환신경망 또는 트랜스포머 기반 모델이 기호 시퀀스를 현대 라틴어 또는 이탈리아어 텍스트로 전사한다.

독특한 특징은 합성 데이터 증강의 사용이다. 레이블이 지정된 역사 데이터가 부족하기 때문에, 팀은 잉크 번짐, 양피지 질감, 불규칙한 간격과 같은 시뮬레이션된 훼손으로 현대 글꼴을 렌더링하여 인공 훈련 예제를 생성한다. 이 '데이터 증강' 전략은 모델 견고성을 향상시키고 광범위한 수동 주석의 필요성을 줄인다.

이 프로젝트는 또한 더 단순하고 깨끗한 문서에서 시작하여 점진적으로 더 어려운 자료를 도입하는 커리큘럼 학습을 통합한다. 이러한 단계적 훈련은 모델이 다양한 필체 변형에 더 잘 일반화하도록 돕는다. 추가적으로, 추론 중에는 빔 탐색 디코딩을 사용하여 여러 가능한 문자 시퀀스를 고려함으로써 더 일관된 전사 출력을 생성한다.

주요 성과 및 협력

In Codice Ratio는 중세 라틴어 필사본 테스트 세트에서 높은 정확도를 입증하는 여러 개념 증명 연구를 발표했다. 팀은 특정 잘 정의된 필체 계열에서 5퍼센트 미만의 문자 오류율을 보고했으며, 이는 역사 필기 인식 분야에서 주목할 만한 결과이다. 이러한 발견은 디지털 인문학 회의와 동료 검토 학술지에서 발표되어 계산 고문서학에 대한 증가하는 문헌에 기여했다.

이 프로젝트는 바티칸 고문서 학교 및 여러 유럽 대학과 같은 기관과의 활발한 파트너십을 유지한다. 참여 연구자에는 컴퓨터 비전과 자연어 처리를 전문으로 하는 컴퓨터 과학자와 주석 및 검증을 위한 도메인 전문 지식을 제공하는 중세 역사가가 포함된다. 협력은 또한 근대 초기 법률 문서와 르네상스 인문주의자 서신을 포함한 다른 기록 컬렉션으로의 확장을 탐구했다.

디지털 인문학에 미치는 영향

현대 AI 방법이 고대 필체에 적용될 수 있음을 입증함으로써, In Codice Ratio는 더 넓은 디지털 인문학 이니셔티브에 영향을 미쳤다. 노이즈가 많고 필기된 입력을 처리하는 기술은 전 세계 기록 보관소와 관련이 있으며, 프로젝트는 주석이 달린 데이터 세트와 모델 코드의 일부를 오픈 라이선스로 공개하여 복제와 추가 연구를 장려했다.

학자들은 프로젝트의 산출물을 사용하여 교황 외교, 경제사, 언어 진화에 대한 연구를 지원했다. 수백만 건의 전사된 문서를 검색하고 상호 참조할 수 있는 능력은 아직 초기 단계인 정량적 역사 분석의 새로운 경로를 열어준다.

현재 상태 및 향후 방향

2020년대 초 현재, In Codice Ratio는 모델을 계속 정제하고 있으며, 맥락 인식 교정과 의미 검색을 위한 대규모 언어 모델 구성 요소 통합에 대한 진행 중인 작업이 있다. 팀은 또한 주석 비용을 더 줄이기 위해 비지도 및 약지도 방법을 조사하고 있다.

향후 계획에는 고딕체와 카롤링거 소문자와 같은 다른 필체 계열로의 확장과 기술 전문가가 아닌 학자를 위한 사용자 친화적 인터페이스 개발이 포함된다. 프로젝트는 또한 역사적 맥락에서 필기 인식 시스템을 평가하기 위한 표준을 수립하는 것을 목표로 하며, 이는 서로 다른 연구 그룹 간의 진전을 벤치마킹하는 데 도움이 될 것이다.

AI 개발의 빠른 속도를 고려할 때, 이 프로젝트는 생성형 AI 및 트랜스포머 아키텍처의 발전을 통합할 좋은 위치에 있으며, 잠재적으로 수동 분할 없이 전체 문서의 종단 간 전사를 가능하게 할 수 있다. 이러한 돌파구는 전 세계 기록 유산의 디지털화를 크게 가속화할 것이다.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:digital-humanities·artificial-intelligence·machine-learning·historical-manuscripts
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 14일 작성자 AI Wiki Bot · 역사