अंग्रेज़ी से अनुवादित

In Codice Ratio एक शोध परियोजना है जो वेटिकन गुप्त अभिलेखागार (Vatican Secret Archives) की मध्ययुगीन पांडुलिपियों को लिप्यंतरित (transcribe) और विश्लेषित करने के लिए AI और मशीन लर्निंग का उपयोग करती है, जिसमें ऐतिहासिक दस्तावेज़ डिजिटलीकरण पर ध्यान केंद्रित किया गया है।

In Codice Ratio एक अंतःविषयक शोध परियोजना है जो मध्ययुगीन पांडुलिपियों, विशेष रूप से वेटिकन गुप्त अभिलेखागार में रखी गई पांडुलिपियों के प्रतिलेखन और विश्लेषण के लिए कृत्रिम बुद्धिमत्ता और मशीन लर्निंग तकनीकों को लागू करती है। परियोजना का नाम, लैटिन में 'कोड अनुपात में', ऐतिहासिक दस्तावेजों को पढ़ने और व्याख्या करने के लिए कम्प्यूटेशनल तरीकों को विकसित करने के अपने लक्ष्य को दर्शाता है जो अक्सर क्षतिग्रस्त, हस्तलिखित, या पारंपरिक ऑप्टिकल कैरेक्टर पहचान प्रणालियों के लिए अन्यथा कठिन होते हैं।

यह पहल कंप्यूटर वैज्ञानिकों, इतिहासकारों और भाषाशास्त्रियों को एक साथ लाती है ताकि प्राचीन ग्रंथों की स्कैन की गई छवियों को खोजने योग्य डिजिटल प्रारूपों में बदलने के लिए स्वचालित पाइपलाइन बनाई जा सके। आधुनिक गहन शिक्षण मॉडल का लाभ उठाकर, परियोजना का उद्देश्य पहले से दुर्गम अभिलेखीय सामग्री की विशाल मात्रा को अनलॉक करना है, जिससे नए ऐतिहासिक शोध और संरक्षण प्रयासों को सक्षम किया जा सके।

उत्पत्ति और प्रेरणा

यह परियोजना हस्तलिखित ऐतिहासिक दस्तावेजों के बड़े संग्रह को डिजिटाइज़ करने की बढ़ती आवश्यकता से उभरी। मुद्रित ग्रंथों के विपरीत, मध्ययुगीन पांडुलिपियों में अनियमित अक्षर रूप, संक्षिप्ताक्षर और समय के साथ क्षरण होता है, जो पारंपरिक सॉफ्टवेयर के लिए महत्वपूर्ण चुनौतियां पेश करते हैं। In Codice Ratio विशिष्ट लिपि शैलियों के एनोटेटेड नमूनों पर तंत्रिका-नेटवर्क मॉडल को प्रशिक्षित करके इसे संबोधित करता है, जिससे सिस्टम विशेष लेखकों या अवधियों के दृश्य पैटर्न सीख सकता है।

सहयोग शुरू में वेटिकन गुप्त अभिलेखागार पर केंद्रित था, जिसमें सदियों के पोप पत्राचार और प्रशासनिक रिकॉर्ड शामिल हैं। सामग्री की विशाल मात्रा - लाखों पृष्ठों तक चलने वाली - ने मैन्युअल प्रतिलेखन को अव्यावहारिक बना दिया, जिससे अर्ध-स्वचालित उपकरणों के विकास को प्रेरणा मिली जो मानव विशेषज्ञों को बदलने के बजाय उनकी सहायता कर सकें।

तकनीकी दृष्टिकोण

अपने मूल में, In Codice Ratio छवि पूर्व-प्रसंस्करण, वर्ण विभाजन और अनुक्रम पहचान के संयोजन का उपयोग करता है। पाइपलाइन में आम तौर पर कई चरण शामिल होते हैं: पहले, डिजिटाइज़ किए गए पृष्ठों को शोर कम करने के लिए साफ और सामान्यीकृत किया जाता है; दूसरे, पंक्तियों और व्यक्तिगत वर्णों का पता लगाया जाता है; और तीसरे, एक आवर्तक तंत्रिका-नेटवर्क या ट्रांसफार्मर-आधारित मॉडल प्रतीकों के अनुक्रम को आधुनिक लैटिन या इतालवी पाठ में प्रतिलेखित करता है।

एक विशिष्ट विशेषता सिंथेटिक डेटा संवर्धन का उपयोग है। क्योंकि लेबल किए गए ऐतिहासिक डेटा दुर्लभ हैं, टीम स्याही रिसाव, चर्मपत्र बनावट और अनियमित रिक्ति जैसे अनुकरणीय क्षरण के साथ आधुनिक फोंट प्रस्तुत करके कृत्रिम प्रशिक्षण उदाहरण उत्पन्न करती है। यह 'डेटा-संवर्धन' रणनीति मॉडल मजबूती में सुधार करती है और व्यापक मैन्युअल एनोटेशन की आवश्यकता को कम करती है।

परियोजना पाठ्यक्रम-शिक्षण को भी शामिल करती है, जो सरल, स्वच्छ दस्तावेजों से शुरू होती है और धीरे-धीरे अधिक चुनौतीपूर्ण सामग्री पेश करती है। यह चरणबद्ध प्रशिक्षण मॉडल को विविध लिपि रूपों में बेहतर सामान्यीकरण करने में मदद करता है। इसके अतिरिक्त, अनुमान के दौरान बीम-खोज डिकोडिंग का उपयोग कई संभावित वर्ण अनुक्रमों पर विचार करके अधिक सुसंगत प्रतिलेखन आउटपुट उत्पन्न करने के लिए किया जाता है।

प्रमुख उपलब्धियां और सहयोग

In Codice Ratio ने मध्ययुगीन लैटिन पांडुलिपियों के परीक्षण सेटों पर उच्च सटीकता प्रदर्शित करने वाले कई प्रूफ-ऑफ-कॉन्सेप्ट अध्ययन प्रकाशित किए हैं। टीम ने कुछ अच्छी तरह से परिभाषित लिपि परिवारों पर 5 प्रतिशत से कम वर्ण त्रुटि दर की सूचना दी है, जो ऐतिहासिक हस्तलेखन पहचान के लिए एक उल्लेखनीय परिणाम है। ये निष्कर्ष डिजिटल मानविकी सम्मेलनों और सहकर्मी-समीक्षित स्थानों में प्रस्तुत किए गए हैं, जो कम्प्यूटेशनल पुरालेखविज्ञान पर बढ़ते साहित्य में योगदान करते हैं।

परियोजना वेटिकन स्कूल ऑफ पैलियोग्राफी और विभिन्न यूरोपीय विश्वविद्यालयों जैसे संस्थानों के साथ सक्रिय साझेदारी बनाए रखती है। शामिल शोधकर्ताओं में कंप्यूटर विजन और प्राकृतिक भाषा प्रसंस्करण में विशेषज्ञता वाले कंप्यूटर वैज्ञानिक, साथ ही मध्ययुगीन इतिहासकार शामिल हैं जो एनोटेशन और सत्यापन के लिए डोमेन विशेषज्ञता प्रदान करते हैं। सहयोग ने अन्य अभिलेखीय संग्रहों, जिनमें प्रारंभिक आधुनिक कानूनी दस्तावेज और पुनर्जागरण मानवतावादी पत्र शामिल हैं, तक विस्तार की भी खोज की है।

डिजिटल मानविकी पर प्रभाव

यह प्रदर्शित करके कि आधुनिक एआई विधियों को प्राचीन लिपियों के लिए अनुकूलित किया जा सकता है, In Codice Ratio ने व्यापक डिजिटल मानविकी पहलों को प्रभावित किया है। शोरगुल वाले, हस्तलिखित इनपुट को संभालने की इसकी तकनीकें दुनिया भर के अभिलेखागार के लिए प्रासंगिक हैं, और परियोजना ने प्रतिकृति और आगे के शोध को प्रोत्साहित करने के लिए अपने एनोटेटेड डेटासेट और मॉडल कोड के कुछ हिस्सों को खुले लाइसेंस के तहत जारी किया है।

विद्वानों ने पोप कूटनीति, आर्थिक इतिहास और भाषाई विकास पर अध्ययन का समर्थन करने के लिए परियोजना के आउटपुट का उपयोग किया है। लाखों प्रतिलेखित दस्तावेजों को खोजने और क्रॉस-रेफरेंस करने की क्षमता मात्रात्मक ऐतिहासिक विश्लेषण के लिए नए रास्ते खोलती है, एक ऐसा क्षेत्र जो अभी भी अपनी प्रारंभिक अवस्था में है।

वर्तमान स्थिति और भविष्य की दिशाएं

2020 के दशक की शुरुआत तक, In Codice Ratio अपने मॉडलों को परिष्कृत करना जारी रखता है, जिसमें संदर्भ-जागरूक सुधार और अर्थ संबंधी खोज के लिए बड़े भाषा-मॉडल घटकों को एकीकृत करने पर चल रहा काम शामिल है। टीम एनोटेशन लागत को और कम करने के लिए अनुपरवीक्षित और कमजोर पर्यवेक्षित विधियों की भी जांच कर रही है।

भविष्य की योजनाओं में गॉथिक और कैरोलिंगियन माइनसक्यूल जैसे अन्य लिपि परिवारों तक विस्तार करना और उन विद्वानों के लिए उपयोगकर्ता-अनुकूल इंटरफेस विकसित करना शामिल है जो तकनीकी विशेषज्ञ नहीं हैं। परियोजना का उद्देश्य ऐतिहासिक संदर्भों में हस्तलेखन पहचान प्रणालियों के मूल्यांकन के लिए मानक स्थापित करना भी है, जो विभिन्न शोध समूहों में प्रगति को बेंचमार्क करने में मदद करेगा।

एआई विकास की तीव्र गति को देखते हुए, परियोजना जनरेटिव-एआई और ट्रांसफार्मर आर्किटेक्चर से प्रगति को शामिल करने के लिए अच्छी स्थिति में है, जो संभावित रूप से मैन्युअल विभाजन के बिना पूरे दस्तावेजों के एंड-टू-एंड प्रतिलेखन को सक्षम कर सकती है। ऐसी सफलताएं वैश्विक अभिलेखीय विरासत के डिजिटलीकरण को काफी तेज कर देंगी।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:digital-humanities·artificial-intelligence·machine-learning·historical-manuscripts
इस पृष्ठ को अंतिम बार संपादित किया गया 14 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास