ऑप्टिकल कैरेक्टर रिकग्निशन (OCR) एक ऐसी तकनीक है जो छवियों, स्कैन किए गए दस्तावेज़ों या पाठ की तस्वीरों से पाठ निकालती है, पिक्सेल को मशीन-पठनीय और मशीन-संपादन योग्य वर्णों में परिवर्तित करती है। यह Computer vision और Natural language processing के प्रतिच्छेदन पर स्थित है, क्योंकि एक कार्यशील प्रणाली को छवि में ग्लिफ़ का पता लगाना और उन्हें खंडित करना तथा उन्हें किसी भाषा के प्रतीकों के रूप में व्याख्या करना दोनों करना होता है। OCR पैटर्न पहचान के पहले व्यावसायिक रूप से उपयोगी अनुप्रयोगों में से एक था और यह आधुनिक Deep learning युग से दशकों पहले का है।
इतिहास
प्रारंभिक OCR प्रणालियाँ 1950 और 1960 के दशक की हैं, जब डेविड शेपर्ड का "गिज़्मो" और नेत्रहीनों के लिए रे कुर्ज़वील की पठन मशीनें (1976) जैसे उपकरण मुद्रित फ़ॉन्ट पहचानने के लिए टेम्पलेट मिलान और हाथ से निर्मित विशेषताओं का उपयोग करते थे। 1980 और 1990 के दशकों के दौरान, टेसेरैक्ट जैसे OCR सॉफ़्टवेयर, जो मूल रूप से हेवलेट-पैकर्ड में विकसित हुआ और बाद में Google द्वारा ओपन-सोर्स किया गया, सांख्यिकीय क्लासिफायर और फीचर निष्कर्षण पाइपलाइनों पर निर्भर था, जो बड़े पैमाने पर Symbolic AI और शास्त्रीय मशीन लर्निंग पर आधारित था, न कि उस स्तरित प्रतिनिधित्व सीखने पर जो बाद में प्रमुख हो गया। स्वच्छ, टाइप किए गए पाठ पर सटीकता 1990 के दशक तक व्यावसायिक उपयोगिता तक पहुँच गई, लेकिन हस्तलेखन और अव्यवस्थित दृश्य अगले दो दशकों तक कठिन समस्याएँ बने रहे।
डीप लर्निंग युग
कन्वोल्यूशनल न्यूरल नेटवर्क और बाद में आवर्ती और अनुक्रम-से-अनुक्रम आर्किटेक्चर की शुरुआत ने OCR सटीकता में नाटकीय रूप से सुधार किया, विशेष रूप से हस्तलेखन और प्राकृतिक दृश्यों में एम्बेडेड पाठ, जैसे सड़क संकेत या उत्पाद लेबल के लिए। दृश्य फीचर निष्कर्षण के लिए CNN को LSTM या ध्यान-आधारित डिकोडर के साथ संयोजित करने वाले आर्किटेक्चर 2010 के दशक के मध्य तक मानक बन गए। Computer vision के अधिकांश भागों की तरह, प्रगति ने हाथ से निर्मित पाइपलाइनों से बड़े लेबल वाले डेटासेट पर प्रशिक्षित एंड-टू-एंड न्यूरल नेटवर्क की ओर व्यापक बदलाव का अनुसरण किया।
विज़न-भाषा मॉडल युग
2020 के दशक की शुरुआत से, सामान्य-उद्देश्य विज़न-भाषा मॉडल और Transformer (architecture) आर्किटेक्चर पर निर्मित मल्टीमॉडल प्रणालियों ने OCR की अधिकांश कार्यक्षमता को अवशोषित कर लिया है। जेमिनी और GPT-4 वेरिएंट सहित विज़न क्षमता वाले मॉडल, एक समर्पित OCR पाइपलाइन के बिना, एक व्यापक दृश्य समझ कार्य के भाग के रूप में छवि में एम्बेडेड पाठ पढ़ सकते हैं, और अक्सर उन दस्तावेज़ों पर विशेष OCR प्रणालियों से बेहतर प्रदर्शन करते हैं जो आरेख, तालिकाओं या संदर्भ में हस्तलेखन के साथ पाठ मिलाते हैं। इसने OCR को एक अलग कार्य के रूप में और सामान्य दस्तावेज़ समझ के बीच की सीमा को धुंधला कर दिया है, हालाँकि उद्देश्य-निर्मित OCR इंजन उच्च-थ्रूपुट, कम-विलंबता, या ऑफ़लाइन दस्तावेज़ प्रसंस्करण के लिए व्यापक उपयोग में बने हुए हैं, जहाँ एक बड़ा मल्टीमॉडल मॉडल अधिक महंगा या धीमा होगा।
अनुप्रयोग और मूल्यांकन
OCR दस्तावेज़ डिजिटलीकरण, खोज योग्य PDF निर्माण, लाइसेंस-प्लेट पहचान, रसीद और चालान प्रसंस्करण, डाक मेल छँटाई, नेत्रहीन और कम दृष्टि वाले उपयोगकर्ताओं के लिए पहुँच उपकरण, और उन इंजेशन पाइपलाइनों को रेखांकित करता है जो खोज इंजनों और बड़े भाषा मॉडल प्रशिक्षण कॉर्पोरा में पाठ फीड करती हैं। प्रणालियों का मूल्यांकन आम तौर पर स्कैन या फोटो खींचे गए पाठ के बेंचमार्क डेटासेट के विरुद्ध वर्ण त्रुटि दर और शब्द त्रुटि दर पर किया जाता है; प्रदर्शन भाषा, लिपि, मुद्रण गुणवत्ता और हस्तलेखन शैली के अनुसार व्यापक रूप से भिन्न होता है, जिसमें घसीट लेखन और कम-संसाधन लिपियाँ तुलनात्मक रूप से कमजोर बिंदु बनी रहती हैं। एक घटक कार्य के रूप में, OCR गुणवत्ता आम तौर पर सामान्य-उद्देश्य बेंचमार्क के बजाय समर्पित दस्तावेज़ और दृश्य-पाठ डेटासेट पर रिपोर्ट की जाती है।
सीमाएँ
OCR त्रुटियाँ डाउनस्ट्रीम प्रणालियों, जैसे खोज सूचकांक या स्वचालित डेटा प्रविष्टि में फैल सकती हैं, और विशेष हमले मौजूद हैं जो OCR-आधारित फ़िल्टर को धोखा देने के लिए दृश्य रूप से समान वर्णों का शोषण करते हैं। जो मल्टीमॉडल मॉडल OCR को अंतर्निहित रूप से करते हैं, वे स्रोत छवि से मेल नहीं खाता लेकिन उसके समान दिखने वाला पाठ भी भ्रमित कर सकते हैं, जो शास्त्रीय OCR की खंडन त्रुटियों से भिन्न एक विफलता मोड है।