कंटेंट-आधारित छवि पुनर्प्राप्ति (CBIR), जिसे छवि सामग्री द्वारा क्वेरी (QBIC) और कंटेंट-आधारित दृश्य सूचना पुनर्प्राप्ति (CBVIR) के रूप में भी जाना जाता है, छवि पुनर्प्राप्ति समस्या में Computer vision तकनीकों का अनुप्रयोग है: बड़े डेटाबेस में डिजिटल छवियों की खोज करने का कार्य। CBIR की परिभाषित विशेषता यह है कि खोज छवि की सामग्री का विश्लेषण करती है, जैसे कि रंग, आकार, बनावट, या अन्य व्युत्पन्न जानकारी, न कि कीवर्ड, टैग, या विवरण जैसे मेटाडेटा का। यह दृष्टिकोण सीधे पारंपरिक अवधारणा-आधारित विधियों का विरोध करता है, जो मानव एनोटेशन की गुणवत्ता और पूर्णता पर निर्भर करते हैं, एक निर्भरता जो बहुत बड़े या स्वचालित रूप से उत्पन्न छवि संग्रहों के लिए समस्याग्रस्त हो जाती है।
CBIR सिस्टम सांख्यिकी, पैटर्न पहचान, सिग्नल प्रोसेसिंग, और Computer vision जैसे क्षेत्रों से कम्प्यूटेशनल विधियों का उपयोग करते हैं। यह क्षेत्र 1990 के दशक की शुरुआत में अपनी उत्पत्ति के बाद से महत्वपूर्ण रूप से विकसित हुआ है, जो डिजिटल छवि भंडारों की वृद्धि और बड़े पैमाने पर मैनुअल एनोटेशन की अव्यवहारिकता से प्रेरित है। जबकि प्रारंभिक सिस्टम बुनियादी दृश्य विशेषता निष्कर्षण पर निर्भर थे, आधुनिक कार्यान्वयन तेजी से Machine learning और Deep learning तकनीकों का लाभ उठा रहे हैं ताकि पुनर्प्राप्ति सटीकता में सुधार हो और अधिक जटिल क्वेरी को संभाला जा सके।
ऐतिहासिक विकास
"कंटेंट-आधारित छवि पुनर्प्राप्ति" शब्द का पहली बार 1992 में जापानी इलेक्ट्रोटेक्निकल लेबोरेटरी के इंजीनियर तोशिकाज़ु काटो द्वारा उपयोग किया गया था, जिन्होंने रंगों और आकारों के आधार पर डेटाबेस से छवियों को स्वचालित रूप से पुनर्प्राप्त करने के प्रयोगों का वर्णन किया था। इसने पिछले दृष्टिकोणों से एक बदलाव को चिह्नित किया जो केवल पाठ्य विवरणों पर निर्भर थे। सबसे पहला वाणिज्यिक CBIR सिस्टम IBM द्वारा विकसित किया गया था और इसे QBIC (क्वेरी बाय इमेज कंटेंट) कहा जाता था। जबकि एकल इकाई के हिस्से के रूप में कई छवियों का भंडारण BLOB (बाइनरी लार्ज ऑब्जेक्ट) शब्द से पहले का था, विवरण के बजाय पूरी तरह से सामग्री द्वारा खोज करने की क्षमता को IBM के QBIC सिस्टम की प्रतीक्षा करनी पड़ी। बाद के विकासों में नेटवर्क- और ग्राफ़-आधारित दृष्टिकोण शामिल थे जो मौजूदा विधियों के सरल और आकर्षक विकल्प प्रदान करते थे।
मेटाडेटा-आधारित खोज के साथ तुलना
पारंपरिक छवि खोज के लिए मनुष्यों को डेटाबेस में छवियों को कीवर्ड या मेटाडेटा के साथ मैन्युअल रूप से एनोटेट करने की आवश्यकता होती है, एक समय लेने वाली प्रक्रिया जो किसी छवि का प्रभावी ढंग से वर्णन करने के लिए वांछित मानदंडों को पकड़ नहीं सकती है। कीवर्ड-आधारित खोज प्रभावशीलता का मूल्यांकन व्यक्तिपरक है और इसे अच्छी तरह से परिभाषित नहीं किया गया है, और CBIR सिस्टम को सफलता को परिभाषित करने में समान चुनौतियों का सामना करना पड़ता है। कीवर्ड क्वेरी के दायरे को पूर्व निर्धारित मानदंडों के सेट तक सीमित करते हैं, और ऐसे एनोटेशन वास्तविक छवि सामग्री का विश्लेषण करने की तुलना में कम विश्वसनीय होते हैं। CBIR विशेष रूप से बहुत बड़े डेटाबेस या स्वचालित रूप से उत्पन्न छवियों के लिए मूल्यवान हो जाता है, जैसे कि निगरानी कैमरों से, जहां मैनुअल एनोटेशन अव्यवहारिक है। छवियों को शब्दार्थ वर्गों में वर्गीकृत करने वाले सिस्टम (उदाहरण के लिए, "जानवर" के उपवर्ग के रूप में "बिल्ली") गलत वर्गीकरण मुद्दों को कम कर सकते हैं लेकिन उन छवियों को खोजने के लिए अधिक उपयोगकर्ता प्रयास की आवश्यकता होती है जो केवल व्यापक श्रेणी से संबंधित हो सकती हैं।
क्वेरी तकनीकें
CBIR सिस्टम विभिन्न क्वेरी विधियों का समर्थन करते हैं, जो विभिन्न उपयोगकर्ता आवश्यकताओं के अनुरूप होती हैं। सबसे आम है क्वेरी बाय एग्ज़ाम्पल (QBE), जहां उपयोगकर्ता एक उदाहरण छवि प्रदान करता है, या तो पहले से मौजूद छवि प्रदान करके, यादृच्छिक सेट से एक चुनकर, या रंग ब्लॉब्स या सामान्य आकृतियों का उपयोग करके एक मोटा अनुमान बनाकर। परिणामों में प्रदान किए गए उदाहरण के साथ सामान्य तत्व साझा होने चाहिए, और यह तकनीक शब्दों में छवियों का वर्णन करने से जुड़ी कठिनाइयों को दूर करती है।
शब्दार्थ पुनर्प्राप्ति "अब्राहम लिंकन की तस्वीरें खोजें" जैसे अनुरोधों से शुरू होती है, जो कंप्यूटर के लिए चुनौतीपूर्ण है क्योंकि विषय हमेशा एक ही मुद्रा या अभिविन्यास में प्रकट नहीं हो सकता है। इसलिए, कई CBIR सिस्टम बनावट, रंग और आकार जैसी निम्न-स्तरीय विशेषताओं पर निर्भर करते हैं, या तो मानदंडों के आसान इनपुट की अनुमति देने वाले इंटरफेस के साथ संयुक्त या चेहरे, फिंगरप्रिंट, या आकृतियों जैसी विशिष्ट विशेषताओं से मेल खाने के लिए पूर्व-प्रशिक्षित डेटाबेस के साथ। सामान्य तौर पर, उच्च-स्तरीय अवधारणाओं की छवि पुनर्प्राप्ति के लिए मानव प्रतिक्रिया की आवश्यकता होती है।
अन्य क्वेरी विधियों में उदाहरण छवियों के लिए ब्राउज़िंग, अनुकूलित या पदानुक्रमित श्रेणियों में नेविगेट करना, पूरी छवि के बजाय छवि क्षेत्र द्वारा क्वेरी करना, कई उदाहरण छवियों द्वारा क्वेरी करना, दृश्य स्केच द्वारा क्वेरी करना, छवि विशेषताओं का प्रत्यक्ष विनिर्देशन, और स्पर्श, आवाज, और अन्य इनपुट को संयोजित करने वाली मल्टीमॉडल क्वेरी शामिल हैं।
प्रासंगिकता प्रतिक्रिया और मशीन लर्निंग
CBIR सफलता का एक महत्वपूर्ण पहलू उपयोगकर्ता के इरादे को समझना है। प्रासंगिकता प्रतिक्रिया उपयोगकर्ताओं को क्वेरी के लिए छवियों को "प्रासंगिक," "अप्रासंगिक," या "तटस्थ" के रूप में चिह्नित करके खोज परिणामों को धीरे-धीरे परिष्कृत करने की अनुमति देती है, जिसके बाद सिस्टम इस नई जानकारी को शामिल करते हुए खोज को दोहराता है। यह इंटरैक्टिव दृष्टिकोण, अन्य मानव-केंद्रित डिज़ाइन तत्वों के साथ, CBIR विकास में एक प्रमुख फोकस बन गया है। इस क्षेत्र में पुनर्प्राप्ति प्रदर्शन में सुधार के लिए Machine learning और पुनरावृत्त तकनीकों का बढ़ता उपयोग भी देखा गया है। प्रारंभिक CBIR सिस्टम रंग, बनावट और आकार गुणों के आधार पर डेटाबेस खोजते थे; इन सिस्टमों के विकसित होने के बाद, उपयोगकर्ता-अनुकूल इंटरफेस की आवश्यकता स्पष्ट हो गई, जिससे वर्णनात्मक शब्दार्थ का समर्थन करने वाली क्वेरी विधियों, उपयोगकर्ता प्रतिक्रिया, और उपयोगकर्ता संतुष्टि स्तरों को समझने में सक्षम सिस्टम सहित प्रयास हुए।
तकनीकी प्रगति और चुनौतियाँ
CBIR में रुचि मेटाडेटा-आधारित सिस्टम की सीमाओं और कुशल छवि पुनर्प्राप्ति के लिए संभावित अनुप्रयोगों की विस्तृत श्रृंखला के कारण बढ़ी है। पाठ्य जानकारी मौजूदा तकनीक के साथ आसानी से खोजने योग्य है, लेकिन बहुत बड़े या स्वचालित रूप से उत्पन्न संग्रहों के लिए हर छवि का मैनुअल विवरण अव्यवहारिक है, और विभिन्न समानार्थक शब्दों का उपयोग करने वाले विवरण छवियों को छूटने का कारण बन सकते हैं। छवियों को वर्गीकृत करने के लिए विभिन्न मानक विकसित किए गए हैं, लेकिन सभी को स्केलिंग और गलत वर्गीकरण मुद्दों का सामना करना पड़ता है। कई CBIR सिस्टम विकसित किए गए हैं, लेकिन 2006 तक, पिक्सेल सामग्री के आधार पर छवियों को पुनर्प्राप्त करने की समस्या काफी हद तक अनसुलझी बनी हुई थी। दो छवियों (आमतौर पर एक उदाहरण छवि और डेटाबेस से एक छवि) की तुलना करने का सबसे आम तरीका निकाले गए दृश्य विशेषताओं के आधार पर दूरी माप की गणना करना है, जिसमें परिणाम तदनुसार रैंक किए जाते हैं। आधुनिक सिस्टम तेजी से Deep learning और Neural network आर्किटेक्चर को शामिल कर रहे हैं ताकि विशेषता निष्कर्षण और शब्दार्थ समझ में सुधार हो सके, हालांकि मानव स्तर पर पूर्ण शब्दार्थ पुनर्प्राप्ति एक खुली शोध चुनौती बनी हुई है।