एक वेक्टर डेटाबेस उच्च-आयामी वेक्टरों की बड़ी संख्या को संग्रहीत, अनुक्रमित और क्वेरी करने के लिए एक प्रणाली है, जो आमतौर पर एक मशीन लर्निंग मॉडल द्वारा उत्पन्न एम्बेडिंग होते हैं, ताकि एक क्वेरी वेक्टर को सटीक कीवर्ड या कुंजी लुकअप के बजाय दूरी द्वारा निकटतम संग्रहीत वेक्टरों से मिलान किया जा सके। पारंपरिक रिलेशनल और दस्तावेज़ डेटाबेस संरचित क्षेत्रों पर सटीक मिलान और रेंज क्वेरी के आसपास बनाए गए हैं; वे उस प्रश्न के लिए अनुपयुक्त हैं जिसे वेक्टर डेटाबेस अच्छी तरह से हल करता है, अर्थात् "इन दस लाख वस्तुओं में से कौन सी इस एक के अर्थ में सबसे समान है?"
इनके उभरने के कारण
समर्पित वेक्टर खोज की आवश्यकता सीधे ट्रांसफॉर्मर और उस पर निर्मित बड़े भाषा मॉडल के उदय से उत्पन्न हुई। जैसे-जैसे संगठनों ने अर्थगत खोज और पुनर्प्राप्ति-संवर्धित पीढ़ी के लिए दस्तावेज़ों, छवियों और अन्य सामग्री को एम्बेड करना शुरू किया, भोली समानता खोज, जो एक क्वेरी वेक्टर की तुलना प्रत्येक संग्रहीत वेक्टर से एक-एक करके करती है, कुछ दसियों हज़ार वस्तुओं से आगे कम्प्यूटेशनल रूप से अव्यवहारिक हो गई। अनुमानित निकटतम-पड़ोसी (ANN) एल्गोरिदम, विशेष रूप से पदानुक्रमित नेविगेबल स्मॉल वर्ल्ड ग्राफ (HNSW) और उल्टे फ़ाइल इंडेक्स जो उत्पाद क्वांटीकरण के साथ संयुक्त हैं, ने स्मृति में छोटे, समायोज्य नुकसान की कीमत पर मिलीसेकंड में लाखों या अरबों वेक्टरों की खोज को संभव बना दिया।
पाइनकोन, वीविएट, मिल्वस और क्वाड्रेंट जैसे उद्देश्य-निर्मित वेक्टर डेटाबेस 2020 के दशक की शुरुआत में उभरे, जिन्होंने इन ANN एल्गोरिदम को डेटाबेस से अपेक्षित परिचालन सुविधाओं के साथ पैक किया: स्थायित्व, प्रतिकृति, मेटाडेटा द्वारा फ़िल्टरिंग और क्षैतिज स्केलिंग। उसी समय, स्थापित डेटाबेस ने एक स्टैंडअलोन उत्पाद के बजाय एक सुविधा के रूप में वेक्टर खोज जोड़ी, जिसमें PostgreSQL के लिए pgvector और Elasticsearch, Redis और MongoDB में वेक्टर इंडेक्स शामिल हैं, जिससे "वेक्टर डेटाबेस" को एक विशिष्ट श्रेणी के रूप में और वेक्टर खोज को मौजूदा बुनियादी ढांचे पर जुड़ी क्षमता के रूप में देखने के बीच की रेखा धुंधली हो गई।
ये कैसे काम करते हैं
एक विशिष्ट कार्यप्रवाह एक एम्बेडिंग मॉडल का उपयोग करके कॉर्पस में प्रत्येक वस्तु को एम्बेड करता है, परिणामी वेक्टर को एक पहचानकर्ता और वैकल्पिक मेटाडेटा के साथ संग्रहीत करता है, और वेक्टर संग्रह पर एक ANN इंडेक्स बनाता है। क्वेरी समय पर, आने वाले पाठ या छवि को उसी मॉडल के साथ एम्बेड किया जाता है, और इंडेक्स चुने गए दूरी मीट्रिक द्वारा k निकटतम वेक्टर लौटाता है, जो आमतौर पर कोसाइन समानता, डॉट उत्पाद या यूक्लिडियन दूरी होती है। कई सिस्टम हाइब्रिड खोज का समर्थन करते हैं, जो वेक्टर समानता को पारंपरिक कीवर्ड फ़िल्टरिंग या मेटाडेटा बाधाओं के साथ जोड़ते हैं, जैसे कि परिणामों को किसी विशेष तिथि सीमा या श्रेणी के दस्तावेज़ों तक सीमित करना।
AI अनुप्रयोगों में भूमिका
वेक्टर डेटाबेस पुनर्प्राप्ति-संवर्धित पीढ़ी के विकास के साथ AI बुनियादी ढांचे का एक मुख्य हिस्सा बन गए, जहां एक वेक्टर इंडेक्स से पुनर्प्राप्त प्रासंगिक अंशों को LLM के संदर्भ-विंडो में डाला जाता है ताकि उसके उत्तरों को विशिष्ट दस्तावेज़ों में आधारित किया जा सके और मतिभ्रम को कम किया जा सके। वे अनुशंसा प्रणालियों, छवि और ऑडियो समानता खोज, डुप्लिकेशन हटाने की पाइपलाइनों और विसंगति का पता लगाने में भी सहायक होते हैं, जहां भी "इसके जैसी चीज़ें खोजें" प्रचालन क्वेरी होती है।
सीमाएँ और व्यापार-नापसंद
ANN खोज बड़ी गति लाभ के लिए थोड़ी मात्रा में सटीकता का त्याग करती है, और इंडेक्स प्रकार और मापदंडों का चुनाव क्वेरी विलंबता, मेमोरी फुटप्रिंट और स्मृति के बीच वास्तविक व्यापार-नापसंद शामिल करता है। एम्बेडिंग गुणवत्ता पुनर्प्राप्ति गुणवत्ता को सीमित करती है: एक वेक्टर डेटाबेस केवल उतना ही अच्छा हो सकता है जितना उसे खिलाने वाला एम्बेडिंग मॉडल, और कॉर्पस को अनुक्रमित करने के लिए उपयोग किए गए एम्बेडिंग मॉडल और क्वेरी समय पर उपयोग किए गए मॉडल के बीच बेमेल चुपचाप परिणामों को खराब कर देता है। 2020 के दशक के मध्य तक, वेक्टर डेटाबेस लंबे-संदर्भ LLM से प्रतिस्पर्धात्मक दबाव का सामना करते हैं जो बड़ी मात्रा में कच्चे पाठ को सीधे ग्रहण कर सकते हैं, जिससे कुछ अनुप्रयोगों में पुनर्प्राप्ति की आवश्यकता कम हो जाती है लेकिन समाप्त नहीं होती है, और सामान्य-उद्देश्य डेटाबेस से जो वेक्टर खोज को एक अलग प्रणाली के रूप में संचालित करने के बजाय एक अंतर्निहित सुविधा के रूप में अवशोषित करते हैं।