सिमेंटिक सर्च एक पुनर्प्राप्ति दृष्टिकोण है जो किसी क्वेरी के अंतर्निहित अर्थ के आधार पर परिणामों को रैंक और लौटाता है, बजाय इसके कि क्वेरी के शाब्दिक शब्द मिलान की गई सामग्री में दिखाई दें। जहां पारंपरिक कीवर्ड सर्च, जो इनवर्टेड-इंडेक्स सिस्टम और TF-IDF तथा BM25 रैंकिंग फॉर्मूलों द्वारा उदाहरणित है, क्वेरी के समान टोकन वाले दस्तावेज़ों से मेल खाता है, वहीं सिमेंटिक सर्च एक अलग प्रश्न पूछता है: कौन से संग्रहीत आइटम उपयोगकर्ता के इरादे के सबसे निकट हैं। "समुद्र तट के पास रहने के लिए किफायती जगह" की खोज को "बजट-अनुकूल समुद्र तट के सामने वाले कमरे" के रूप में वर्णित एक लिस्टिंग को सामने लाना चाहिए, भले ही दोनों वाक्यांश लगभग कोई शब्द साझा न करें।
यह कैसे काम करता है
प्रमुख तकनीक क्वेरी और कॉर्पस के प्रत्येक आइटम दोनों को एक Embedding के रूप में प्रस्तुत करती है, जो एक प्रशिक्षित मॉडल द्वारा उत्पन्न एक सघन संख्यात्मक वेक्टर है, जैसे कि अर्थगत रूप से समान पाठ निकटवर्ती वेक्टर उत्पन्न करता है। क्वेरी समय पर, सिस्टम आने वाली क्वेरी को एम्बेड करता है और उन आइटमों को पुनर्प्राप्त करता है जिनके वेक्टर कोसाइन समानता जैसे दूरी मीट्रिक द्वारा सबसे निकट हैं, यह ऑपरेशन एक Vector database द्वारा अनुमानित निकटतम-पड़ोसी इंडेक्सिंग का उपयोग करके बड़े पैमाने पर किया जाता है। यह सामान्य दृष्टिकोण, जिसे अक्सर डेंस रिट्रीवल कहा जाता है, उन स्पार्स, टर्म-मैचिंग विधियों के विपरीत है जो इससे पहले थीं।
सिमेंटिक सर्च की जड़ें वर्तमान एम्बेडिंग-आधारित दृष्टिकोण से पहले की हैं। 1980 के दशक के अंत और 1990 के दशक की शुरुआत में लैटेंट सिमेंटिक एनालिसिस ने शब्द-दस्तावेज़ सह-घटना आंकड़ों पर मैट्रिक्स फैक्टराइजेशन का उपयोग करके विषयगत समानता की कुछ धारणा को पकड़ा, और Knowledge graph पर निर्मित सर्च इंजनों ने स्ट्रिंग्स के बजाय संस्थाओं और संबंधों पर तर्क करने का प्रयास किया। एम्बेडिंग-आधारित संस्करण केवल Word2vec और बाद में Transformer (architecture) युग के संदर्भगत एम्बेडिंग मॉडलों के बाद प्रमुख बना, जो Natural language processing के व्यापक क्षेत्र के भीतर विकसित हुए, जिसने बड़े पैमाने पर उच्च-गुणवत्ता वाले डेंस वेक्टर उत्पादन को सस्ता बना दिया।
अनुप्रयोग
सिमेंटिक सर्च Retrieval-augmented generation प्रणालियों के पीछे पुनर्प्राप्ति तंत्र है, जहां प्रासंगिक अनुच्छेदों को एक दस्तावेज़ भंडार से खींचा जाता है और एक LLM के प्रॉम्प्ट में डाला जाता है ताकि उसके आउटपुट को विशिष्ट स्रोत सामग्री में आधारित किया जा सके और भ्रम को कम किया जा सके। इसका उपयोग सीधे उपभोक्ता और उद्यम सर्च उत्पादों, ई-कॉमर्स उत्पाद खोज, ग्राहक सहायता डिफ्लेक्शन, कानूनी और चिकित्सा दस्तावेज़ समीक्षा, और कोड सर्च में भी किया जाता है, जहां भी उपयोगकर्ता की वाक्यांश रचना लक्ष्य सामग्री के शब्दावली से बिल्कुल मेल खाने की संभावना नहीं होती है।
हाइब्रिड दृष्टिकोण और सीमाएं
शुद्ध सिमेंटिक सर्च उन क्वेरीज़ पर कम प्रदर्शन कर सकता है जो सटीक स्ट्रिंग्स पर निर्भर करती हैं, जैसे उत्पाद कोड, उचित संज्ञाएं, या दुर्लभ तकनीकी शब्द, जहां कीवर्ड मिलान स्पष्ट होता है और डेंस रिट्रीवल केवल विषयगत रूप से संबंधित लेकिन गलत परिणाम की ओर बह सकता है। इस कारण से, अधिकांश उत्पादन प्रणालियां हाइब्रिड सर्च का उपयोग करती हैं, जो BM25 जैसे स्पार्स कीवर्ड-आधारित सिग्नल को डेंस एम्बेडिंग-आधारित सिग्नल के साथ जोड़ती है, फिर दोनों परिणाम सेटों को विलय या पुनः-रैंक करती है। एक दूसरे चरण का पुनः-रैंकर, जो अक्सर एक छोटा ट्रांसफॉर्मर मॉडल होता है जिसे विशेष रूप से क्वेरी-दस्तावेज़ प्रासंगिकता को स्कोर करने के लिए प्रशिक्षित किया जाता है, आमतौर पर प्रारंभिक पुनर्प्राप्ति पास के शीर्ष उम्मीदवारों पर सटीकता में सुधार के लिए लागू किया जाता है।
सिमेंटिक सर्च की गुणवत्ता एम्बेडिंग मॉडल के प्रशिक्षण डेटा और डोमेन मिलान पर काफी हद तक निर्भर करती है: एक मॉडल जो मुख्य रूप से सामान्य वेब टेक्स्ट पर प्रशिक्षित है, वह केस लॉ या रसायन विज्ञान साहित्य जैसे विशेष कॉर्पस के भीतर खराब पुनर्प्राप्ति कर सकता है, जब तक कि इसे Fine-tuning के माध्यम से अनुकूलित न किया गया हो या कॉर्पस को डोमेन-विशिष्ट मॉडल के साथ एम्बेड न किया गया हो। किसी भी समानता-आधारित प्रणाली की तरह, सिमेंटिक सर्च भी आत्मविश्वास से गलत परिणाम सामने ला सकता है जब इंडेक्स में कोई वास्तव में प्रासंगिक आइटम मौजूद नहीं होता है, क्योंकि यह हमेशा निकटतम मिलान लौटाएगा, भले ही वह मिलान खराब फिट हो।