Chroma (जिसे ChromaDB के रूप में भी जाना जाता है) एक ओपन-सोर्स डेटा इंफ्रास्ट्रक्चर प्रणाली है जो बड़े भाषा मॉडल के साथ निर्मित अनुप्रयोगों के लिए तैयार की गई है। यह एक एम्बेडिंग डेटाबेस के रूप में कार्य करती है, जो डेवलपर्स को डेटा के वेक्टर प्रतिनिधित्व को संग्रहीत, प्रबंधित और खोजने में सक्षम बनाती है, जो आधुनिक Artificial intelligence वर्कफ़्लो जैसे Retrieval-augmented generation के लिए एक मुख्य आवश्यकता है। यह प्रणाली AI पाइपलाइनों में वेक्टर खोज को एकीकृत करने के लिए एक हल्का और डेवलपर-अनुकूल इंटरफ़ेस प्रदान करती है, जिसे अक्सर Generative AI अनुप्रयोगों के निर्माण के लिए फ्रेमवर्क के साथ उपयोग किया जाता है।
सैन फ्रांसिस्को में मुख्यालय होने के कारण, Chroma को 2023 में लॉन्च किया गया था और इसने तेजी से उद्यम पूंजी आकर्षित की। अप्रैल 2023 में, कंपनी ने घोषणा की कि उसने सीड फंडिंग में 18 मिलियन अमेरिकी डॉलर जुटाए हैं, जो AI के लिए डेटा इंफ्रास्ट्रक्चर में बढ़ती रुचि को दर्शाता है। यह परियोजना ओपन-सोर्स सॉफ्टवेयर के रूप में बनाए रखी गई है, जो व्यापक सामुदायिक योगदान और अपनाने की अनुमति देती है।
वेक्टर खोज और एम्बेडिंग
Chroma का प्राथमिक कार्य Neural network // वेक्टर डेटाबेस के रूप में सेवा करना है जो एम्बेडिंग के भंडारण और पुनर्प्राप्ति को संभालता है। Machine learning के संदर्भ में, एम्बेडिंग डेटा जैसे पाठ, चित्र, या ऑडियो के संख्यात्मक प्रतिनिधित्व हैं, जो Large language model जैसे मॉडल द्वारा उत्पन्न होते हैं। Chroma इन एम्बेडिंग को अनुक्रमित करता है और तेज़ समानता खोज का समर्थन करता है, जिससे बहुआयामी स्थान में निकटतम वैक्टर खोजकर प्रश्न-उत्तर या अनुशंसा जैसे संचालन सक्षम होते हैं। यह दृष्टिकोण Natural language processing कार्यों में आम है, जहां सिमेंटिक समानता कीवर्ड मिलान की जगह लेती है।
डेटाबेस को हल्का और सेट अप करने में आसान बनाने के लिए डिज़ाइन किया गया है, जो इन-मेमोरी और स्थायी भंडारण बैकएंड दोनों प्रदान करता है। डेवलपर्स एक सरल API का उपयोग करके इसे क्वेरी कर सकते हैं, लोकप्रिय AI फ्रेमवर्क और OpenAI या Anthropic मॉडल API के साथ एकीकृत कर सकते हैं। Chroma मेटाडेटा फ़िल्टरिंग का भी समर्थन करता है, जिससे कस्टम विशेषताओं द्वारा खोज परिणामों को सीमित किया जा सकता है।
बड़े भाषा मॉडल के साथ एकीकरण
Chroma का उपयोग अक्सर Retrieval-augmented generation (RAG) स्टैक के हिस्से के रूप में किया जाता है, एक तकनीक जो उत्तर उत्पन्न करने से पहले प्रासंगिक दस्तावेज़ प्राप्त करने के लिए एक बड़े भाषा मॉडल को वेक्टर डेटाबेस के साथ जोड़ती है। एक RAG पाइपलाइन में, एक इनपुट क्वेरी को एम्बेडिंग में परिवर्तित किया जाता है, Chroma सबसे समान डेटा बिंदुओं को पुनर्प्राप्त करता है, और मॉडल उन्हें संदर्भ के रूप में उपयोग करता है। यह वास्तविक डेटा में आधारित होकर Hallucination (AI) को कम करता है।
यह वर्कफ़्लो कृत्रिम बुद्धिमत्ता पर शैक्षणिक अध्ययनों में लागू किया गया है, विशेष रूप से Transformer (architecture) आर्किटेक्चर से जुड़े प्रयोगों में। डिज़ाइन Google DeepMind और Cerebras जैसी कंपनियों की प्रथाओं के अनुरूप है, हालांकि Chroma स्वयं कई वातावरणों में आसान एकीकरण के लिए निर्मित एक स्वतंत्र उपकरण है।
तकनीकी आर्किटेक्चर
कोर Python में बनाया गया है, जो डेटा-विज्ञान और Machine learning वर्कफ़्लो में सीधा उपयोग की अनुमति देता है। तेज़ निकटतम-पड़ोसी गणना के लिए एक वेक्टर इंडेक्स मेमोरी में बनाए रखा जाता है, और एक स्थायी भंडारण परत भी होती है। Chroma में एम्बेडिंग उत्पन्न करने के लिए एक रनटाइम मॉडल शामिल नहीं है; इसके बजाय, यह सरल से लेकर उपयोगकर्ता-परिभाषित तक कई एम्बेडिंग फ़ंक्शन का समर्थन करता है, ताकि इसे किसी भी मॉडल के साथ उपयोग किया जा सके।
डेवलपर्स प्रोटोटाइपिंग के लिए Chroma को स्थानीय रूप से चला सकते हैं या उत्पादन के लिए इसे Amazon Web Services और अन्य क्लाउड इंफ्रास्ट्रक्चर पर तैनात कर सकते हैं। इसे प्रदर्शन और न्यूनतम संसाधन खपत पर ध्यान देकर बनाया गया है, जो इसे एज डिवाइस या पॉकेट-आकार के रोबोट जैसे वातावरण में अनुप्रयोगों के लिए उपयुक्त बनाता है, और यह Oracle Cloud Infrastructure और Google Cloud जैसे अन्य प्लेटफार्मों के साथ समान रूप से काम करता है।
शैक्षणिक और अनुसंधान में उपयोग
कई कृत्रिम बुद्धिमत्ता अनुसंधान परियोजनाओं, विशेष रूप से ज्ञान-गहन प्रश्न-उत्तर और सूचना पुनर्प्राप्ति के क्षेत्र में, ने अपने तकनीकी स्टैक के हिस्से के रूप में Chroma को अपनाया है। इसकी ओपन-सोर्स प्रकृति पुनरुत्पादन की अनुमति देती है, क्योंकि शोधकर्ता अपने परीक्षण सेट के लिए आसानी से वेक्टर डेटाबेस स्थापित कर सकते हैं। उदाहरण के लिए, वैज्ञानिक पत्रों जैसे कोरपोरा पर Large language model का उपयोग करने वाले कुछ अध्ययनों में, Chroma उत्पादन मॉडल के आउटपुट उत्पन्न करने से पहले पुनर्प्राप्ति चरण प्रदान करता है। यह कुशल ज्ञान पहुंच के लिए Neural network प्रणालियों को सुधारने पर काम में और अन्य RAG कार्यान्वयनों के साथ तुलना में देखा गया है।
सॉफ्टवेयर का उपयोग AI के लिए डेटा प्रबंधन में नए तरीकों की खोज के लिए एक परीक्षण मंच के रूप में भी किया जाता है, क्योंकि यह पारंपरिक डेटाबेस की तुलना में न्यूनतम सेटअप के साथ तेज़ पुनरावृत्ति की अनुमति देता है।
समुदाय और उद्योग
Chroma ने आधुनिक AI फ्रेमवर्क के साथ आसान एकीकरण के कारण जनरेटिव AI समाधान बनाने वाले डेवलपर्स के साथ लोकप्रियता हासिल की है। टीम वाणिज्यिक समर्थन और क्लाउड पिवट प्रदान करती है, लेकिन ओपन-सोर्स कोड इसके मूल्य का एक केंद्रीय हिस्सा बना हुआ है। यह एक मानक API प्रदान करता है जिसका उपयोग चैट-आधारित सहायक बनाने के लिए किया गया है, जिसमें Amazon AI और सीमित हार्डवेयर स्वादों के तहत शामिल हैं।
Artificial intelligence अनुप्रयोगों में कुशल पुनर्प्राप्ति पर बढ़ते जोर के साथ, Chroma खुद को उस चीज़ के निर्माण के लिए एक मुख्य घटक के रूप में स्थापित करता है जिसे अक्सर AI डेटाबेस परत कहा जाता है, साथ ही SambaNova द्वारा उपयोग किए जाने वाले समान उपकरण या मुख्यालय में प्रतीक्षारत वितरित कंप्यूटिंग के साथ।