लाया सितंबर 2026 में कॉन्वाइ इनोवेशन्स द्वारा जारी एक ओपन-वेट आर्टिफिशियल-इंटेलिजेंस निर्णय मॉडल है, जो भारत के केरल के कासरगोड में स्थित एक स्टार्टअप है, जिसकी स्थापना नंदकिशोर एम ने की थी। Apache 2.0 लाइसेंस के तहत हगिंग फेस पर वेट्स के साथ वितरित, लाया को जेव के ओपन, सेल्फ-होस्टेबल समकक्ष के रूप में स्थापित किया गया है, जो टाइपसेफ एआई का उसी महीने जारी किया गया बंद "सिस्टम वन" निर्णय मॉडल है।
यह कैसे काम करता है
लाया गैर-ऑटोरेग्रेसिव है: एक बड़े भाषा मॉडल की तरह टोकन दर टोकन टेक्स्ट उत्पन्न करने के बजाय, यह वर्गीकृत करता है। राज्य का एक टुकड़ा (एक ईमेल, एक सपोर्ट टिकट, एक एजेंट ट्रेस, एक JSON ऑब्जेक्ट) और निश्चित उत्तर सेट वाले टाइप किए गए प्रश्नों की एक सूची दिए जाने पर, यह एक ही फॉरवर्ड पास में कैलिब्रेटेड संभावनाओं के साथ चुने गए उत्तर लौटाता है। चूंकि यह कोई मुक्त-पाठ उत्पन्न नहीं करता है, इसलिए भ्रमित करने के लिए कुछ भी नहीं है और पार्स करने के लिए कोई गद्य या JSON नहीं है; डाउनस्ट्रीम कोड सीधे टाइप किए गए परिणाम और उसके विश्वास पर शाखा करता है।
मुख्य अंग्रेजी चेकपॉइंट ModernBERT-large बैकबोन पर बनाया गया है जिसमें लगभग 421 मिलियन पैरामीटर हैं, जो मामूली स्थानीय हार्डवेयर पर चलने के लिए पर्याप्त छोटा है। एक बहुभाषी संस्करण 100 से अधिक भाषाओं को कवर करता है।
प्रदर्शन दावे
कॉन्वाइ एक एकल टेस्ला T4 GPU पर लगभग 32.8 मिलीसेकंड की माध्यिका (p50) विलंबता की रिपोर्ट करता है, जिसकी तुलना वह जेव के होस्टेड API के लिए मापे गए 236-276 ms से करता है, जो विक्रेता के अपने बेंचमार्क पर लगभग 7.8x गति लाभ है, और सेल्फ-होस्टेड होने पर शून्य सीमांत लागत पर। जेव के लॉन्च आंकड़ों की तरह, ये आंकड़े विक्रेता के अपने मूल्यांकन से आते हैं और रिलीज़ के बाद के हफ्तों में इनका सीमित स्वतंत्र सत्यापन था।
परियोजना द्वारा स्वयं स्वीकार की गई एक महत्वपूर्ण चेतावनी: बॉक्स से बाहर, आधार मॉडल निर्णय कार्यों पर यादृच्छिक के करीब स्कोर करता है - शीर्षक सटीकता संख्याएं लक्ष्य कार्य पर फाइन-ट्यूनिंग के बाद प्राप्त की जाती हैं। लाया को सबसे अच्छा एक खुले, कुशल निर्णय-मॉडल आर्किटेक्चर के रूप में समझा जाता है जिसे आप अपने कार्यभार के अनुसार अनुकूलित करते हैं, न कि ज़ीरो-शॉट ड्रॉप-इन के रूप में।
लाया और जेव
लाया और जेव एक उभरती हुई श्रेणी को परिभाषित करते हैं जिसे कभी-कभी सिस्टम वन मॉडल कहा जाता है, डैनियल काह्नमैन की थिंकिंग, फास्ट एंड स्लो के तेज़, सहज "सिस्टम 1" के नाम पर: उच्च-मात्रा, कम-विलंबता वर्गीकरण, स्कोरिंग, रूटिंग और अगले-चरण निर्णयों के लिए बनाए गए मॉडल जो जनरेटिव बड़े-भाषा-मॉडल के साथ सह-अस्तित्व में रहते हैं, न कि उन्हें प्रतिस्थापित करते हैं। दोनों मुख्य रूप से वितरण में भिन्न हैं: जेव एक बंद होस्टेड API है, जबकि लाया के Apache-2.0 वेट्स को स्थानीय रूप से चलाया जा सकता है (Node.js/TypeScript के लिए ONNX Runtime के माध्यम से सामुदायिक रनटाइम मौजूद हैं), स्वतंत्र रूप से फाइन-ट्यून किया जा सकता है, और प्रति-कॉल लागत के बिना तैनात किया जा सकता है।