अंग्रेज़ी से अनुवादित

vLLM एक ओपन-सोर्स फ्रेमवर्क है जो बड़े भाषा मॉडलों के उच्च-थ्रूपुट, मेमोरी-कुशल अनुमान और सर्विंग के लिए है, जिसे UC बर्कले में विकसित किया गया है और यह PagedAttention एल्गोरिदम पर केंद्रित है। यह निरंतर बैचिंग, क्वांटाइज़ेशन, और OpenAI-संगत APIs जैसी सुविधाओं का समर्थन करता है, और 2024 में यह Linux Foundation परियोजना बन गया।

vLLM एक ओपन-सोर्स सॉफ्टवेयर फ्रेमवर्क है जो बड़े भाषा मॉडल और संबंधित मल्टीमॉडल मॉडल के अनुमान और सर्विंग के लिए उपयोग किया जाता है। मूल रूप से कैलिफोर्निया विश्वविद्यालय, बर्कले के स्काई कंप्यूटिंग लैब में विकसित, यह परियोजना PagedAttention पर केंद्रित है, जो ट्रांसफॉर्मर की-वैल्यू कैश के लिए एक मेमोरी-प्रबंधन विधि है, और इसमें निरंतर बैचिंग, वितरित अनुमान, क्वांटाइजेशन और OpenAI-संगत API जैसी सुविधाएँ शामिल हैं। इसे उत्पादन वातावरण में बड़े भाषा मॉडल तैनात करने के लिए उच्च थ्रूपुट और मेमोरी दक्षता प्रदान करने के लिए डिज़ाइन किया गया है।

यह परियोजना कृत्रिम बुद्धिमत्ता समुदाय में मॉडल सर्विंग के लिए एक मानक उपकरण के रूप में महत्वपूर्ण गति प्राप्त कर चुकी है, जिसे क्लाउड प्रदाताओं और हार्डवेयर विक्रेताओं द्वारा अपनाया गया है। इसकी वास्तुकला और डिज़ाइन ने बाद के अनुमान फ्रेमवर्क को प्रभावित किया है, और 2024 में लिनक्स फाउंडेशन परियोजना में इसका संक्रमण ओपन-सोर्स AI बुनियादी ढांचे में एक मील का पत्थर साबित हुआ।

इतिहास

vLLM को 2023 में UC बर्कले के स्काई कंप्यूटिंग लैब से जुड़े शोधकर्ताओं द्वारा पेश किया गया था। इसके मूल विचारों को 2023 के पेपर "Efficient Memory Management for Large Language Model Serving with PagedAttention" में वर्णित किया गया था, जिसने सिस्टम को बड़े भाषा मॉडल के लिए उच्च-थ्रूपुट और मेमोरी-कुशल सर्विंग इंजन के रूप में प्रस्तुत किया। पेपर में विस्तार से बताया गया कि कैसे PagedAttention की-वैल्यू कैश में मेमोरी की बर्बादी को कम कर सकता है, जो ट्रांसफॉर्मर अनुमान में एक महत्वपूर्ण बाधा है।

एक परियोजना अनुरक्षक के अनुसार, vLLM में "v" मूल रूप से "वर्चुअल" को संदर्भित करता था, जो वर्चुअल मेमोरी से प्रेरित था। यह नामकरण एल्गोरिदम के ऑपरेटिंग सिस्टम पेजिंग तकनीकों के साथ वैचारिक ऋण को दर्शाता है।

PyTorch की परियोजना पृष्ठ बताता है कि कैलिफोर्निया विश्वविद्यालय, बर्कले ने जुलाई 2024 में vLLM को लिनक्स फाउंडेशन में योगदान दिया। 2025 में, PyTorch फाउंडेशन ने घोषणा की कि vLLM एक फाउंडेशन-होस्टेड परियोजना बन गई है, जिससे फाउंडेशन की छत्रछाया में इसका शासन औपचारिक हो गया। जनवरी 2026 में, TechCrunch ने रिपोर्ट किया कि vLLM के निर्माताओं ने परियोजना का व्यावसायीकरण करने के लिए स्टार्टअप Inferact लॉन्च किया, जिसमें $150 मिलियन की सीड फंडिंग जुटाई गई।

वास्तुकला

अपने 2023 के पेपर के अनुसार, vLLM को ट्रांसफॉर्मर अनुमान के दौरान उपयोग किए जाने वाले की-वैल्यू कैश में मेमोरी की बर्बादी को कम करके बड़े भाषा मॉडल सर्विंग की दक्षता में सुधार करने के लिए डिज़ाइन किया गया था। पेपर ने PagedAttention पेश किया, जो ऑपरेटिंग सिस्टम में वर्चुअल मेमोरी और पेजिंग तकनीकों से प्रेरित एक एल्गोरिदम है, और vLLM को ब्लॉक-स्तरीय मेमोरी प्रबंधन और अनुरोध शेड्यूलिंग का उपयोग करके समान विलंबता बनाए रखते हुए थ्रूपुट बढ़ाने के रूप में वर्णित किया।

PagedAttention की-वैल्यू कैश को निश्चित आकार के ब्लॉकों में विभाजित करके काम करता है, जिन्हें गतिशील रूप से आवंटित और विमुक्त किया जा सकता है, ठीक उसी तरह जैसे ऑपरेटिंग सिस्टम भौतिक मेमोरी पेजों का प्रबंधन करते हैं। यह दृष्टिकोण विखंडन को कम करता है और GPU मेमोरी के अधिक कुशल उपयोग की अनुमति देता है, जिससे उच्च बैच आकार और हार्डवेयर संसाधनों का बेहतर उपयोग संभव होता है।

परियोजना दस्तावेज़ीकरण और रिपॉजिटरी निरंतर बैचिंग, चंक्ड प्रीफिल, सट्टा डिकोडिंग, प्रीफिक्स कैशिंग, क्वांटाइजेशन और वितरित अनुमान के कई रूपों के लिए समर्थन का वर्णन करते हैं। निरंतर बैचिंग सिस्टम को पूर्ण बैच की प्रतीक्षा करने के बजाय अनुरोध आते ही संसाधित करने की अनुमति देती है, जिससे प्रतिक्रियाशीलता और थ्रूपुट में सुधार होता है। सट्टा डिकोडिंग जनरेशन को तेज करने के लिए छोटे ड्राफ्ट मॉडल का उपयोग करती है, जबकि प्रीफिक्स कैशिंग साझा प्रॉम्प्ट प्रीफिक्स के लिए गणनाओं का पुन: उपयोग करती है।

PyTorch ने vLLM को एक उच्च-थ्रूपुट, मेमोरी-कुशल अनुमान और सर्विंग इंजन के रूप में वर्णित किया है जो NVIDIA और AMD GPU, Google TPU, AWS Trainium और Intel प्रोसेसर सहित कई हार्डवेयर बैकएंड का समर्थन करता है। यह व्यापक हार्डवेयर समर्थन इसे ऑन-प्रिमाइसेस क्लस्टर से लेकर क्लाउड वातावरण तक विविध तैनाती परिदृश्यों के लिए एक बहुमुखी विकल्प बनाता है।

विशेषताएँ और क्षमताएँ

vLLM एक OpenAI-संगत API प्रदान करता है, जिससे डेवलपर्स इसे मौजूदा अनुप्रयोगों और उपकरणों के साथ एकीकृत कर सकते हैं जो एक मानक इंटरफ़ेस की अपेक्षा करते हैं। यह संगतता अन्य सर्विंग समाधानों से माइग्रेशन को सरल बनाती है और LangChain और LlamaIndex जैसे फ्रेमवर्क के साथ सहज उपयोग को सक्षम बनाती है।

vLLM में क्वांटाइजेशन समर्थन में INT8 और INT4 वेट क्वांटाइजेशन जैसी तकनीकें शामिल हैं, जो स्वीकार्य सटीकता बनाए रखते हुए मॉडल आकार और मेमोरी फुटप्रिंट को कम करती हैं। यह संसाधन-सीमित हार्डवेयर पर बड़े मॉडल तैनात करने के लिए विशेष रूप से महत्वपूर्ण है।

वितरित अनुमान क्षमताएँ vLLM को कई GPU या नोड्स में स्केल करने की अनुमति देती हैं, जो एकल डिवाइस की मेमोरी से अधिक मॉडलों को संभालने के लिए टेंसर समानांतरता और पाइपलाइन समानांतरता का उपयोग करती हैं। यह सैकड़ों अरबों मापदंडों वाले फ्रंटियर-स्केल मॉडल की सेवा के लिए आवश्यक है।

पारिस्थितिकी तंत्र और अपनाना

vLLM AI बुनियादी ढांचे के पारिस्थितिकी तंत्र में एक मौलिक घटक बन गया है, जिसमें प्रमुख क्लाउड प्रदाताओं और हार्डवेयर विक्रेताओं से एकीकरण शामिल है। उदाहरण के लिए, AWS अपने Trainium चिप्स पर vLLM का समर्थन करता है, और Google Cloud इसे TPU पर प्रदान करता है। AMD और Intel ने भी अपने एक्सेलेरेटर के लिए vLLM को अनुकूलित किया है, जिससे NVIDIA GPU से परे इसकी पहुँच व्यापक हुई है।

परियोजना की ओपन-सोर्स प्रकृति ने योगदानकर्ताओं का एक जीवंत समुदाय विकसित किया है, जिसमें नियमित रिलीज़ और बढ़ती सुविधाएँ शामिल हैं। स्टार्टअप्स और उद्यमों दोनों द्वारा इसका अपनाना इसे अनुमान प्रदर्शन के लिए एक बेंचमार्क बना चुका है, जिसका उपयोग अक्सर Ollama और SGLang जैसे अन्य फ्रेमवर्क के साथ तुलना में किया जाता है।

यह भी देखें

  • Ollama
  • SGLang
  • TensorRT-LLM
  • llama.cpp
  • OpenVINO
  • Open Neural Network Exchange
  • गहन शिक्षण सॉफ्टवेयर की तुलना
  • मशीन लर्निंग सॉफ्टवेयर की तुलना
  • विश्वविद्यालयों में विकसित सॉफ्टवेयर की सूची
  • ओपन-सोर्स AI सॉफ्टवेयर की सूचियाँ
  • बड़े भाषा मॉडल की सूची
  • TurboQuant
  • 2025–वर्तमान वैश्विक मेमोरी आपूर्ति की कमी
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:open-source-software·large-language-models·machine-learning·artificial-intelligence
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास