vLLM एक ओपन-सोर्स सॉफ्टवेयर फ्रेमवर्क है जो बड़े भाषा मॉडल और संबंधित मल्टीमॉडल मॉडल के अनुमान और सर्विंग के लिए उपयोग किया जाता है। मूल रूप से कैलिफोर्निया विश्वविद्यालय, बर्कले के स्काई कंप्यूटिंग लैब में विकसित, यह परियोजना PagedAttention पर केंद्रित है, जो ट्रांसफॉर्मर की-वैल्यू कैश के लिए एक मेमोरी-प्रबंधन विधि है, और निरंतर बैचिंग, वितरित अनुमान, क्वांटाइजेशन, और OpenAI-संगत API जैसी सुविधाओं का समर्थन करती है।
इतिहास
vLLM को 2023 में यूसी बर्कले के स्काई कंप्यूटिंग लैब से जुड़े शोधकर्ताओं द्वारा पेश किया गया था। इसके मूल विचारों को 2023 के पेपर "Efficient Memory Management for Large Language Model Serving with PagedAttention" में वर्णित किया गया था, जिसने सिस्टम को बड़े भाषा मॉडल के लिए उच्च-थ्रूपुट और मेमोरी-कुशल सर्विंग इंजन के रूप में प्रस्तुत किया। एक परियोजना अनुरक्षक के अनुसार, vLLM में "v" मूल रूप से "वर्चुअल" को संदर्भित करता था, जो वर्चुअल मेमोरी से प्रेरित था।
PyTorch की परियोजना पृष्ठ बताती है कि कैलिफोर्निया विश्वविद्यालय, बर्कले ने जुलाई 2024 में vLLM को लिनक्स फाउंडेशन में योगदान दिया। 2025 में, PyTorch फाउंडेशन ने घोषणा की कि vLLM एक फाउंडेशन-होस्टेड परियोजना बन गया है। जनवरी 2026 में, TechCrunch ने रिपोर्ट किया कि vLLM के निर्माताओं ने परियोजना को व्यावसायिक रूप देने के लिए स्टार्टअप Inferact लॉन्च किया, जिसमें सीड फंडिंग में $150 मिलियन जुटाए गए।
वास्तुकला
अपने 2023 के पेपर के अनुसार, vLLM को ट्रांसफॉर्मर अनुमान के दौरान उपयोग किए जाने वाले की-वैल्यू कैश में मेमोरी अपशिष्ट को कम करके बड़े भाषा मॉडल सर्विंग की दक्षता में सुधार करने के लिए डिज़ाइन किया गया था। पेपर ने PagedAttention पेश किया, जो ऑपरेटिंग सिस्टम में वर्चुअल मेमोरी और पेजिंग तकनीकों से प्रेरित एक एल्गोरिदम है, और vLLM को ब्लॉक-स्तरीय मेमोरी प्रबंधन और अनुरोध शेड्यूलिंग का उपयोग करके समान विलंबता बनाए रखते हुए थ्रूपुट बढ़ाने के रूप में वर्णित किया।
परियोजना दस्तावेज़ीकरण और रिपॉजिटरी निरंतर बैचिंग, चंक्ड प्रीफिल, सट्टा डिकोडिंग, प्रीफिक्स कैशिंग, क्वांटाइजेशन, और वितरित अनुमान के कई रूपों के समर्थन का वर्णन करते हैं। PyTorch ने vLLM को एक उच्च-थ्रूपुट, मेमोरी-कुशल अनुमान और सर्विंग इंजन के रूप में वर्णित किया है जो NVIDIA और AMD GPU, Google TPU, AWS Trainium, और Intel प्रोसेसर सहित कई हार्डवेयर बैक एंड का समर्थन करता है।
प्रदर्शन और उपयोग के मामले
vLLM का व्यापक रूप से शैक्षणिक और औद्योगिक दोनों सेटिंग्स में बड़े भाषा मॉडल को बड़े पैमाने पर सर्व करने के लिए उपयोग किया जाता है। इसका उच्च थ्रूपुट इसे चैटबॉट, कोड जनरेशन, और वास्तविक समय AI सहायकों जैसे अनुप्रयोगों के लिए उपयुक्त बनाता है। फ्रेमवर्क लोकप्रिय मॉडल लाइब्रेरीज़ के साथ एकीकृत होता है और इसे अमेज़न वेब सर्विसेज, गूगल क्लाउड, और एज़्योर जैसे क्लाउड प्लेटफार्मों पर तैनात किया जा सकता है।
समुदाय और शासन
लिनक्स फाउंडेशन में योगदान देने के बाद, vLLM PyTorch फाउंडेशन के तहत एक परियोजना बन गया, जो ओपन-सोर्स AI बुनियादी ढांचे के लिए शासन और समर्थन प्रदान करता है। परियोजना में शिक्षा और उद्योग से योगदानकर्ताओं का एक सक्रिय समुदाय है, और इसका विकास बर्कले एआई रिसर्च और स्टैनफोर्ड एआई लैब जैसे संगठनों के अनुरक्षकों द्वारा निर्देशित है।
यह भी देखें
- ओलामा
- sglang
- टेंसरआरटी-एलएलएम
- llama.cpp
- openvino
- open-neural-network-exchange
- comparison-of-deep-learning-software
- comparison-of-machine-learning-software
- list-of-software-developed-at-universities
- lists-of-open-source-artificial-intelligence-software
- list-of-large-language-models
- turboquant
- 2025-present-global-memory-supply-shortage