MLC LLM एक मशीन लर्निंग संकलन ढांचा है जो बड़े भाषा मॉडलों के कुशल परिनियोजन पर केंद्रित है। एक ओपन-सोर्स परियोजना के रूप में विकसित, यह LLM कार्यभार को अनुकूलित कोड में अनुवाद करने के लिए Apache TVM संकलक स्टैक का लाभ उठाता है जो उपभोक्ता GPU, मोबाइल उपकरणों और क्लाउड सर्वर सहित विभिन्न हार्डवेयर बैकएंड पर चलता है। परियोजना का उद्देश्य LLM अनुमान के लिए एक एकीकृत संकलन पथ प्रदान करके AI हार्डवेयर के विखंडन को संबोधित करना है, जिससे विक्रेता-विशिष्ट कर्नेल और मैनुअल अनुकूलन की आवश्यकता कम हो जाती है।
यह ढांचा Apache TVM समुदाय से जुड़े शोधकर्ताओं और इंजीनियरों की एक टीम द्वारा पेश किया गया था, जिसमें कार्नेगी मेलन विश्वविद्यालय और वाशिंगटन विश्वविद्यालय जैसे संस्थानों का योगदान था। इसका विकास 2020 के दशक की शुरुआत में मशीन लर्निंग मॉडलों को एज डिवाइस से डेटा सेंटर तक विभिन्न वातावरणों में अधिक पोर्टेबल और स्केलेबल बनाने के व्यापक प्रयासों के हिस्से के रूप में शुरू हुआ। MLC LLM स्वचालित अनुकूलन के सिद्धांतों पर आधारित है, जो मैन्युअल रूप से ट्यून किए गए कार्यान्वयन के बराबर प्रदर्शन प्राप्त करने के लिए ऑपरेटर फ्यूजन, मेमोरी प्लानिंग और क्वांटाइजेशन जैसी तकनीकों का उपयोग करता है।
संकलन कार्यप्रवाह
MLC LLM का मूल इसकी संकलन पाइपलाइन में निहित है, जो एक पूर्व-प्रशिक्षित मॉडल लेता है और इसे परिनियोजन योग्य आर्टिफैक्ट में परिवर्तित करता है। यह प्रक्रिया PyTorch जैसे ढांचे या ONNX जैसे मानक प्रारूप में निर्दिष्ट मॉडल से शुरू होती है, फिर अनुकूलन लागू करने के लिए TVM के मध्यवर्ती प्रतिनिधित्व का उपयोग करती है। इनमें NVIDIA GPU के लिए CUDA कर्नेल, Apple सिलिकॉन के लिए Metal कर्नेल, और अन्य त्वरक के लिए Vulkan या OpenCL कर्नेल का स्वचालित निर्माण शामिल है। संकलित आउटपुट को एक रनटाइम में पैकेज किया जा सकता है जो मूल प्रशिक्षण स्टैक की आवश्यकता के बिना लक्ष्य डिवाइस पर निष्पादित होता है।
एक प्रमुख विशेषता गतिशील आकृतियों के लिए समर्थन है, जो परिवर्तनीय इनपुट लंबाई के कारण LLM अनुमान में सामान्य हैं। MLC LLM कोड उत्पन्न करके इसे संभालता है जो बदलते टेंसर आयामों के अनुकूल हो सकता है, जो पारंपरिक स्थैतिक संकलन में एक महत्वपूर्ण चुनौती है। इसके अतिरिक्त, ढांचा Hugging Face पारिस्थितिकी तंत्र के साथ एकीकृत होता है, जिससे उपयोगकर्ता transformers लाइब्रेरी से सीधे मॉडल आयात कर सकते हैं, जो चिकित्सकों के लिए कार्यप्रवाह को सरल बनाता है।
हार्डवेयर समर्थन
MLC LLM LLM परिनियोजन को सुलभ बनाने के लिए हार्डवेयर की एक विस्तृत श्रृंखला को लक्षित करता है। इसमें ROCm के माध्यम से AMD GPU, oneAPI के माध्यम से Intel GPU, और Metal का उपयोग करके Apple उपकरणों के लिए बैकएंड शामिल हैं। मोबाइल और एम्बेडेड सिस्टम के लिए, यह ARM-आधारित प्रोसेसर और अन्य कम-शक्ति त्वरक का समर्थन करता है। परियोजना विशेष प्रशिक्षण और अनुमान चिप्स के लिए प्रयोगात्मक समर्थन भी प्रदान करती है, जैसे AWS Trainium और Groq हार्डवेयर, हालांकि ये मुख्यधारा के बैकएंड के रूप में परिपक्व नहीं हैं।
ढांचे की लचीलापन क्लाउड वातावरण तक फैली हुई है, जहां यह NVIDIA T4 या A100 GPU वाले AWS इंस्टेंस पर चल सकता है, साथ ही TVM स्टैक के माध्यम से TPU का उपयोग करके Google Cloud पर भी। यह व्यापकता विक्रेताओं को प्रत्येक प्लेटफॉर्म के लिए परिनियोजन कोड को फिर से लिखने की आवश्यकता को समाप्त करने का लक्ष्य रखती है, जो Generative AI उद्योग में एक सामान्य दर्द बिंदु है।
प्रमुख विशेषताएं और अनुकूलन
अपनी उल्लेखनीय क्षमताओं में, MLC LLM सट्टा डिकोडिंग लागू करता है, एक तकनीक जो कई टोकन तैयार करके और उन्हें समानांतर में सत्यापित करके अनुमान को तेज करती है, जो ऑटोरेग्रेसिव मॉडलों के लिए थ्रूपुट में सुधार करती है। यह विभिन्न क्वांटाइजेशन योजनाओं का भी समर्थन करता है, जैसे 4-बिट और 8-बिट पूर्णांक क्वांटाइजेशन, जो मेमोरी फुटप्रिंट को कम करते हैं और सीमित संसाधनों वाले उपकरणों पर गति बढ़ाते हैं। ये अनुकूलन लक्ष्य हार्डवेयर की क्षमताओं द्वारा निर्देशित, संकलन के दौरान स्वचालित रूप से लागू होते हैं।
परियोजना में Rust और C में लिखा एक उच्च-प्रदर्शन रनटाइम शामिल है, जो निष्पादन के दौरान कम ओवरहेड सुनिश्चित करता है। यह Python के लिए API और एक कमांड-लाइन इंटरफ़ेस भी उजागर करता है, जो इसे शोधकर्ताओं और उत्पादन डेवलपर्स दोनों के लिए उपयुक्त बनाता है। 2024 तक, MLC LLM का उपयोग लैपटॉप और स्मार्टफोन पर इंटरैक्टिव गति के साथ Llama 2 और Mistral जैसे मॉडल चलाने के लिए किया गया है, जो इसके व्यावहारिक मूल्य को प्रदर्शित करता है।
Apache TVM से संबंध
MLC LLM Apache TVM परियोजना से निकटता से जुड़ा हुआ है, एक ओपन-सोर्स डीप लर्निंग संकलक जो मूल रूप से वाशिंगटन विश्वविद्यालय के शोधकर्ताओं द्वारा विकसित किया गया था। TVM ग्राफ-स्तर और ऑपरेटर-स्तर अनुकूलन के लिए मूलभूत बुनियादी ढांचा प्रदान करता है, जबकि MLC LLM इसे LLM कार्यप्रवाह के लिए विशिष्ट उच्च-स्तरीय अमूर्तताओं के साथ विस्तारित करता है, जैसे कि कुंजी-मूल्य कैश और ध्यान तंत्र को संभालना। यह संबंध MLC LLM को TVM की परिपक्व संकलन पास और इसके सक्रिय समुदाय को विरासत में लेने की अनुमति देता है, जिसमें उद्योग और शिक्षा के योगदानकर्ता शामिल हैं। सहयोग Machine learning में मैन्युअल कर्नेल इंजीनियरिंग के बजाय संकलक-आधारित दृष्टिकोणों की ओर एक व्यापक प्रवृत्ति को उजागर करता है।
समुदाय और अपनाना
परियोजना GitHub पर Apache 2.0 लाइसेंस के तहत होस्ट की गई है, जो वैश्विक डेवलपर आधार से योगदान को प्रोत्साहित करती है। नए उपयोगकर्ताओं के लिए प्रवेश बाधा को कम करने के लिए दस्तावेज़ीकरण, ट्यूटोरियल और पूर्व-संकलित मॉडल प्रदान किए जाते हैं। MLC LLM को कुशल अनुमान में प्रयोगों के लिए BAIR (Berkeley AI Research) और Stanford AI Lab के शोधकर्ताओं द्वारा अपनाया गया है, और यह विषम फ्लीट पर LLM परिनियोजित करने वाली कंपनियों के लिए एक व्यावहारिक उपकरण के रूप में कार्य करता है। इसका विकास Artificial intelligence समुदाय में अच्छी तरह से संसाधन वाले संगठनों से परे उन्नत मॉडलों तक पहुंच को लोकतांत्रिक बनाने के चल रहे प्रयासों के साथ संरेखित है।
ढांचा विकसित होता रहता है, नियमित अपडेट के साथ जो नए मॉडल आर्किटेक्चर और हार्डवेयर के लिए समर्थन जोड़ते हैं। हालांकि शुरू में अनुमान पर केंद्रित, तकनीकें प्रशिक्षण कार्यभार तक विस्तारित हो सकती हैं, हालांकि यह सक्रिय अनुसंधान का एक क्षेत्र बना हुआ है।
सीमाएं और भविष्य की दिशाएं
अपनी ताकत के बावजूद, MLC LLM चुनौतियों का सामना करता है, जिसमें संकलक इंजीनियरिंग की जटिलता शामिल है, जो कम तकनीकी उपयोगकर्ताओं को रोक सकती है। प्रदर्शन लाभ हार्डवेयर-निर्भर हैं और इष्टतम परिणामों के लिए संकलन फ्लैग के ट्यूनिंग की आवश्यकता हो सकती है। टीम पुराने उपकरणों या मालिकाना त्वरक के लिए संगतता मुद्दों को स्वीकार करती है जिनमें खुले ड्राइवरों की कमी है। भविष्य के काम का उद्देश्य प्रदर्शन ट्यूनिंग के स्वचालन में सुधार करना, Nokia Bell Labs-संबंधित चिप्स जैसे उभरते हार्डवेयर के लिए समर्थन का विस्तार करना और एज परिनियोजन ढांचे के साथ एकीकृत करना है। परियोजना की सफलता Deep learning पारिस्थितिकी तंत्र में निरंतर सहयोग और संकलक अनुसंधान में सतत निवेश पर निर्भर करेगी।