अंग्रेज़ी से अनुवादित

llama.cpp एक ओपन-सोर्स C++ लाइब्रेरी है जो बड़े भाषा मॉडलों के कुशल अनुमान के लिए है, मुख्य रूप से CPU हार्डवेयर पर, और GGML टेंसर लाइब्रेरी के साथ सह-विकसित की गई है। यह स्थानीय LLM अनुमान उपकरणों के लिए वास्तविक मानक बन गई है।

llama.cpp एक ओपन-सोर्स सॉफ्टवेयर लाइब्रेरी है जो विभिन्न बड़े भाषा मॉडल जैसे कि Meta के Llama मॉडल पर अनुमान लगाता है। इसे GGML परियोजना के साथ सह-विकसित किया गया है, जो C में लिखी गई एक सामान्य-उद्देश्य टेंसर लाइब्रेरी है। यह लाइब्रेरी समर्पित GPU के बिना कंप्यूटरों पर कुशल निष्पादन पर केंद्रित है, जिससे मशीन-लर्निंग मॉडल मानक हार्डवेयर पर सुलभ हो जाते हैं।

इस परियोजना में कमांड-लाइन उपकरण और एक सरल वेब इंटरफेस वाला सर्वर शामिल है। यह लगभग सभी स्थानीय अनुमान उपकरणों, जिनमें Ollama और LM Studio शामिल हैं, के मूल के रूप में वास्तविक मानक बन गया है, जिससे उपयोगकर्ता अपने स्वयं के उपकरणों पर जनरेटिव एआई मॉडल चला सकते हैं।

पृष्ठभूमि

सितंबर 2022 के अंत में, जॉर्जियाई डेवलपर Georgi Gerganov ने GGML लाइब्रेरी पर काम शुरू किया, जो टेंसर बीजगणित को लागू करने वाली एक C लाइब्रेरी है। Gerganov ने GGML को सख्त मेमोरी प्रबंधन और मल्टी-थ्रेडिंग को प्राथमिक लक्ष्यों के रूप में डिज़ाइन किया। यह निर्माण Fabrice Bellard के LibNC पर काम से प्रेरित था, जो टेंसर गणनाओं के लिए एक C लाइब्रेरी है।

llama.cpp शुरू करने से पहले, Gerganov ने whisper.cpp नामक एक समान लाइब्रेरी विकसित की थी, जो OpenAI द्वारा बनाए गए स्पीच-टू-टेक्स्ट मॉडल Whisper को लागू करती थी। इस पूर्व परियोजना ने निम्न-स्तरीय भाषाओं में कुशल मॉडल अनुमान के लिए उनका दृष्टिकोण स्थापित किया।

विकास

llama.cpp का विकास मार्च 2023 में शुरू हुआ, जो बिना किसी बाहरी निर्भरता के शुद्ध C/C++ में Llama अनुमान कोड के कार्यान्वयन के रूप में था। इस दृष्टिकोण ने GPU या अन्य विशेष हार्डवेयर के बिना कंप्यूटरों पर प्रदर्शन में सुधार किया, जो परियोजना का प्राथमिक लक्ष्य था। यह समर्पित हार्डवेयर की कमी वाले उपयोगकर्ताओं के बीच तेजी से प्रमुख हो गया, क्योंकि यह अकेले केंद्रीय प्रोसेसिंग यूनिट (CPU) पर चल सकता था।

जबकि शुरू में CPU के लिए डिज़ाइन किया गया था, GPU और न्यूरल प्रोसेसिंग यूनिट (NPU) बैकएंड के लिए समर्थन बाद में जोड़ा गया। मई 2026 तक, परियोजना के GitHub पर 109,000 से अधिक स्टार हैं, जो इसके व्यापक अपनाने को दर्शाता है।

प्रमुख विकास मील के पत्थरों में शामिल हैं: FlashAttention को 30 अप्रैल 2024 को पेश किया गया, जिससे ध्यान तंत्र की दक्षता में सुधार हुआ। 10 अप्रैल 2025 को, libmtmd को पेश किया गया, जिससे मल्टीमॉडल मॉडलों के लिए समर्थन को पुनर्जीवित किया गया जो पहले स्थिर था। 17 दिसंबर 2025 को, एक नए GUI बाइंडिंग के माध्यम से Android और ChromeOS उपकरणों पर पूर्ण त्वरण पेश किया गया, जिससे पिछले क्रॉस-कंपाइलिंग और adb शेल में कमांड-लाइन इंटरफेस चलाने से परे देशी ऐप विकास की अनुमति मिली।

वास्तुकला

llama.cpp कई हार्डवेयर लक्ष्यों का समर्थन करता है, जिनमें x86, ARM, Metal, BLAS, BLIS, zDNN, ZenDNN, SYCL, MUSA, CUDA, HIP, CANN, OpenCL, RPC, और Vulkan संस्करण 1.2 या उससे अधिक शामिल हैं। ये बैकएंड GGML टेंसर लाइब्रेरी का हिस्सा हैं, जिसका उपयोग फ्रंट-एंड मॉडल-विशिष्ट llama.cpp कोड द्वारा किया जाता है।

लाइब्रेरी अनुकूलन के लिए कई CPU एक्सटेंशन का उपयोग करती है। x86-64 के लिए, यह AVX, AVX2, AVX-512, AVX-VNNI, और AMX निर्देश सेट का उपयोग करती है। AArch64 (ARM64) के लिए, यह NEON, i8MM, SVE, SVE2, SME, और SME2 का उपयोग करती है। s390x के लिए, यह Vector Enhancement Facility 2 (VXE2) का उपयोग करती है। Apple silicon परियोजना के लिए एक महत्वपूर्ण लक्ष्य है।

कई सुविधाएँ एज डिवाइसों पर अनुमान को लक्षित करती हैं। इनमें समय-पूर्व मॉडल क्वांटाइजेशन, ऑन-द-फ्लाई की-वैल्यू (kv) कैश क्वांटाइजेशन, सट्टा डिकोडिंग, और मॉडल परतों का सिस्टम RAM में आंशिक ऑफलोडिंग शामिल हैं। बाद वाला उपकरणों को ऐसे मॉडल लोड करने की अनुमति देता है जो अन्यथा पूरी तरह से GPU VRAM में फिट होने के लिए बहुत बड़े होते हैं।

फ्रंटएंड संचार के लिए, llama.cpp OpenAI-संगत एंडपॉइंट जैसे v1/chat/completions प्रदान करता है और JSON के रूप में व्याकरण-आधारित आउटपुट स्वरूपण का समर्थन करता है। यह क्लाउड सेवाओं को लाइब्रेरी के साथ एकीकृत करने में सक्षम बनाता है।

GGUF फ़ाइल प्रारूप

GGUF (GGML Universal File) प्रारूप एक बाइनरी प्रारूप है जो टेंसर और मेटाडेटा दोनों को एक ही फ़ाइल में संग्रहीत करता है, जिसे मॉडल डेटा की तेज़ सेविंग और लोडिंग के लिए डिज़ाइन किया गया है। इसे अगस्त 2023 में परियोजना टीम द्वारा पेश किया गया था ताकि अन्य मॉडल आर्किटेक्चर के लिए समर्थन जोड़े जाने पर पिछड़ी संगतता बनाए रखी जा सके।

GGUF ने पिछले GGML प्रारूप को प्रतिस्थापित किया और आमतौर पर PyTorch जैसी अन्य मशीन-लर्निंग लाइब्रेरीज़ के साथ विकसित मॉडलों को परिवर्तित करके उत्पादित किया जाता है। प्रारूप क्वांटाइजेशन पर केंद्रित है, जो मॉडल भार में परिशुद्धता को कम करने की क्रिया है। क्वांटाइजेशन मेमोरी उपयोग को कम करता है और गति बढ़ाता है, हालांकि मॉडल सटीकता में कमी की कीमत पर।

GGUF 2-बिट से 8-बिट क्वांटाइज़्ड पूर्णांक प्रकार, सामान्य फ्लोटिंग-पॉइंट डेटा प्रारूप जैसे float32, float16, और bfloat16, और 1.58-बिट क्वांटाइजेशन का समर्थन करता है। इसमें टोकनाइज़र शब्दावली, संदर्भ लंबाई, टेंसर जानकारी, और GPT-जैसे भाषा मॉडल के लिए आवश्यक अन्य विशेषताएँ शामिल हैं।

बाइट-स्तरीय संरचना लिटिल-एंडियन क्रम का उपयोग करती है, जो मेटाडेटा ब्लॉक और टेंसर जानकारी ब्लॉक में विभाजित है। यह संरचना गतिशील भंडारण से और उसके लिए कुशल क्रमबद्धता को सक्षम बनाती है।

मॉडल

llama.cpp कई बड़े भाषा मॉडलों का समर्थन करता है, जिनमें Llama, Mistral, Gemma, DeepSeek, gpt-oss, Phi, और Qwen शामिल हैं। यह विविधता इसे विभिन्न कृत्रिम बुद्धिमत्ता उपयोग मामलों के लिए एक लचीला समाधान बनाती है, चैट अनुप्रयोगों से लेकर अधिक विशिष्ट कार्यों तक।

Ollama और LM Studio जैसे सामुदायिक उपकरण इस परियोजना पर बनाए गए हैं, और यह अक्सर स्थानीय बुनियादी ढांचे पर Anthropic जैसे मालिकाना पारिस्थितिकी तंत्र का उपयोग करता है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:machine-learning·large-language-models·open-source-software·cpu
इस पृष्ठ को अंतिम बार संपादित किया गया 9 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास