अंग्रेज़ी से अनुवादित

GGML एक ओपन-सोर्स टेंसर लाइब्रेरी है जो मशीन लर्निंग के लिए है, जिसे उपभोक्ता हार्डवेयर पर कुशल अनुमान के लिए डिज़ाइन किया गया है। इसे llama.cpp के साथ सह-विकसित किया गया है, जो बड़े भाषा मॉडल को स्थानीय रूप से चलाने के लिए व्यापक रूप से उपयोग किया जाने वाला एक उपकरण है।

GGML एक सामान्य-उद्देश्यीय टेंसर लाइब्रेरी है जो C में लिखी गई है, जिसे मशीन लर्निंग अनुप्रयोगों के लिए डिज़ाइन किया गया है, जिसमें उपभोक्ता हार्डवेयर पर कुशल निष्पादन पर ध्यान केंद्रित किया गया है। इसे जॉर्जी गेरगानोव द्वारा बनाया गया था और इसे llama.cpp के साथ सह-विकसित किया गया है, जो एक ओपन-सोर्स सॉफ्टवेयर लाइब्रेरी है जो मेटा के Llama जैसे विभिन्न बड़े भाषा मॉडलों पर अनुमान लगाती है। GGML अंतर्निहित टेंसर संचालन और हार्डवेयर बैकएंड प्रदान करता है जो llama.cpp को मॉडलों को CPU, GPU और अन्य एक्सेलेरेटर पर चलाने में सक्षम बनाता है, जिससे स्थानीय AI अनुमान व्यापक दर्शकों के लिए सुलभ हो जाता है।

लाइब्रेरी सख्त मेमोरी प्रबंधन और मल्टी-थ्रेडिंग पर जोर देती है, जो इसे समर्पित ग्राफिक्स कार्ड के बिना सिस्टम पर भी उच्च प्रदर्शन प्राप्त करने की अनुमति देती है। GGML स्थानीय AI पारिस्थितिकी तंत्र में एक मौलिक घटक बन गया है, जिसमें llama.cpp को स्थानीय अनुमान उपकरणों के लिए वास्तविक मानक माना जाता है, जिसमें Ollama और LM Studio जैसे लोकप्रिय अनुप्रयोग शामिल हैं।

पृष्ठभूमि

जॉर्जी गेरगानोव ने सितंबर 2022 के अंत में GGML लाइब्रेरी पर काम शुरू किया, जो फैब्रीस बेलार्ड के LibNC पर काम से प्रेरणा लेते हुए। GGML से पहले, गेरगानोव ने whisper.cpp विकसित किया, जो एक समान लाइब्रेरी थी जो OpenAI के Whisper स्पीच-टू-टेक्स्ट मॉडल को लागू करती थी। इस पहले प्रोजेक्ट ने डिज़ाइन सिद्धांतों और तकनीकी दृष्टिकोण की नींव रखी जो बाद में GGML और llama.cpp पर लागू की गई।

विकास

llama.cpp ने मार्च 2023 में विकास शुरू किया, जो बिना किसी बाहरी निर्भरता के Llama अनुमान कोड का एक शुद्ध C/C++ कार्यान्वयन था। प्रोजेक्ट का उद्देश्य GPU या अन्य समर्पित हार्डवेयर के बिना कंप्यूटरों पर प्रदर्शन में सुधार करना था, और यह सीमित हार्डवेयर क्षमताओं वाले उपयोगकर्ताओं के बीच जल्दी से लोकप्रिय हो गया। शुरू में CPU के लिए डिज़ाइन किया गया, llama.cpp ने बाद में GPU और NPU के लिए समर्थन जोड़ा। मई 2026 तक, प्रोजेक्ट के GitHub पर 109,000 से अधिक स्टार हैं।

प्रमुख मील के पत्थर में 30 अप्रैल 2024 को FlashAttention की शुरुआत शामिल है, जिसने ध्यान गणना दक्षता में काफी सुधार किया। 10 अप्रैल 2025 को, libmtmd पेश किया गया, जिसने मल्टीमॉडल मॉडलों के लिए समर्थन को पुनर्जीवित किया। 17 दिसंबर 2025 को, एक नए GUI बाइंडिंग के माध्यम से Android और ChromeOS उपकरणों पर पूर्ण त्वरण सक्षम किया गया, जिससे पिछले क्रॉस-कंपाइलिंग और CLI दृष्टिकोण से परे देशी ऐप विकास की अनुमति मिली।

वास्तुकला

llama.cpp कई हार्डवेयर लक्ष्यों का समर्थन करता है, जिसमें x86, ARM, Metal, BLAS, BLIS, zDNN, ZenDNN, SYCL, MUSA, CUDA, HIP, CANN, OpenCL, RPC और Vulkan (संस्करण 1.2 या अधिक) शामिल हैं। ये बैकएंड GGML टेंसर लाइब्रेरी बनाते हैं, जिसका उपयोग मॉडल-विशिष्ट llama.cpp फ्रंटएंड द्वारा किया जाता है। लाइब्रेरी अनुकूलन के लिए CPU एक्सटेंशन का लाभ उठाती है: x86-64 के लिए AVX, AVX2, AVX-512, AVX-VNNI और AMX; AArch64 के लिए Neon, i8MM, SVE, SVE2, SME और SME2; और S390x के लिए VXE2। Apple सिलिकॉन प्रोजेक्ट के लिए एक महत्वपूर्ण लक्ष्य है।

GGML एज अनुमान के उद्देश्य से सुविधाओं का समर्थन करता है, जिसमें समय से पहले मॉडल क्वांटाइजेशन, ऑन-द-फ्लाई KV-कैश क्वांटाइजेशन, स्पेकुलेटिव डिकोडिंग और सिस्टम RAM में मॉडल परतों का आंशिक ऑफलोडिंग शामिल है, जिससे उपकरणों को GPU VRAM क्षमता से अधिक मॉडल लोड करने में सक्षम बनाता है। फ्रंटएंड संचार के लिए, llama.cpp OpenAI-संगत एंडपॉइंट जैसे v1/chat/completions और JSON के रूप में व्याकरण-आधारित आउटपुट स्वरूपण प्रदान करता है।

GGUF फ़ाइल प्रारूप

GGUF (GGML यूनिवर्सल फ़ाइल) प्रारूप एक बाइनरी प्रारूप है जो टेंसर और मेटाडेटा दोनों को एक ही फ़ाइल में संग्रहीत करता है, जिसे मॉडल डेटा के तेज़ सेविंग और लोडिंग के लिए डिज़ाइन किया गया है। अगस्त 2023 में llama.cpp प्रोजेक्ट द्वारा पेश किया गया, GGUF को अतिरिक्त मॉडल वास्तुकलाओं के लिए समर्थन जोड़े जाने पर पिछड़ी संगतता बनाए रखने के लिए बनाया गया था। इसने GGML जैसे पहले के प्रारूपों को प्रतिस्थापित किया और आमतौर पर PyTorch जैसी अन्य मशीन लर्निंग लाइब्रेरी से मॉडलों को परिवर्तित करके उत्पादित किया जाता है।

डिज़ाइन

GGUF क्वांटाइजेशन पर केंद्रित है, जो मेमोरी उपयोग को कम करने और गति बढ़ाने के लिए मॉडल वजन की सटीकता को कम करता है, कुछ सटीकता की कीमत पर। यह 2-बिट से 8-बिट क्वांटाइज्ड पूर्णांक प्रकार, float32, float16 और bfloat16 जैसे सामान्य फ्लोटिंग-पॉइंट प्रारूप और 1.58-बिट क्वांटाइजेशन का समर्थन करता है। प्रारूप में GPT-जैसे भाषा मॉडल चलाने के लिए आवश्यक जानकारी शामिल है, जैसे टोकनाइज़र शब्दावली, संदर्भ लंबाई, टेंसर जानकारी और अन्य विशेषताएं।

मॉडल

llama.cpp बड़े भाषा मॉडलों की एक विस्तृत श्रृंखला का समर्थन करता है, जिसमें Llama, Mistral, Gemma, DeepSeek, gpt-oss, Phi और Qwen शामिल हैं। इस व्यापक संगतता ने GGML और llama.cpp को स्थानीय हार्डवेयर पर बड़े भाषा मॉडल के साथ काम करने वाले डेवलपर्स और शोधकर्ताओं के लिए आवश्यक उपकरण बना दिया है।

यह भी देखें

  • Ollama - LLM को स्थानीय रूप से चलाने के लिए एक उपकरण
  • LM Studio - स्थानीय LLM इंटरैक्शन के लिए डेस्कटॉप अनुप्रयोग
  • vLLM - उच्च-प्रदर्शन अनुमान इंजन
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:machine-learning·tensor-library·open-source·llm-inference
इस पृष्ठ को अंतिम बार संपादित किया गया 9 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास