अंग्रेज़ी से अनुवादित

TensorRT, NVIDIA का SDK और रनटाइम है, जो प्रशिक्षित डीप लर्निंग मॉडल को NVIDIA GPUs पर उच्च-प्रदर्शन इन्फरेंस इंजन में अनुकूलित करने के लिए उपयोग किया जाता है, और यह PyTorch, TensorFlow, और ONNX जैसे फ्रेमवर्क का समर्थन करता है। इसमें कोर SDK, TensorRT-LLM, और TensorRT-RTX शामिल हैं।

TensorRT एक सॉफ्टवेयर डेवलपमेंट किट (SDK) और इन्फ्रेंस ऑप्टिमाइज़ेशन रनटाइम है जिसे Nvidia द्वारा ग्राफिक्स प्रोसेसिंग यूनिट्स (GPUs) पर प्रशिक्षित डीप लर्निंग और मशीन लर्निंग मॉडल तैनात करने के लिए विकसित किया गया है। यह PyTorch, TensorFlow, और ONNX जैसे फ्रेमवर्क से मॉडल आयात कर सकता है, और उन्हें कम-विलंबता और उच्च-थ्रूपुट इन्फ्रेंस के लिए अनुकूलित रनटाइम इंजन में संकलित कर सकता है। वर्तमान Nvidia दस्तावेज़ीकरण में, TensorRT नाम एक व्यापक उत्पाद परिवार को भी संदर्भित करता है जिसमें मुख्य TensorRT SDK, TensorRT-LLM, और TensorRT-RTX शामिल हैं।

मुख्य SDK मुख्य रूप से एक स्वामित्व वाला Nvidia उत्पाद है, हालांकि Nvidia Apache-लाइसेंस प्राप्त ओपन-सोर्स TensorRT रिपॉजिटरी और संबंधित सहयोगी परियोजनाओं को भी बनाए रखता है। TensorRT का उपयोग उत्पादन वातावरण में AI इन्फ्रेंस कार्यों के लिए व्यापक रूप से किया जाता है, कंप्यूटर विज़न से लेकर बड़े भाषा मॉडल तक, और यह Nvidia के डीप लर्निंग सॉफ्टवेयर स्टैक का एक प्रमुख घटक है।

इतिहास

TensorRT 2017 तक Nvidia के डीप लर्निंग सॉफ्टवेयर स्टैक के हिस्से के रूप में उपलब्ध था, जब इसे Nvidia GPUs पर प्रशिक्षित तंत्रिका नेटवर्क तैनात करने के लिए एक उच्च-प्रदर्शन इन्फ्रेंस इंजन के रूप में वर्णित किया गया था। 2018 में, Google ने TensorFlow 1.7 के साथ Nvidia TensorRT के एकीकरण की घोषणा की, और TensorRT को एक लाइब्रेरी के रूप में वर्णित किया जो इन्फ्रेंस के लिए डीप लर्निंग मॉडल को अनुकूलित करती है और उत्पादन वातावरण में GPUs पर तैनाती के लिए एक रनटाइम बनाती है। इस एकीकरण ने TensorRT को Nvidia हार्डवेयर पर मशीन लर्निंग इन्फ्रेंस के लिए एक मानक उपकरण बनाने की दिशा में एक प्रारंभिक कदम चिह्नित किया।

अवलोकन

TensorRT का मूल एक C++ लाइब्रेरी है जो एक प्रशिक्षित नेटवर्क, जिसमें एक नेटवर्क परिभाषा और प्रशिक्षित पैरामीटर शामिल होते हैं, को लेती है और Nvidia GPUs पर इन्फ्रेंस के लिए एक अत्यधिक अनुकूलित रनटाइम इंजन तैयार करती है। TensorRT C++ और Python दोनों APIs प्रदान करता है, और मॉडल या तो सीधे इसके नेटवर्क परिभाषा API के माध्यम से व्यक्त किए जा सकते हैं या इसके ONNX पार्सर के माध्यम से आयात किए जा सकते हैं। यह लचीलापन डेवलपर्स को विभिन्न डीप लर्निंग फ्रेमवर्क के मॉडल के साथ काम करने की अनुमति देता है।

Nvidia के दस्तावेज़ीकरण के अनुसार, TensorRT ग्राफ-स्तर और कर्नेल-स्तर अनुकूलन करता है जैसे कि लेयर फ्यूज़न और समर्थित संचालन के लिए कुशल कार्यान्वयन का चयन। ये अनुकूलन विलंबता को कम करते हैं और थ्रूपुट बढ़ाते हैं, जिससे TensorRT वास्तविक समय अनुप्रयोगों के लिए उपयुक्त हो जाता है। वर्तमान दस्तावेज़ीकरण गतिशील आकृतियों, FP32, FP16, BF16, FP8, और INT8 सहित मिश्रित-परिशुद्धता निष्पादन मोड, और ट्रांसफॉर्मर और बड़े भाषा मॉडल कार्यभार के लिए विशेष अनुकूलन के समर्थन का भी वर्णन करता है। इसमें प्रदर्शन को और बेहतर बनाने के लिए मॉडल प्रूनिंग और क्वांटाइज़ेशन जैसी तकनीकें शामिल हैं।

TensorRT इंजन TensorRT APIs या trtexec कमांड-लाइन उपयोगिता के माध्यम से उत्पन्न किए जा सकते हैं। Nvidia का क्विक-स्टार्ट दस्तावेज़ीकरण ONNX रूपांतरण, रनटाइम APIs, और C++ और Python अनुप्रयोगों के लिए सीधे इंजन डिसेरिएलाइज़ेशन पर आधारित तैनाती वर्कफ़्लो का वर्णन करता है। ये वर्कफ़्लो उत्पादन प्रणालियों में निर्बाध एकीकरण सक्षम करते हैं, अक्सर Amazon Web Services या Google Cloud जैसी क्लाउड सेवाओं के साथ संयोजन में।

लाइसेंसिंग और ओपन-सोर्स घटक

TensorRT के आसपास का लाइसेंसिंग मॉडल एक स्वामित्व वाले मुख्य SDK और ओपन-सोर्स रिपॉजिटरी और उपकरणों के एक सेट के बीच विभाजित है। Nvidia द्वारा वितरित पैकेज्ड TensorRT सॉफ्टवेयर Nvidia सॉफ्टवेयर लाइसेंस समझौते द्वारा शासित है। साथ ही, Nvidia GitHub पर Apache लाइसेंस 2.0 के तहत एक सार्वजनिक TensorRT रिपॉजिटरी बनाए रखता है, जो कुछ घटकों के लिए सामुदायिक योगदान और पारदर्शिता की अनुमति देता है।

आधिकारिक TensorRT दस्तावेज़ीकरण उपयोगकर्ताओं को क्विक-स्टार्ट कोड और नमूनों के लिए TensorRT ओपन-सोर्स सॉफ्टवेयर रिपॉजिटरी की ओर भी निर्देशित करता है। आर्किटेक्चर दस्तावेज़ीकरण डिबगिंग और कॉन्स्टेंट फोल्डिंग के लिए Polygraphy, साथ ही TensorRT के साथ तैनाती से पहले ONNX ग्राफ़ को संशोधित करने के लिए ONNX-GraphSurgeon जैसे संबंधित उपकरणों का वर्णन करता है। TensorRT कस्टम लेयर और असमर्थित संचालन के लिए एक प्लगइन तंत्र का भी समर्थन करता है, जिससे डेवलपर्स विशेष आवश्यकताओं के लिए इसकी कार्यक्षमता का विस्तार कर सकते हैं।

उत्पाद परिवार

Nvidia का वर्तमान दस्तावेज़ीकरण TensorRT नाम के तहत कई इन्फ्रेंस उत्पादों को समूहित करता है। उस दस्तावेज़ीकरण में, मुख्य SDK को TensorRT (एंटरप्राइज़) के रूप में प्रतिष्ठित किया गया है, जबकि संबंधित पेशकशों में बड़े भाषा मॉडल इन्फ्रेंस के लिए TensorRT-LLM और उपभोक्ता RTX GPUs के लिए TensorRT-RTX शामिल हैं। यह परिवार दृष्टिकोण AI कार्यभार और हार्डवेयर लक्ष्यों की बढ़ती विविधता को दर्शाता है।

TensorRT-LLM

TensorRT-LLM Nvidia GPUs पर बड़े भाषा मॉडल को अनुकूलित करने और सेवा देने के लिए एक संबंधित ओपन-सोर्स टूलकिट है। Nvidia इसे LLM परिभाषित करने और LLM कार्यभार के लिए अनुकूलित TensorRT इंजन बनाने के लिए एक Python API प्रदान करने के रूप में वर्णित करता है। यह टूलकिट जनरेटिव AI मॉडल की अनूठी चुनौतियों का समाधान करने के लिए डिज़ाइन किया गया है, जिन्हें उच्च मेमोरी बैंडविड्थ और कुशल ध्यान तंत्र की आवश्यकता होती है।

Nvidia के उत्पाद-परिवार दस्तावेज़ीकरण के अनुसार, TensorRT-LLM मल्टी-GPU और मल्टी-नोड निष्पादन, इन-फ्लाइट बैचिंग, पेज्ड KV कैशिंग, और उच्च-थ्रूपुट मॉडल सेवा के लिए FP8, INT8, और INT4 जैसी क्वांटाइज़ेशन विधियों का समर्थन करता है। ये सुविधाएँ OpenAI या Anthropic जैसे मॉडलों की उत्पादन में कुशल तैनाती सक्षम करती हैं। TensorRT-LLM कोडबेस Apache लाइसेंस 2.0 के तहत GitHub पर प्रकाशित है, जो डेवलपर्स के समुदाय को बढ़ावा देता है।

क्योंकि Nvidia TensorRT-LLM को TensorRT उत्पाद परिवार के एक अलग सदस्य के रूप में दस्तावेजित करता है, इसे आमतौर पर बेस TensorRT SDK की एकल विशेषता के बजाय एक संबंधित लेकिन अलग सॉफ्टवेयर परियोजना के रूप में माना जाता है। यह भेद पारंपरिक तंत्रिका नेटवर्क से भिन्न प्रदर्शन विशेषताओं वाले बड़े भाषा मॉडल के लिए केंद्रित विकास और अनुकूलन की अनुमति देता है।

यह भी देखें

  • llama.cpp
  • SGLang
  • vLLM
  • ओपन-सोर्स आर्टिफिशियल इंटेलिजेंस सॉफ्टवेयर की सूचियाँ
  • डीप लर्निंग सॉफ्टवेयर की तुलना
  • मशीन लर्निंग सॉफ्टवेयर की तुलना
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:nvidia·inference·deep-learning·gpu
इस पृष्ठ को अंतिम बार संपादित किया गया 13 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास