NVLink-C2C एक चिप-से-चिप इंटरकनेक्ट है जिसे NVIDIA द्वारा एक ही सिस्टम के भीतर प्रोसेसर, GPU और अन्य एक्सेलेरेटर को जोड़ने के लिए विकसित किया गया है। यह NVLink प्रोटोकॉल पर आधारित है, जिसे पहली बार मार्च 2014 में वायर-आधारित सीरियल, मल्टी-लेन, निकट-रेंज संचार लिंक के रूप में घोषित किया गया था। PCI Express के विपरीत, NVLink उपकरणों को कई लिंक और मेश नेटवर्किंग का उपयोग करने की अनुमति देता है, जिससे केंद्रीय हब के बिना सीधे पीयर-टू-पीयर संचार संभव होता है। NVLink-C2C इस तकनीक का विस्तार करता है ताकि विभिन्न प्रकार के चिप्स, जैसे कि CPU और GPU, या एक कसकर युग्मित सिस्टम में कई GPU के बीच उच्च-बैंडविड्थ, कम-विलंबता कनेक्शन प्रदान किया जा सके। यह इंटरकनेक्ट आधुनिक AI और मशीन लर्निंग वर्कलोड के लिए महत्वपूर्ण है, जहां कंप्यूट तत्वों के बीच विशाल डेटा स्थानांतरण की आवश्यकता होती है।
NVLink-C2C सुसंगत मेमोरी साझाकरण का समर्थन करता है, जिससे जुड़े उपकरणों को एकीकृत मेमोरी स्पेस तक पहुंच मिलती है। यह प्रोग्रामिंग को सरल बनाता है और डेटा दोहराव को कम करता है, जिससे डीप लर्निंग और बड़े भाषा मॉडल जैसे अनुप्रयोगों के लिए प्रदर्शन में सुधार होता है। यह तकनीक NVIDIA के Grace CPU और Hopper GPU आर्किटेक्चर में उपयोग की जाती है, जिससे Grace Hopper Superchip जैसे सिस्टम सक्षम होते हैं, जो त्वरित कंप्यूटिंग के लिए NVLink-C2C पर CPU और GPU को जोड़ता है।
तकनीकी विशिष्टताएँ
NVLink-C2C NVLink की भौतिक परत का लाभ उठाता है, जो संस्करण 1.0, 2.0 और 3.0+ के लिए क्रमशः 20, 25 और 50 Gbit/s प्रति डिफरेंशियल पेयर की डेटा दरों के साथ पॉइंट-टू-पॉइंट कनेक्शन निर्दिष्ट करता है। NVLink 1.0 और 2.0 के लिए, आठ डिफरेंशियल पेयर एक सब-लिंक बनाते हैं, और दो सब-लिंक (प्रत्येक दिशा के लिए एक) एक लिंक बनाते हैं। NVLink 3.0 से शुरू करके, केवल चार डिफरेंशियल पेयर एक सब-लिंक बनाते हैं। NVLink 2.0 और उच्चतर के लिए प्रति सब-लिंक कुल डेटा दर 25 GB/s है, और प्रति लिंक कुल 50 GB/s है। NVLink-C2C समान उच्च-गति सिग्नलिंग का उपयोग करता है लेकिन अलग मॉड्यूल के बीच के बजाय पैकेज या बोर्ड के भीतर चिप-से-चिप कनेक्शन के लिए अनुकूलित है।
उदाहरण के लिए, Grace CPU में 18 NVLink-C2C लिंक हैं, जो Hopper GPU को 900 GB/s तक की द्विदिश बैंडविड्थ प्रदान करते हैं। यह उच्च बैंडविड्थ जनरेटिव AI और ट्रांसफॉर्मर मॉडल के लिए कुशल डेटा संचलन सक्षम करता है, जिन्हें बड़े मेमोरी फुटप्रिंट और कंप्यूट इकाइयों के बीच लगातार संचार की आवश्यकता होती है।
आर्किटेक्चर और डिज़ाइन
NVLink-C2C को विभिन्न टोपोलॉजी का समर्थन करने के लिए डिज़ाइन किया गया है, जिसमें पॉइंट-टू-पॉइंट, मेश और स्विच-आधारित कनेक्शन शामिल हैं। कम संख्या में उपकरणों के लिए, प्रत्यक्ष लिंक सभी-से-सभी कनेक्टिविटी प्रदान करते हैं। बड़े सिस्टम के लिए, NVLink स्विच (2018 में पेश किए गए) पैकेट-स्विच्ड आर्किटेक्चर का उपयोग करते हैं, जिसमें प्रत्येक स्विच 32 दो-लेन पोर्ट तक का समर्थन करता है। NVLink 4.0 के लिए NVSwitch में SHARP एक्सेलेरेटर शामिल है, जो नेटवर्क में योग और ब्रॉडकास्ट जैसी सरल गणनाएँ कर सकता है, जिससे संचार ओवरहेड कम होता है।
NVLink-C2C में विश्वसनीयता और बिजली दक्षता के लिए सुविधाएँ भी शामिल हैं। यह PCI Express 3.0 और उच्चतर के समान 128b/130b लाइन कोड का उपयोग करता है, जो पुराने एन्कोडिंग योजनाओं की तुलना में ओवरहेड को कम करता है। भौतिक परत में लिंक नियंत्रण वर्ण और लेनदेन हेडर शामिल हैं, जो कुछ ओवरहेड जोड़ते हैं, लेकिन बेंचमार्क दिखाते हैं कि प्राप्त करने योग्य स्थानांतरण दर सैद्धांतिक अधिकतम का लगभग 90-95% है। उदाहरण के लिए, P100 GPU के लिए 40 Gbit/s NVLink कनेक्शन ने वास्तविक दुनिया के परीक्षणों में लगभग 35.3 Gbit/s प्राप्त किया।
अनुप्रयोग और उपयोग के मामले
NVLink-C2C मुख्य रूप से उच्च-प्रदर्शन कंप्यूटिंग और AI डेटा केंद्रों में उपयोग किया जाता है। यह NVIDIA के DGX सिस्टम का एक प्रमुख घटक है, जो बड़े मॉडलों के प्रशिक्षण और अनुमान के लिए कई GPU को एकीकृत करता है। यह इंटरकनेक्ट Grace Hopper Superchip में भी उपयोग किया जाता है, जो 72-कोर Grace CPU को H100 GPU के साथ जोड़ता है, जिससे उनके बीच 900 GB/s तक की बैंडविड्थ मिलती है। यह डिज़ाइन विशेष रूप से मेमोरी-बाउंड वर्कलोड के लिए प्रभावी है, जैसे कि तंत्रिका नेटवर्क और बड़े भाषा मॉडल, जहां डेटा स्थानांतरण गति एक बाधा है।
AI के अलावा, NVLink-C2C वैज्ञानिक कंप्यूटिंग में उपयोग किया जाता है, जहां सिमुलेशन और डेटा विश्लेषण के लिए उच्च-थ्रूपुट संचार की आवश्यकता होती है। यह तकनीक क्लाउड प्रदाताओं जैसे Amazon Web Services और Google Cloud द्वारा उनके AI बुनियादी ढांचे के लिए भी अपनाई जा रही है, साथ ही TSMC-निर्मित चिप्स में AMD और Intel के सिस्टम में जो विषम कंप्यूटिंग के लिए NVLink-C2C शामिल करते हैं।
अन्य इंटरकनेक्ट के साथ तुलना
NVLink-C2C PCI Express, CXL और InfiniBand जैसे अन्य उच्च-गति इंटरकनेक्ट के साथ प्रतिस्पर्धा करता है। PCIe की तुलना में, NVLink-C2C उच्च बैंडविड्थ और कम विलंबता प्रदान करता है, क्योंकि यह परिधीय विस्तार के बजाय विशेष रूप से चिप-से-चिप संचार के लिए डिज़ाइन किया गया है। उदाहरण के लिए, PCIe 5.0 प्रति लेन 32 GT/s प्रदान करता है, जबकि NVLink 4.0 प्रति डिफरेंशियल पेयर 50 Gbit/s प्रदान करता है, और अधिक लिंक के साथ, कुल बैंडविड्थ काफी अधिक है। CXL, जो PCIe पर आधारित है, कैश-सुसंगत मेमोरी साझाकरण का समर्थन करता है लेकिन आमतौर पर NVLink-C2C की तुलना में कम बैंडविड्थ होती है।
NVLink-C2C InfiniBand जैसे नेटवर्क इंटरकनेक्ट से भी भिन्न है, जो सिस्टम-से-सिस्टम संचार के लिए उपयोग किए जाते हैं। NVLink-C2C इंट्रा-सिस्टम कनेक्शन के लिए है, जो नेटवर्क समाधानों की तुलना में कम विलंबता और उच्च बैंडविड्थ प्रदान करता है। यह इसे एक ही सर्वर या रैक में कसकर युग्मित कंप्यूट नोड्स के लिए आदर्श बनाता है।
भविष्य के विकास
NVIDIA NVLink तकनीक को विकसित करना जारी रखता है। NVLink 6, जो Vera Rubin NVL72 प्लेटफ़ॉर्म में उपयोग किया जाता है, प्रति GPU 3.6 TB/s द्विदिश बैंडविड्थ प्रदान करता है। एक NVL72 रैक 260 TB/s कुल स्केल-अप बैंडविड्थ देने के लिए नौ NVLink 6 स्विच का उपयोग करता है। इन प्रगतियों से और भी बड़े AI मॉडल और अधिक जटिल सिमुलेशन का समर्थन करने की उम्मीद है, जिससे उद्योग में NVLink-C2C की अग्रणी चिप-से-चिप इंटरकनेक्ट के रूप में स्थिति बनी रहेगी।
2025 तक, NVLink-C2C AI बुनियादी ढांचे के लिए एक महत्वपूर्ण सक्षमकर्ता है, और इसका अपनाना AWS, Azure और Oracle Cloud पेशकशों में बढ़ रहा है। यह तकनीक एज डिवाइस और ऑटोमोटिव अनुप्रयोगों में उपयोग के लिए भी खोजी जा रही है, जहां उच्च-बैंडविड्थ, कम-बिजली इंटरकनेक्ट आवश्यक हैं।