AMD Instinct, AMD द्वारा विकसित डेटा सेंटर ग्राफिक्स प्रोसेसिंग यूनिट्स (GPUs) का एक ब्रांड है। 2016 में FirePro S लाइन के प्रतिस्थापन के रूप में पेश किया गया, Instinct उत्पाद परिवार डीप लर्निंग, आर्टिफिशियल इंटेलिजेंस वर्कलोड और हाई-परफॉर्मेंस कंप्यूटिंग (HPC) अनुप्रयोगों को तेज करने के लिए डिज़ाइन किया गया है। AMD के Radeon ब्रांड के विपरीत, जो उपभोक्ता और गेमिंग बाजारों को लक्षित करता है, Instinct कार्ड न्यूरल नेटवर्क प्रशिक्षण और बड़े पैमाने पर वैज्ञानिक सिमुलेशन चलाने जैसे कंप्यूट-गहन कार्यों के लिए अनुकूलित हैं। यह ब्रांड सीधे Nvidia के डेटा सेंटर GPU पेशकशों और Intel के Xeon Phi और Data Center GPU लाइनों से प्रतिस्पर्धा करता है।
उत्पाद लाइन को मूल रूप से AMD Radeon Instinct के रूप में विपणन किया गया था, लेकिन नवंबर 2020 में MI100 के लॉन्च से पहले AMD ने Radeon ब्रांडिंग हटा दी। तब से, Instinct श्रृंखला कई आर्किटेक्चर के माध्यम से विकसित हुई है, जिसमें जनरेटिव AI और मशीन लर्निंग की बढ़ती मांगों को संबोधित करने के लिए उन्नत पैकेजिंग और मेमोरी तकनीकों को शामिल किया गया है। 2023 तक, Instinct GPUs का उपयोग करने वाले AMD-आधारित सुपरकंप्यूटरों ने वैश्विक प्रदर्शन और दक्षता रैंकिंग पर अग्रणी स्थान हासिल किए हैं।
प्रारंभिक उत्पाद (2016-2017)
AMD ने 12 दिसंबर, 2016 को पहले तीन Radeon Instinct उत्पादों की घोषणा की और उन्हें 20 जून, 2017 को जारी किया। प्रत्येक कार्ड एक अलग GPU आर्किटेक्चर पर आधारित था, जो कंप्यूट बाजार के विभिन्न क्षेत्रों को लक्षित करता था।
MI6
MI6 ने 16 GB GDDR5 मेमोरी और 150 W से कम थर्मल डिज़ाइन पावर (TDP) के साथ Polaris 10 चिप का उपयोग किया। इसने FP16 और FP32 प्रदर्शन के 5.7 TFLOPS प्रदान किए, जिससे यह मुख्य रूप से प्रशिक्षण के बजाय अनुमान कार्यों के लिए उपयुक्त था। इसकी पीक डबल-प्रिसिजन (FP64) प्रदर्शन 358 GFLOPS थी। कार्ड निष्क्रिय रूप से ठंडा किया गया था, जो इसके कम-पावर डिज़ाइन को दर्शाता है।
MI8
MI8 Fiji आर्किटेक्चर पर आधारित था, जो Radeon R9 Nano के समान था, जिसका TDP 175 W से कम था। इसमें 4 GB हाई बैंडविड्थ मेमोरी (HBM) थी और FP16 और FP32 में 8.2 TFLOPS हासिल किए। MI6 की तरह, यह अनुमान वर्कलोड की ओर उन्मुख था, जिसकी पीक FP64 प्रदर्शन 512 GFLOPS थी।
MI25
MI25 ने HBM2 मेमोरी के साथ Vega आर्किटेक्चर का उपयोग किया। इसने FP32 में 12.3 TFLOPS प्रदान किए और कम-प्रिसिजन अंकगणित का लाभ उठाकर FP16 में 24.6 TFLOPS तक पहुंच सकता था। कार्ड का TDP 300 W से कम था जिसमें निष्क्रिय कूलिंग थी और FP32 दर के सोलहवें हिस्से पर 768 GFLOPS की पीक FP64 प्रदर्शन की पेशकश की। MI25 को प्रशिक्षण और अनुमान दोनों के लिए स्थान दिया गया था, जो Vega आर्किटेक्चर की बेहतर कंप्यूट क्षमताओं से लाभान्वित हुआ।
MI50 और MI60 (Vega 20)
Graphics Core Next (GCN) 5 आर्किटेक्चर के Vega 20 वेरिएंट पर आधारित MI50 और MI60, Radeon ब्रांडिंग ले जाने वाले अंतिम Instinct कार्ड के रूप में पेश किए गए थे। उन्होंने आधी-दर FP64 प्रदर्शन का समर्थन किया, जो पहले के मॉडलों की तुलना में एक महत्वपूर्ण सुधार था, और डिस्प्ले आउटपुट उत्पन्न करने की क्षमता बनाए रखी। इन कार्डों का उपयोग प्रारंभिक एक्सास्केल और HPC तैनातियों में किया गया था, जो वर्कस्टेशन और डेटा सेंटर भूमिकाओं के बीच की खाई को पाटते थे।
MI100 श्रृंखला (CDNA 1)
नवंबर 2020 में लॉन्च की गई MI100 श्रृंखला ने AMD के CDNA (Compute DNA) आर्किटेक्चर में संक्रमण को चिह्नित किया, जिसे विशेष रूप से कंप्यूट वर्कलोड के लिए डिज़ाइन किया गया था। CDNA 1 कार्डों ने रैस्टराइज़ेशन यूनिट जैसे सभी रेंडरिंग-संबंधित हार्डवेयर हटा दिए, और ट्रांसफॉर्मर मॉडल और अन्य डीप लर्निंग संचालन को तेज करने के लिए मैट्रिक्स प्रोसेसिंग यूनिट जोड़े। इस आर्किटेक्चर ने AMD के बाद के AI-केंद्रित एक्सेलेरेटरों के लिए आधार तैयार किया।
MI300 श्रृंखला (CDNA 3)
MI300A और MI300X, जो 2023 के अंत में पेश किए गए, CDNA 3 आर्किटेक्चर पर निर्मित डेटा सेंटर एक्सेलेरेटर हैं, जो HPC और जनरेटिव AI वर्कलोड के लिए अनुकूलित हैं। आर्किटेक्चर एक स्केलेबल चिपलेट डिज़ाइन का उपयोग करता है, जो एकल इंटरपोज़र पर कई चिपलेट्स को संयोजित करने के लिए TSMC की उन्नत पैकेजिंग तकनीकों, जिसमें CoWoS (chip-on-wafer-on-substrate) और InFO (integrated fan-out) शामिल हैं, का लाभ उठाता है। AMD का Infinity Fabric इंटरकनेक्ट चिपलेट्स और होस्ट सिस्टम के बीच हाई-स्पीड, कम-लेटेंसी डेटा ट्रांसफर सक्षम करता है।
MI300A
MI300A एक एक्सेलेरेटेड प्रोसेसिंग यूनिट (APU) है जो 24 Zen 4 CPU कोर को चार CDNA 3 GPU कोर के साथ एकीकृत करता है, जिसमें GPU अनुभाग में कुल 228 कंप्यूट यूनिट (CUs) और 128 GB HBM3 मेमोरी शामिल है। 5 nm प्रक्रिया पर निर्मित Zen 4 कोर, x86-64 निर्देश सेट, AVX-512 और BFloat16 एक्सटेंशन का समर्थन करते हैं, जिससे वे सामान्य-उद्देश्य अनुप्रयोग चला सकते हैं और होस्ट-साइड कंप्यूटेशन प्रदान कर सकते हैं। MI300A 61.3 TFLOPS FP64 (FP64 मैट्रिक्स संचालन के साथ 122.6 TFLOPS) और 980.6 TFLOPS FP16 (स्पार्सिटी के साथ 1961.2 TFLOPS) की पीक प्रदर्शन प्राप्त करता है, जिसमें 5.3 TB/s मेमोरी बैंडविड्थ है। यह विषम सिस्टम एकीकरण के लिए PCIe 5.0 और CXL 2.0 इंटरफेस का समर्थन करता है।
MI300X
MI300X एक समर्पित जनरेटिव AI एक्सेलेरेटर है जो CPU कोर को अतिरिक्त GPU संसाधनों से बदल देता है, जिसके परिणामस्वरूप 304 CUs और 192 GB HBM3 मेमोरी होती है। यह प्राकृतिक भाषा प्रसंस्करण, कंप्यूटर विज़न और डीप लर्निंग जैसे अनुप्रयोगों के लिए डिज़ाइन किया गया है। MI300X TF32 प्रदर्शन के 653.7 TFLOPS (स्पार्सिटी के साथ 1307.4 TFLOPS) और FP16 के 1307.4 TFLOPS (स्पार्सिटी के साथ 2614.9 TFLOPS) प्रदान करता है, जिसमें समान 5.3 TB/s मेमोरी बैंडविड्थ है। यह PCIe 5.0 और CXL 2.0, साथ ही AMD के ROCm सॉफ्टवेयर स्टैक का समर्थन करता है, जो जनरेटिव AI अनुप्रयोगों को विकसित करने और तैनात करने के लिए एक एकीकृत प्रोग्रामिंग मॉडल प्रदान करता है।
MI350 श्रृंखला (CDNA 4)
MI350X और MI355X, जिनकी 2025 में घोषणा की गई, CDNA 4 आर्किचेक्चर पर निर्मित हैं, जो उन्नत AI प्रशिक्षण और अनुमान को लक्षित करते हैं। TSMC की 3 nm (N3) प्रक्रिया पर निर्मित, उनमें 288 GB HBM3E मेमोरी और 8 TB/s बैंडविड्थ के साथ एक उच्च-प्रदर्शन चिपलेट डिज़ाइन है। CDNA 4 FP8 और FP16 के अतिरिक्त, कम-प्रिसिजन प्रारूप FP4 और FP6 के लिए मूल समर्थन पेश करता है, जो MI355X पर FP4 कंप्यूट को 9.2 पेटाफ्लॉप्स तक बढ़ाता है। आर्किटेक्चर कुशल डेटा ट्रांजिट के लिए Infinity Fabric इंटरकनेक्ट बनाए रखता है। 2026 में, AMD ने MI350P को PCIe कार्ड के रूप में जारी किया, जिसमें MI350X की लगभग आधी कंप्यूट क्षमता और पावर आवश्यकताएं हैं, जो कुछ तैनातियों के लिए अधिक सुलभ विकल्प प्रदान करता है।
सॉफ्टवेयर स्टैक
ROCm
Instinct उत्पादों के लिए AMD का सॉफ्टवेयर पारिस्थितिकी तंत्र Radeon Open Compute (ROCm) मेटा-प्रोजेक्ट के तहत आयोजित किया गया है, जो GPU कंप्यूटिंग के लिए ड्राइवरों, लाइब्रेरी और टूल्स का एक संग्रह प्रदान करता है। ROCm को Nvidia के CUDA प्लेटफ़ॉर्म के साथ प्रतिस्पर्धा करने के लिए डिज़ाइन किया गया है, जो डेवलपर्स के लिए एक ओपन-सोर्स विकल्प प्रदान करता है।
MxGPU
MI6, MI8 और MI25 AMD की MxGPU वर्चुअलाइज़ेशन तकनीक का समर्थन करते हैं, जो कई उपयोगकर्ताओं या वर्चुअल मशीनों में GPU संसाधनों को साझा करने में सक्षम बनाती है। यह सुविधा क्लाउड और एंटरप्राइज़ वातावरण के लिए मूल्यवान है जहां कुशल संसाधन उपयोग महत्वपूर्ण है।
MIOpen
MIOpen AMD की डीप लर्निंग लाइब्रेरी है जो न्यूरल नेटवर्क प्रशिक्षण और अनुमान के GPU त्वरण को सक्षम करती है। यह GPUOpen Boltzmann Initiative सॉफ्टवेयर का विस्तार करती है और Theano, Caffe, TensorFlow, MXNet, Microsoft Cognitive Toolkit, Torch और Chainer सहित लोकप्रिय फ्रेमवर्क का समर्थन करती है। प्रोग्रामिंग OpenCL और Python में समर्थित है, और AMD का Heterogeneous-compute Interface for Portability (HIP) और Heterogeneous Compute Compiler CUDA कोड को AMD हार्डवेयर पर चलाने के लिए संकलन की अनुमति देता है, जिससे डेवलपर्स के लिए प्रवासन आसान हो जाता है।
प्रदर्शन और बाजार स्थिति
जून 2022 में, AMD के Epyc CPUs और Instinct GPUs पर आधारित सुपरकंप्यूटरों ने सबसे अधिक पावर-कुशल सुपरकंप्यूटरों की Green500 सूची में बढ़त ले ली, जिसमें किसी भी अन्य सिस्टम पर 50% से अधिक की बढ़त के साथ शीर्ष चार स्थानों पर कब्जा किया। इनमें से एक, Frontier सुपरकंप्यूटर, जून 2022 से TOP500 सूची में दुनिया का सबसे तेज़ रहा है और 2023 तक ऐसा ही रहा। इस उपलब्धि ने बड़े पैमाने पर HPC वातावरण में Instinct एक्सेलेरेटरों की दक्षता और कंप्यूट क्षमता पर प्रकाश डाला।
Instinct लाइन बड़े भाषा मॉडल और जनरेटिव AI के तीव्र विकास के जवाब में विकसित होती रहती है, प्रत्येक पीढ़ी पैमाने पर प्रशिक्षण और अनुमान की मांगों को पूरा करने के लिए मेमोरी क्षमता, बैंडविड्थ और कम-प्रिसिजन प्रारूपों के समर्थन में वृद्धि करती है।
यह भी देखें
- AMD - मूल कंपनी
- Intel - डेटा सेंटर GPUs में एक प्रतियोगी
- TSMC - उन्नत चिप्स का निर्माता
- आर्टिफिशियल इंटेलिजेंस - प्राथमिक अनुप्रयोग डोमेन