अंग्रेज़ी से अनुवादित

TPU v2 गूगल की दूसरी पीढ़ी की टेंसर प्रोसेसिंग यूनिट है, जिसे मई 2017 में पेश किया गया था, जिसमें bfloat16 फ्लोटिंग-पॉइंट समर्थन और 16 GB हाई बैंडविड्थ मेमोरी शामिल है, जो मशीन लर्निंग मॉडल के लिए प्रशिक्षण और अनुमान दोनों को सक्षम बनाती है।

TPU v2 दूसरी पीढ़ी का Tensor Processing Unit है, जो Google द्वारा न्यूरल नेटवर्क मशीन लर्निंग वर्कलोड को तेज करने के लिए विकसित एक कस्टम एप्लिकेशन-विशिष्ट एकीकृत सर्किट (ASIC) है। मई 2017 में घोषित, यह मूल TPU का उत्तराधिकारी था और इसमें महत्वपूर्ण स्थापत्य सुधार पेश किए गए, विशेष रूप से फ्लोटिंग-पॉइंट गणना करने की क्षमता और bfloat16 प्रारूप का समावेश, जिसका आविष्कार Google Brain ने किया था। इसने TPU v2 को मशीन लर्निंग मॉडल के प्रशिक्षण और अनुमान दोनों के लिए उपयुक्त बना दिया, इसके पूर्ववर्ती के विपरीत जो केवल पूर्णांक संचालन तक सीमित था। TPU v2 को Google Cloud की Cloud TPU सेवा के माध्यम से तीसरे पक्षों के लिए उपलब्ध कराया गया था, और इसका उपयोग Google के अपने उत्पादन प्रणालियों में व्यापक रूप से किया गया है, जिसमें ट्रांसफॉर्मर-आधारित मॉडल और बड़े भाषा मॉडल शामिल हैं।

TPU v2 को पहली पीढ़ी के TPU की मेमोरी बैंडविड्थ सीमाओं को संबोधित करने के लिए डिज़ाइन किया गया था। 16 GB हाई बैंडविड्थ मेमोरी (HBM) को शामिल करके, दूसरी पीढ़ी के डिज़ाइन ने मेमोरी बैंडविड्थ को 600 GB/s तक बढ़ा दिया और प्रति चिप 45 टेराफ्लॉप्स का प्रदर्शन दिया। इन चिप्स को फिर चार-चिप मॉड्यूल में व्यवस्थित किया गया, जिससे संयुक्त प्रदर्शन 180 टेराफ्लॉप्स प्राप्त हुआ। इसके अलावा, इनमें से 64 मॉड्यूल को 256-चिप पॉड्स में इकट्ठा किया गया, जिससे कुल प्रदर्शन 11.5 पेटाफ्लॉप्स मिला। इस स्केलेबल आर्किटेक्चर ने Google को बड़े पैमाने पर मशीन लर्निंग कार्यों के लिए TPU v2 सिस्टम तैनात करने की अनुमति दी, जिसमें न्यूरल नेटवर्क और डीप लर्निंग शामिल हैं।

विकास और इतिहास

TPU v2 का विकास अमीर सालेक के नेतृत्व में किया गया था, जिन्होंने Google के कस्टम सिलिकॉन समूह की स्थापना और नेतृत्व किया, और नॉर्मन पी. जौपी ने समग्र TPU कार्यक्रम के तकनीकी प्रमुख और प्रधान वास्तुकार के रूप में कार्य किया। मूल TPU को केवल 15 महीनों में उत्पादन में तैनात किया गया था, और v2 ने उस आधार पर निर्माण किया। जोनाथन रॉस के अनुसार, जो मूल TPU इंजीनियरों में से एक थे और बाद में Groq के संस्थापक बने, TPU डिज़ाइन, जो सिस्टोलिक ऐरे आर्किटेक्चर का उपयोग करता है, Google में तीन प्रतिस्पर्धी AI एक्सेलेरेटर प्रस्तावों में से चुना गया था। TPU v2 उद्योग की पहली उत्पादन डीप-लर्निंग प्रशिक्षण चिप थी, जो AI के लिए कस्टम सिलिकॉन में एक मील का पत्थर साबित हुई। ब्रॉडकॉम ने TPU v2 का सह-विकास किया, Google के आर्किटेक्चर को विनिर्माण योग्य सिलिकॉन में अनुवादित किया और TSMC जैसी फाउंड्री के माध्यम से फैब्रिकेशन का प्रबंधन किया।

तकनीकी विशिष्टताएँ

TPU v2 एक मैट्रिक्स गुणन इंजन है जो पूर्णांक और फ्लोटिंग-पॉइंट अंकगणित दोनों का समर्थन करता है। इसका प्रमुख नवाचार bfloat16 प्रारूप की शुरुआत थी, जो एक 16-बिट फ्लोटिंग-पॉइंट प्रतिनिधित्व है जो पारंपरिक 16-बिट प्रारूपों की तुलना में व्यापक गतिशील रेंज प्रदान करता है जबकि कम मेमोरी और बैंडविड्थ की आवश्यकता होती है। इसने इसे गहरे न्यूरल नेटवर्क के प्रशिक्षण के लिए विशेष रूप से प्रभावी बना दिया। प्रत्येक TPU v2 चिप में गुणकों और संचायकों की एक सिस्टोलिक ऐरे होती है, साथ ही 16 GB HBM जो 600 GB/s की बैंडविड्थ प्रदान करता है। चिप्स चार-चिप मॉड्यूल में परस्पर जुड़े होते हैं, और इन मॉड्यूल को बड़े पॉड्स में संयोजित किया जाता है। 256-चिप पॉड कॉन्फ़िगरेशन 11.5 पेटाफ्लॉप्स प्रदान करता है, जो ट्रांसफॉर्मर और अन्य बड़े भाषा मॉडल के प्रशिक्षण जैसे कार्यों के लिए विशाल समानांतर गणना सक्षम बनाता है।

अनुप्रयोग और उपयोग

Google ने विभिन्न उत्पादन अनुप्रयोगों में TPU v2 सिस्टम का उपयोग किया। इन्हें AlphaGo बनाम ली सेडोल गो मैचों की श्रृंखला के साथ-साथ AlphaZero प्रणाली में नियोजित किया गया था, जिसने केवल खेल के नियमों से शतरंज, शोगी और गो खेलना सीखा। TPU का उपयोग Google Street View टेक्स्ट प्रोसेसिंग के लिए भी किया गया, जिससे पांच दिनों से कम समय में Street View डेटाबेस में सभी टेक्स्ट निकालना संभव हुआ। Google Photos में, एक एकल TPU प्रति दिन 100 मिलियन से अधिक फ़ोटो संसाधित कर सकता था। इसके अतिरिक्त, TPU v2 का उपयोग RankBrain में किया गया, जो खोज परिणाम प्रदान करने के लिए Google की प्रणाली है। Google Cloud पर Cloud TPU सेवा के माध्यम से, तीसरे पक्ष अपने स्वयं के मशीन लर्निंग वर्कलोड के लिए TPU v2 तक पहुँच सकते थे, जो TensorFlow, JAX और PyTorch जैसे फ्रेमवर्क का समर्थन करते थे।

GPU के साथ तुलना

GPU की तुलना में, TPU उच्च-मात्रा, कम-परिशुद्धता गणना के लिए डिज़ाइन किए गए हैं, जिनमें प्रति जूल अधिक इनपुट/आउटपुट संचालन होते हैं। उनमें रेखांकन या बनावट मैपिंग के लिए हार्डवेयर की कमी होती है, इसके बजाय मैट्रिक्स संचालन पर ध्यान केंद्रित किया जाता है। TPU कन्वोल्यूशनल न्यूरल नेटवर्क (CNN) के लिए उपयुक्त हैं, जबकि GPU कुछ पूरी तरह से जुड़े न्यूरल नेटवर्क के लिए लाभ रखते हैं, और CPU आवर्ती न्यूरल नेटवर्क (RNN) के लिए फायदेमंद हो सकते हैं। बड़े भाषा मॉडल के लिए ट्रांसफॉर्मर-आधारित न्यूरल नेटवर्क से जुड़े वर्कफ्लो में, TPU अक्सर अनुमान के लिए उपयोग किए जाते हैं, जबकि GPU अक्सर प्रशिक्षण के लिए उपयोग किए जाते हैं। श्रम का यह विभाजन प्रत्येक प्रोसेसर प्रकार की विभिन्न शक्तियों को दर्शाता है, जिसमें TPU कई आधुनिक AI मॉडलों में पाए जाने वाले गणना के विशिष्ट पैटर्न में उत्कृष्टता प्राप्त करते हैं।

विरासत और प्रभाव

TPU v2 ने Google के TPU हार्डवेयर की बाद की पीढ़ियों के लिए एक टेम्पलेट स्थापित किया, जिसमें TPU v3 शामिल है, जिसे 8 मई, 2018 को घोषित किया गया था, जिसमें प्रति चिप दोगुना प्रदर्शन और चार गुना अधिक चिप्स वाले पॉड्स थे। bfloat16 की शुरुआत का AI हार्डवेयर पारिस्थितिकी तंत्र पर स्थायी प्रभाव पड़ा, जिसने अन्य एक्सेलेरेटर डिज़ाइनों को प्रभावित किया। 2025 तक, Google Cloud TPU सिस्टम की बिक्री से महत्वपूर्ण उत्पाद राजस्व उत्पन्न करता है, और Google विभिन्न "नियोक्लाउड्स" और Meta जैसी कंपनियों के साथ अपने डेटा केंद्रों में TPU तैनात करने के बारे में बातचीत कर रहा है। TPU v2 कृत्रिम बुद्धिमत्ता हार्डवेयर के इतिहास में एक मौलिक मंच बना हुआ है, जो मशीन लर्निंग के लिए कस्टम सिलिकॉन के मूल्य को प्रदर्शित करता है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:hardware·google·machine-learning·ai-accelerator
इस पृष्ठ को अंतिम बार संपादित किया गया 13 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास