टेंसर प्रोसेसिंग यूनिट (TPU) एक एप्लिकेशन-विशिष्ट एकीकृत सर्किट है जिसे Google द्वारा विशेष रूप से मशीन लर्निंग कार्यभार को तेज करने के लिए डिज़ाइन किया गया है, विशेष रूप से तंत्रिका नेटवर्क प्रशिक्षण और अनुमान के मूल में मैट्रिक्स गुणन। एक सामान्य-उद्देश्य GPU के विपरीत, एक TPU टेंसर संचालन के लिए विशेष रूप से निर्मित होता है और ग्राफिक्स प्रस्तुत करने के लिए डिज़ाइन नहीं किया गया है।
इतिहास
Google ने 2015 में आंतरिक रूप से TPU को तैनात करना शुरू किया, ताकि खोज रैंकिंग, स्ट्रीट व्यू टेक्स्ट पहचान, और अल्फागो के मैचों के दौरान चाल मूल्यांकन जैसी सेवाओं को तेज किया जा सके, और 2016 के अपने I/O सम्मेलन में चिप की सार्वजनिक घोषणा की। पहली पीढ़ी के TPU ने पहले से प्रशिक्षित मॉडलों के लिए अनुमान पर ध्यान केंद्रित किया; 2017 में जारी दूसरी पीढ़ी ने प्रशिक्षण के लिए समर्थन जोड़ा, और Google ने Google Cloud के माध्यम से बाहरी ग्राहकों को TPU उपलब्ध कराए। क्रमिक पीढ़ियों, TPU v3 (2018), v4 (2021), v5 (2023), और Trillium (2024) ने प्रत्येक ने प्रदर्शन और मेमोरी में वृद्धि की, और 2020 के दशक के मध्य तक TPU ने हजारों चिप्स के बड़े परस्पर जुड़े पॉड बना दिए, जिनका उपयोग Google के अपने फाउंडेशन मॉडल को प्रशिक्षित करने के लिए किया गया, जिसमें इसका Gemini परिवार शामिल है, साथ ही Google Cloud के माध्यम से बाहरी ग्राहकों को किराए पर भी दिया गया।
डिज़ाइन और GPU से तुलना
TPU एक सिस्टोलिक ऐरे आर्किटेक्चर के आसपास बनाए गए हैं, जो प्रोसेसिंग तत्वों का एक ग्रिड है जो एक निश्चित लय में पड़ोसी तत्वों को डेटा पास करता है, जो गहन शिक्षण में उपयोग किए जाने वाले दोहराए जाने वाले मैट्रिक्स गुणन के लिए अत्यधिक कुशल है, लेकिन सामान्य-उद्देश्य समानांतर कंप्यूटिंग के लिए GPU की तुलना में कहीं कम लचीला है। यह विशेषज्ञता TPU को बड़े पैमाने पर प्रशिक्षण और तंत्रिका नेटवर्क की सेवा के लिए प्रति वाट और प्रति डॉलर दक्षता लाभ देती है, जिसकी कीमत गैर-टेंसर कार्यभार के लिए कम अनुकूलनीय होने के रूप में चुकानी पड़ती है। जहां Nvidia के GPU व्यापक रूप से अपनाए गए CUDA सॉफ्टवेयर प्लेटफॉर्म पर चलते हैं, TPU मुख्य रूप से TensorFlow और बाद में PyTorch और JAX, Google की अपनी संख्यात्मक कंप्यूटिंग लाइब्रेरी के माध्यम से प्रोग्राम किए जाते हैं, जिससे उन्हें एक छोटा लेकिन बढ़ता हुआ सॉफ्टवेयर पारिस्थितिकी तंत्र मिलता है।
महत्व
TPU एक प्रमुख AI प्रयोगशाला द्वारा अपने स्वयं के चिप डिज़ाइन को लंबवत रूप से एकीकृत करने के सबसे स्पष्ट उदाहरणों में से एक का प्रतिनिधित्व करते हैं, न कि केवल Nvidia जैसे आपूर्तिकर्ताओं से व्यापारिक सिलिकॉन पर निर्भर रहने का, एक रणनीति जिसे बाद में कस्टम AI त्वरक डिज़ाइन करने वाली अन्य कंपनियों, जैसे Amazon के Trainium और Meta के MTIA द्वारा प्रतिध्वनित किया गया, क्योंकि 2020 के दशक के AI बूम के दौरान बड़े भाषा मॉडल प्रशिक्षण और अनुमान क्षमता की मांग बढ़ी। चूंकि TPU मुख्य रूप से Google Cloud के माध्यम से उपलब्ध हैं, न कि स्टैंडअलोन हार्डवेयर के रूप में बेचे जाते हैं, वे GPU की तुलना में समग्र AI त्वरक बाजार का एक छोटा हिस्सा बने हुए हैं, लेकिन वे Google के आंतरिक AI बुनियादी ढांचे को रेखांकित करते हैं, जिसमें इसके सबसे बड़े मॉडलों के लिए प्रशिक्षण रन शामिल हैं, और Google द्वारा एक प्रमुख कारण के रूप में उद्धृत किया जाता है कि यह उन प्रतिद्वंद्वियों के साथ प्रतिस्पर्धा कर सकता है जो बाहरी GPU आपूर्ति पर अधिक निर्भर हैं।