BLOOM-176B, BLOOM (BigScience Large Open-science Open-access Multilingual) भाषा मॉडल का सबसे बड़ा संस्करण है, जिसे BigScience सहयोग द्वारा विकसित किया गया था और जुलाई 2022 में जारी किया गया था। 176 बिलियन पैरामीटर के साथ, यह एक सघन ट्रांसफॉर्मर-आधारित बड़ा भाषा मॉडल है जिसे दर्जनों प्राकृतिक भाषाओं और प्रोग्रामिंग भाषाओं में पाठ उत्पन्न करने के लिए डिज़ाइन किया गया है। मॉडल को ROOTS कॉर्पस पर प्रशिक्षित किया गया था, जो 1.6 टेराबाइट से अधिक पाठ का एक क्यूरेटेड डेटासेट है, और इसे जिम्मेदार AI लाइसेंस के तहत उपलब्ध कराया गया था, जो एक खुला लाइसेंस है जिसमें हानिकारक अनुप्रयोगों को रोकने के लिए उपयोग प्रतिबंध शामिल हैं।
BLOOM-176B को स्वामित्व मॉडल के लिए एक बड़े पैमाने पर, बहुभाषी विकल्प प्रदान करने के लिए बनाया गया था, जिसमें पारदर्शिता और प्रतिलिपि प्रस्तुत करने योग्यता पर जोर दिया गया था। इसकी वास्तुकला एक मानक डिकोडर-केवल ट्रांसफॉर्मर का पालन करती है जिसमें बहु-शीर्ष ध्यान, परत सामान्यीकरण, और स्थितीय एन्कोडिंग शामिल है, लेकिन इसमें कई नवाचार शामिल हैं, जिनमें एक ALiBi (Attention with Linear Biases) स्थितीय एन्कोडिंग योजना शामिल है जो लंबे अनुक्रमों में एक्सट्रपोलेशन में सुधार करती है। मॉडल 46 प्राकृतिक भाषाओं और 13 प्रोग्रामिंग भाषाओं का समर्थन करता है, जो इसे अपने समय के सबसे भाषाई रूप से विविध बड़े मॉडलों में से एक बनाता है।
प्रशिक्षण और कंप्यूट
BLOOM-176B को प्रशिक्षित करने के लिए महत्वपूर्ण कंप्यूटिंग संसाधनों की आवश्यकता थी। मॉडल को फ्रांस में जीन ज़े सुपरकंप्यूटर पर प्रशिक्षित किया गया था, जिसमें 384 NVIDIA A100 GPU का उपयोग किया गया था, जिनमें से प्रत्येक में 80GB मेमोरी थी। प्रशिक्षण प्रक्रिया में लगभग 3.5 महीने लगे, जिसमें लगभग 1,082,990 कंप्यूट घंटे खर्च हुए। टीम ने गहन शिक्षण अनुकूलन तकनीकों का मिश्रण इस्तेमाल किया, जिसमें एडम ऑप्टिमाइज़र शामिल था, जिसमें सीखने की दर अनुसूची शामिल थी जिसमें वार्मअप चरण और कोसाइन क्षय शामिल था। ग्रेडिएंट क्लिपिंग को प्रशिक्षण को स्थिर करने के लिए लागू किया गया था, और मेमोरी उपयोग को कम करने के लिए bfloat16 मिश्रित परिशुद्धता का उपयोग किया गया था।
प्रशिक्षण डेटा, ROOTS, को BigScience समुदाय द्वारा एकत्र किया गया था, जिसमें पुस्तकों, समाचार लेखों और वेब सामग्री सहित विविध स्रोतों से 1.6 टेराबाइट पाठ शामिल था। गुणवत्ता सुनिश्चित करने और पूर्वाग्रह को कम करने के लिए डेटासेट को फ़िल्टर और डीडुप्लिकेट किया गया था। मॉडल को 2048 टोकन की संदर्भ लंबाई के साथ प्रशिक्षित किया गया था, और ALiBi तंत्र ने इसे अतिरिक्त प्रशिक्षण के बिना अनुमान के समय लंबे अनुक्रमों को संभालने की अनुमति दी।
क्षमताएं और प्रदर्शन
BLOOM-176B अपने समर्थित भाषाओं में पाठ निर्माण, अनुवाद और सारांशीकरण में उत्कृष्ट है। यह अन्य बड़े मॉडलों के समान, मजबूत कुछ-शॉट सीखने की क्षमताओं का प्रदर्शन करता है, और प्रश्न उत्तर और कोड निर्माण जैसे कार्य कर सकता है। मूल्यांकन में, इसने SuperGLUE और बहुभाषी कार्यों जैसे बेंचमार्क पर प्रतिस्पर्धी परिणाम प्राप्त किए, हालांकि यह अपने बहुभाषी फोकस के कारण अंग्रेजी-केवल कार्यों पर GPT-3 जैसे मॉडलों से कभी-कभी पीछे रह गया।
एक उल्लेखनीय विशेषता कम-संसाधन भाषाओं में पाठ उत्पन्न करने की इसकी क्षमता है, जैसे कि अफ्रीकी और दक्षिण पूर्व एशियाई क्षेत्रों की भाषाएं, जो अक्सर अन्य मॉडलों में कम प्रतिनिधित्व वाली होती हैं। मॉडल पायथन, जावा और C++ जैसी प्रोग्रामिंग भाषाओं का भी समर्थन करता है, जिससे कोड पूर्णता और निर्माण संभव होता है। हालांकि, सभी जनरेटिव एआई मॉडल की तरह, यह पक्षपाती या तथ्यात्मक रूप से गलत आउटपुट उत्पन्न कर सकता है, और लाइसेंस में उच्च-जोखिम वाले डोमेन में उपयोग पर प्रतिबंध शामिल हैं।
रिलीज़ और पहुंच
BLOOM-176B जुलाई 2022 में हगिंग फेस हब के माध्यम से जारी किया गया था, जिसमें वजन डाउनलोड के लिए उपलब्ध थे। रिलीज़ के साथ एक विस्तृत मॉडल कार्ड और तकनीकी रिपोर्ट भी थी, जिसमें प्रशिक्षण प्रक्रिया और इच्छित उपयोगों का दस्तावेजीकरण किया गया था। मॉडल को उच्च-स्तरीय हार्डवेयर पर चलाया जा सकता है, लेकिन इसके आकार के लिए कई GPU या बड़ी मेमोरी वाले अमेज़न वेब सेवाओं उदाहरणों की आवश्यकता होती है। BigScience सहयोग ने कम शक्तिशाली हार्डवेयर पर अनुसंधान की सुविधा के लिए BLOOM-7B और BLOOM-3B सहित छोटे संस्करण भी जारी किए।
BLOOM-176B की खुली-पहुंच प्रकृति ने इसे शोधकर्ताओं और डेवलपर्स के लिए एक मूल्यवान संसाधन बना दिया, विशेष रूप से शिक्षा और उन क्षेत्रों में जहां स्वामित्व मॉडल तक सीमित पहुंच है। इसका उपयोग पूर्वाग्रह, व्याख्यात्मकता और बहुभाषी एनएलपी पर अध्ययनों में किया गया है, जो कृत्रिम बुद्धिमत्ता अनुसंधान के व्यापक क्षेत्र में योगदान देता है।
प्रभाव और विरासत
BLOOM-176B ने प्रदर्शित किया कि बड़े पैमाने पर भाषा मॉडल को कॉर्पोरेट संसाधनों पर भरोसा किए बिना सहयोगात्मक और पारदर्शी रूप से विकसित किया जा सकता है। इसकी रिलीज़ ने फाल्कन और लामा मॉडल जैसे बाद के ओपन-सोर्स प्रयासों को प्रभावित किया, जिन्होंने समान लाइसेंसिंग और पारदर्शिता सिद्धांतों को अपनाया। मॉडल ने मशीन लर्निंग में बहुभाषी प्रतिनिधित्व के महत्व को भी उजागर किया, जिससे अन्य परियोजनाओं को भाषाई विविधता को प्राथमिकता देने के लिए प्रोत्साहित किया गया।
अपनी सफलता के बावजूद, BLOOM-176B को चुनौतियों का सामना करना पड़ा, जिसमें अनुमान की उच्च लागत और विशिष्ट कार्यों के लिए फाइन-ट्यूनिंग की कठिनाई शामिल है। 2025 तक, यह खुली-पहुंच मॉडल के लिए एक संदर्भ बिंदु बना हुआ है, हालांकि नए मॉडल ने प्रदर्शन और दक्षता में इसे पीछे छोड़ दिया है। इसकी विरासत यह साबित करने में निहित है कि समुदाय-संचालित एआई विकास नैतिक दिशानिर्देशों का पालन करते हुए अत्याधुनिक परिणाम उत्पन्न कर सकता है।