अंग्रेज़ी से अनुवादित

फाल्कन अबू धाबी में टेक्नोलॉजी इनोवेशन इंस्टीट्यूट (TII) द्वारा विकसित ओपन-सोर्स बड़े भाषा मॉडलों का एक परिवार है, जो अपनी दक्षता और तर्क तथा कोडिंग बेंचमार्क पर मजबूत प्रदर्शन के लिए जाना जाता है।

फाल्कन ओपन-सोर्स लार्ज लैंग्वेज मॉडल का एक परिवार है, जिसे अबू धाबी में टेक्नोलॉजी इनोवेशन इंस्टीट्यूट (TII) द्वारा विकसित किया गया है। मार्च 2023 में पहली बार जारी किए गए, फाल्कन मॉडल डिकोडर-ओनली आर्किटेक्चर पर आधारित हैं और उच्च-गुणवत्ता वाले वेब डेटा पर प्रशिक्षित हैं, जिसमें दक्षता और प्रदर्शन पर जोर दिया गया है। फाल्कन श्रृंखला में 1B से 180B पैरामीटर तक के विभिन्न आकारों के मॉडल शामिल हैं, जिनमें सबसे बड़े मॉडल मानक बेंचमार्क पर प्रतिस्पर्धी परिणाम प्राप्त करते हैं, जबकि कुछ समकालीनों की तुलना में अनुमान के दौरान कम कम्प्यूटेशनल संसाधनों की आवश्यकता होती है।

फाल्कन मॉडल मल्टी-क्वेरी अटेंशन (MQA) और फ्लैश अटेंशन के उपयोग के लिए उल्लेखनीय हैं, जो मेमोरी बैंडविड्थ को कम करते हैं और डिकोडिंग को तेज करते हैं। वे फाल्कन रिफाइंडवेब डेटासेट पर प्रशिक्षित हैं, जो सार्वजनिक वेब टेक्स्ट का एक बड़े पैमाने पर फ़िल्टर किया गया कॉर्पस है। फाल्कन मॉडल अनुमोदक लाइसेंस के तहत जारी किए गए हैं, जिसमें छोटे मॉडल Apache 2.0 लाइसेंस के तहत और बड़े मॉडल एक कस्टम लाइसेंस के तहत हैं जो व्यावसायिक उपयोग को प्रतिबंधित करता है। मॉडलों को ओपन-सोर्स समुदाय में व्यापक रूप से अपनाया गया है और विभिन्न फाइन-ट्यून किए गए वेरिएंट के लिए आधार के रूप में काम किया है।

आर्किटेक्चर और प्रशिक्षण

फाल्कन मॉडल एक मानक ट्रांसफॉर्मर डिकोडर आर्किटेक्चर का उपयोग करते हैं, लेकिन कई अनुकूलन के साथ। वे रोटरी पोजिशनल एम्बेडिंग और बड़े मॉडल के लिए मल्टी-क्वेरी अटेंशन के संयोजन का उपयोग करते हैं, जो सभी क्वेरी हेड्स में की और वैल्यू हेड्स साझा करता है, जिससे मेमोरी उपयोग कम होता है और अनुमान गति में सुधार होता है। प्रशिक्षण डेटा फाल्कन रिफाइंडवेब डेटासेट से प्राप्त होता है, जिसमें कॉमन क्रॉल से फ़िल्टर किए गए अरबों टोकन शामिल हैं, और कुछ मॉडलों के लिए अतिरिक्त क्यूरेटेड स्रोत भी हैं। प्रशिक्षण प्रक्रिया AdamW ऑप्टिमाइज़र और कोसाइन लर्निंग रेट शेड्यूल का उपयोग करती है, जिसमें अधिकांश मॉडलों के लिए अधिकतम अनुक्रम लंबाई 2048 टोकन होती है।

सबसे बड़ा फाल्कन मॉडल, फाल्कन-180B, 384 GPU का उपयोग करके 3.5 ट्रिलियन टोकन पर प्रशिक्षित किया गया था, और यह तर्क, कोडिंग और सामान्य ज्ञान कार्यों पर मजबूत प्रदर्शन प्रदर्शित करता है। अपने आकार के बावजूद, फाल्कन-180B को कुशल बनाने के लिए डिज़ाइन किया गया है, जिसमें मल्टी-क्वेरी अटेंशन के माध्यम से अनुमान के दौरान उपयोग किए जाने वाले पैरामीटर की संख्या को कम करने पर ध्यान केंद्रित किया गया है।

मॉडल वेरिएंट और रिलीज़

फाल्कन मॉडल कई आकारों और कॉन्फ़िगरेशन में जारी किए गए हैं। मार्च 2023 में पहली रिलीज़ में फाल्कन-1B और फाल्कन-7B शामिल थे, दोनों Apache 2.0 लाइसेंस के तहत। मई 2023 में, फाल्कन-40B जारी किया गया, जो उस समय ओपन एलएलएम लीडरबोर्ड में शीर्ष पर था। बाद में, सितंबर 2023 में, फाल्कन-180B उपलब्ध कराया गया, जिसमें एक कस्टम लाइसेंस है जो अनुसंधान और गैर-व्यावसायिक उद्देश्यों के लिए मुफ्त उपयोग की अनुमति देता है लेकिन व्यावसायिक तैनाती को प्रतिबंधित करता है। छोटे वेरिएंट, जैसे फाल्कन-3B और फाल्कन-11B, भी जारी किए गए हैं, जिसमें 11B मॉडल एक अलग अटेंशन तंत्र (मल्टी-क्वेरी अटेंशन) का उपयोग करता है और उल्लेखनीय दक्षता प्राप्त करता है।

सभी फाल्कन मॉडल हगिंग फेस हब पर उपलब्ध हैं, और उन्हें vLLM और TensorRT-LLM सहित विभिन्न अनुमान फ्रेमवर्क में एकीकृत किया गया है। मॉडलों को निर्देश-पालन और चैट अनुप्रयोगों के लिए भी फाइन-ट्यून किया गया है, जिसमें फाल्कन-7B-इंस्ट्रक्ट और फाल्कन-40B-इंस्ट्रक्ट जैसे आधिकारिक वेरिएंट शामिल हैं।

प्रदर्शन और बेंचमार्क

फाल्कन मॉडल ने कई बेंचमार्क पर प्रतिस्पर्धी प्रदर्शन प्रदर्शित किया है। उदाहरण के लिए, फाल्कन-40B ने MMLU (मैसिव मल्टीटास्क लैंग्वेज अंडरस्टैंडिंग) बेंचमार्क पर कई मौजूदा ओपन-सोर्स मॉडलों से बेहतर प्रदर्शन किया, 60.4% का स्कोर हासिल किया। फाल्कन-180B ने इन परिणामों में और सुधार किया, MMLU पर 70.4% और HellaSwag पर 68.2% स्कोर किया, और कई कार्यों पर PaLM-2 लार्ज जैसे मालिकाना मॉडलों के बराबर प्रदर्शन किया। कोडिंग बेंचमार्क पर, फाल्कन-180B ने HumanEval पर 19.3% का pass@1 स्कोर हासिल किया, जो अन्य बड़े मॉडलों के साथ प्रतिस्पर्धी है।

फाल्कन मॉडल की दक्षता एक प्रमुख विक्रय बिंदु है। मल्टी-क्वेरी अटेंशन का उपयोग मेमोरी फुटप्रिंट को कम करता है और अनुमान को तेज करता है, जिससे वे एकल GPU पर तैनाती के लिए उपयुक्त होते हैं। उदाहरण के लिए, फाल्कन-40B को क्वांटाइज़ेशन के साथ एक एकल A100 GPU पर चलाया जा सकता है, और फाल्कन-180B को कई GPU की आवश्यकता होती है लेकिन फिर भी यह एक अनुकूल प्रदर्शन-से-संसाधन अनुपात प्रदान करता है।

प्रभाव और पारिस्थितिकी तंत्र

फाल्कन मॉडल का ओपन-सोर्स एआई परिदृश्य पर महत्वपूर्ण प्रभाव पड़ा है। उन्हें कई फाइन-ट्यून किए गए वेरिएंट के लिए आधार मॉडल के रूप में उपयोग किया गया है, जिसमें निर्देश-ट्यून और चैट मॉडल शामिल हैं, और हगिंग फेस, रेप्लिकेट और AWS सेजमेकर जैसे प्लेटफार्मों में एकीकृत किया गया है। फाल्कन-40B और फाल्कन-180B की रिलीज़ ने कुशल बड़े मॉडल डिज़ाइन में और नवाचार को बढ़ावा देने में मदद की, जिससे बाद में लामा 2 और मिस्ट्रल जैसे मॉडल प्रभावित हुए। फाल्कन मॉडल एआई में TII के व्यापक अनुसंधान प्रयासों का भी हिस्सा हैं, जिसमें प्राकृतिक भाषा प्रसंस्करण और कंप्यूटर विज़न पर काम शामिल है।

छोटे फाल्कन मॉडल की अनुमोदक लाइसेंसिंग ने अनुसंधान और व्यावसायिक अनुप्रयोगों में व्यापक रूप से अपनाने को प्रोत्साहित किया है, जबकि बड़े मॉडल का उपयोग शैक्षणिक अध्ययनों और उद्योग पायलटों में किया गया है। फाल्कन परिवार ओपन-सोर्स लार्ज लैंग्वेज मॉडल के विकास में एक महत्वपूर्ण संदर्भ बिंदु बना हुआ है।

यह भी देखें

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:large-language-models·open-source-ai·natural-language-processing·artificial-intelligence
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास