फाल्कन ओपन-सोर्स लार्ज लैंग्वेज मॉडल का एक परिवार है, जिसे अबू धाबी में टेक्नोलॉजी इनोवेशन इंस्टीट्यूट (TII) द्वारा विकसित किया गया है। मार्च 2023 में पहली बार जारी किए गए, फाल्कन मॉडल डिकोडर-ओनली आर्किटेक्चर पर आधारित हैं और उच्च-गुणवत्ता वाले वेब डेटा पर प्रशिक्षित हैं, जिसमें दक्षता और प्रदर्शन पर जोर दिया गया है। फाल्कन श्रृंखला में 1B से 180B पैरामीटर तक के विभिन्न आकारों के मॉडल शामिल हैं, जिनमें सबसे बड़े मॉडल मानक बेंचमार्क पर प्रतिस्पर्धी परिणाम प्राप्त करते हैं, जबकि कुछ समकालीनों की तुलना में अनुमान के दौरान कम कम्प्यूटेशनल संसाधनों की आवश्यकता होती है।
फाल्कन मॉडल मल्टी-क्वेरी अटेंशन (MQA) और फ्लैश अटेंशन के उपयोग के लिए उल्लेखनीय हैं, जो मेमोरी बैंडविड्थ को कम करते हैं और डिकोडिंग को तेज करते हैं। वे फाल्कन रिफाइंडवेब डेटासेट पर प्रशिक्षित हैं, जो सार्वजनिक वेब टेक्स्ट का एक बड़े पैमाने पर फ़िल्टर किया गया कॉर्पस है। फाल्कन मॉडल अनुमोदक लाइसेंस के तहत जारी किए गए हैं, जिसमें छोटे मॉडल Apache 2.0 लाइसेंस के तहत और बड़े मॉडल एक कस्टम लाइसेंस के तहत हैं जो व्यावसायिक उपयोग को प्रतिबंधित करता है। मॉडलों को ओपन-सोर्स समुदाय में व्यापक रूप से अपनाया गया है और विभिन्न फाइन-ट्यून किए गए वेरिएंट के लिए आधार के रूप में काम किया है।
आर्किटेक्चर और प्रशिक्षण
फाल्कन मॉडल एक मानक ट्रांसफॉर्मर डिकोडर आर्किटेक्चर का उपयोग करते हैं, लेकिन कई अनुकूलन के साथ। वे रोटरी पोजिशनल एम्बेडिंग और बड़े मॉडल के लिए मल्टी-क्वेरी अटेंशन के संयोजन का उपयोग करते हैं, जो सभी क्वेरी हेड्स में की और वैल्यू हेड्स साझा करता है, जिससे मेमोरी उपयोग कम होता है और अनुमान गति में सुधार होता है। प्रशिक्षण डेटा फाल्कन रिफाइंडवेब डेटासेट से प्राप्त होता है, जिसमें कॉमन क्रॉल से फ़िल्टर किए गए अरबों टोकन शामिल हैं, और कुछ मॉडलों के लिए अतिरिक्त क्यूरेटेड स्रोत भी हैं। प्रशिक्षण प्रक्रिया AdamW ऑप्टिमाइज़र और कोसाइन लर्निंग रेट शेड्यूल का उपयोग करती है, जिसमें अधिकांश मॉडलों के लिए अधिकतम अनुक्रम लंबाई 2048 टोकन होती है।
सबसे बड़ा फाल्कन मॉडल, फाल्कन-180B, 384 GPU का उपयोग करके 3.5 ट्रिलियन टोकन पर प्रशिक्षित किया गया था, और यह तर्क, कोडिंग और सामान्य ज्ञान कार्यों पर मजबूत प्रदर्शन प्रदर्शित करता है। अपने आकार के बावजूद, फाल्कन-180B को कुशल बनाने के लिए डिज़ाइन किया गया है, जिसमें मल्टी-क्वेरी अटेंशन के माध्यम से अनुमान के दौरान उपयोग किए जाने वाले पैरामीटर की संख्या को कम करने पर ध्यान केंद्रित किया गया है।
मॉडल वेरिएंट और रिलीज़
फाल्कन मॉडल कई आकारों और कॉन्फ़िगरेशन में जारी किए गए हैं। मार्च 2023 में पहली रिलीज़ में फाल्कन-1B और फाल्कन-7B शामिल थे, दोनों Apache 2.0 लाइसेंस के तहत। मई 2023 में, फाल्कन-40B जारी किया गया, जो उस समय ओपन एलएलएम लीडरबोर्ड में शीर्ष पर था। बाद में, सितंबर 2023 में, फाल्कन-180B उपलब्ध कराया गया, जिसमें एक कस्टम लाइसेंस है जो अनुसंधान और गैर-व्यावसायिक उद्देश्यों के लिए मुफ्त उपयोग की अनुमति देता है लेकिन व्यावसायिक तैनाती को प्रतिबंधित करता है। छोटे वेरिएंट, जैसे फाल्कन-3B और फाल्कन-11B, भी जारी किए गए हैं, जिसमें 11B मॉडल एक अलग अटेंशन तंत्र (मल्टी-क्वेरी अटेंशन) का उपयोग करता है और उल्लेखनीय दक्षता प्राप्त करता है।
सभी फाल्कन मॉडल हगिंग फेस हब पर उपलब्ध हैं, और उन्हें vLLM और TensorRT-LLM सहित विभिन्न अनुमान फ्रेमवर्क में एकीकृत किया गया है। मॉडलों को निर्देश-पालन और चैट अनुप्रयोगों के लिए भी फाइन-ट्यून किया गया है, जिसमें फाल्कन-7B-इंस्ट्रक्ट और फाल्कन-40B-इंस्ट्रक्ट जैसे आधिकारिक वेरिएंट शामिल हैं।
प्रदर्शन और बेंचमार्क
फाल्कन मॉडल ने कई बेंचमार्क पर प्रतिस्पर्धी प्रदर्शन प्रदर्शित किया है। उदाहरण के लिए, फाल्कन-40B ने MMLU (मैसिव मल्टीटास्क लैंग्वेज अंडरस्टैंडिंग) बेंचमार्क पर कई मौजूदा ओपन-सोर्स मॉडलों से बेहतर प्रदर्शन किया, 60.4% का स्कोर हासिल किया। फाल्कन-180B ने इन परिणामों में और सुधार किया, MMLU पर 70.4% और HellaSwag पर 68.2% स्कोर किया, और कई कार्यों पर PaLM-2 लार्ज जैसे मालिकाना मॉडलों के बराबर प्रदर्शन किया। कोडिंग बेंचमार्क पर, फाल्कन-180B ने HumanEval पर 19.3% का pass@1 स्कोर हासिल किया, जो अन्य बड़े मॉडलों के साथ प्रतिस्पर्धी है।
फाल्कन मॉडल की दक्षता एक प्रमुख विक्रय बिंदु है। मल्टी-क्वेरी अटेंशन का उपयोग मेमोरी फुटप्रिंट को कम करता है और अनुमान को तेज करता है, जिससे वे एकल GPU पर तैनाती के लिए उपयुक्त होते हैं। उदाहरण के लिए, फाल्कन-40B को क्वांटाइज़ेशन के साथ एक एकल A100 GPU पर चलाया जा सकता है, और फाल्कन-180B को कई GPU की आवश्यकता होती है लेकिन फिर भी यह एक अनुकूल प्रदर्शन-से-संसाधन अनुपात प्रदान करता है।
प्रभाव और पारिस्थितिकी तंत्र
फाल्कन मॉडल का ओपन-सोर्स एआई परिदृश्य पर महत्वपूर्ण प्रभाव पड़ा है। उन्हें कई फाइन-ट्यून किए गए वेरिएंट के लिए आधार मॉडल के रूप में उपयोग किया गया है, जिसमें निर्देश-ट्यून और चैट मॉडल शामिल हैं, और हगिंग फेस, रेप्लिकेट और AWS सेजमेकर जैसे प्लेटफार्मों में एकीकृत किया गया है। फाल्कन-40B और फाल्कन-180B की रिलीज़ ने कुशल बड़े मॉडल डिज़ाइन में और नवाचार को बढ़ावा देने में मदद की, जिससे बाद में लामा 2 और मिस्ट्रल जैसे मॉडल प्रभावित हुए। फाल्कन मॉडल एआई में TII के व्यापक अनुसंधान प्रयासों का भी हिस्सा हैं, जिसमें प्राकृतिक भाषा प्रसंस्करण और कंप्यूटर विज़न पर काम शामिल है।
छोटे फाल्कन मॉडल की अनुमोदक लाइसेंसिंग ने अनुसंधान और व्यावसायिक अनुप्रयोगों में व्यापक रूप से अपनाने को प्रोत्साहित किया है, जबकि बड़े मॉडल का उपयोग शैक्षणिक अध्ययनों और उद्योग पायलटों में किया गया है। फाल्कन परिवार ओपन-सोर्स लार्ज लैंग्वेज मॉडल के विकास में एक महत्वपूर्ण संदर्भ बिंदु बना हुआ है।