अंग्रेज़ी से अनुवादित

OpenAI ने 18 जुलाई 2024 को GPT-4o mini जारी किया, जो एक लागत-कुशल छोटा भाषा मॉडल है, जो कम कीमत पर मजबूत प्रदर्शन प्रदान करता है, जिसका लक्ष्य व्यापक डेवलपर अपनाना है। यह उच्च-मात्रा वाले अनुप्रयोगों के लिए क्षमता और सामर्थ्य के बीच संतुलन बनाता है।

OpenAI ने 18 जुलाई, 2024 को GPT-4o mini को अपनी बड़े भाषा मॉडल श्रृंखला में एक कॉम्पैक्ट जोड़ के रूप में पेश किया। यह मॉडल बड़े सिस्टम की लागत के एक अंश पर मजबूत तर्क और मल्टीमोडल क्षमताएँ प्रदान करने के लिए डिज़ाइन किया गया था, जिससे उच्च-मात्रा वाले अनुप्रयोगों के लिए उन्नत जनरेटिव AI सुलभ हो गया। $0.15 प्रति मिलियन इनपुट टोकन और $0.60 प्रति मिलियन आउटपुट टोकन की कीमत पर, इसने कई प्रतिस्पर्धियों को कम कीमत पर पीछे छोड़ दिया, जबकि कई बेंचमार्क पर पूर्ण GPT-4o के करीब प्रदर्शन बनाए रखा। यह रिलीज़ दक्षता की ओर एक रणनीतिक बदलाव का संकेत था, जो उन डेवलपर्स को लक्षित करता था जिन्हें निषेधात्मक खर्चों के बिना विश्वसनीय AI की आवश्यकता थी।

GPT-4o mini आधुनिक गहन शिक्षण मॉडलों को रेखांकित करने वाली ट्रांसफॉर्मर आर्किटेक्चर पर आधारित है। यह टेक्स्ट और इमेज इनपुट संसाधित करता है, टेक्स्ट आउटपुट करता है, और 128,000 टोकन का कंटेक्स्ट विंडो सपोर्ट करता है। मॉडल का ज्ञान कटऑफ अक्टूबर 2023 है, और इसे OpenAI API, Azure OpenAI Service, और ChatGPT ऐप के माध्यम से मुफ्त और प्लस उपयोगकर्ताओं के लिए उपलब्ध कराया गया था। शुरुआती बेंचमार्क में इसने MMLU (विशाल मल्टीटास्क भाषा समझ) परीक्षण पर 82% स्कोर किया, जो Anthropic के Claude 3 Haiku और Google DeepMind के Gemini 1.5 Flash जैसे छोटे मॉडलों से बेहतर प्रदर्शन करते हुए, प्रति टोकन कम लागत पर था।

मॉडल डिज़ाइन और प्रशिक्षण

मॉडल को पर्यवेक्षित फाइन-ट्यूनिंग और AI फीडबैक से सुदृढीकरण सीखना (RLAIF) के मिश्रण का उपयोग करके प्रशिक्षित किया गया था, एक तकनीक जो आउटपुट को मानवीय अपेक्षाओं के साथ संरेखित करने के लिए AI-जनित प्राथमिकताओं का उपयोग करती है। यह दृष्टिकोण, पाठ्यक्रम सीखना और ग्रेडिएंट क्लिपिंग के साथ मिलकर, प्रशिक्षण को स्थिर करने और नमूना दक्षता में सुधार करने में मदद करता है। OpenAI ने सटीक पैरामीटर संख्या का खुलासा नहीं किया, लेकिन "मिनी" पदनाम ने GPT-4o की तुलना में एक छोटे पदचिह्न का संकेत दिया, जिसके अनुमानित रूप से एक ट्रिलियन से अधिक पैरामीटर हैं। कम आकार ने तेज़ अनुमान और कम विलंबता की अनुमति दी, जो चैटबॉट और कोडिंग सहायकों जैसे वास्तविक समय के अनुप्रयोगों के लिए महत्वपूर्ण है।

प्रशिक्षण डेटा में सार्वजनिक रूप से उपलब्ध टेक्स्ट और चित्र शामिल थे, जिन्हें व्यक्तिगत जानकारी और हानिकारक सामग्री को हटाने के लिए फ़िल्टर किया गया था। मॉडल को लेयर नॉर्मलाइज़ेशन और ड्रॉपआउट जैसी तकनीकों के साथ अनुकूलित किया गया था ताकि ओवरफिटिंग को रोका जा सके, और प्रशिक्षण के बाद अतिरेक को कम करने के लिए मॉडल प्रूनिंग लागू की गई थी। परिणाम एक ऐसा मॉडल था जिसने GPT-4o की अधिकांश तर्क क्षमता को बनाए रखा, जबकि कम कम्प्यूटेशनल शक्ति की आवश्यकता थी, जो सीमांत AI तक पहुंच को लोकतांत्रिक बनाने की दिशा में एक कदम था।

प्रदर्शन बेंचमार्क

मानक मूल्यांकनों पर, GPT-4o mini ने प्रतिस्पर्धी प्रदर्शन का प्रदर्शन किया। इसने MMLU पर 82%, MGSM (गणित शब्द समस्याएं) पर 87%, और कोड जनरेशन के लिए HumanEval पर 77% हासिल किया। मल्टीमोडल कार्यों में, इसने MMMU (विशाल बहु-विषय मल्टीमोडल समझ) पर 59.4% स्कोर किया, जो GPT-4o के 69.1% से पीछे था, लेकिन कई साथियों से अधिक था। मॉडल ने IFEval जैसे निर्देश-पालन बेंचमार्क पर भी मजबूत परिणाम दिखाए, जहां इसने 87.5% स्कोर किया, और बर्कले फंक्शन कॉलिंग लीडरबोर्ड पर, जहां इसने टूल-उपयोग परिदृश्यों में बड़े मॉडलों से बेहतर प्रदर्शन किया।

ये संख्याएं GPT-4o mini को अनुक्रम-से-अनुक्रम प्रसंस्करण की आवश्यकता वाले कार्यों के लिए एक व्यावहारिक विकल्प के रूप में स्थापित करती हैं, जैसे अनुवाद, सारांशीकरण, और ग्राहक सहायता। इसकी दक्षता मल्टी-हेड अटेंशन और पोजीशनल एन्कोडिंग जैसे वास्तुशिल्प विकल्पों से आई, जो मॉडल को अत्यधिक मेमोरी उपयोग के बिना लंबे अनुक्रमों को संभालने की अनुमति देते हैं। डेवलपर्स ने नोट किया कि मॉडल के टॉप-पी सैंपलिंग और तापमान स्केलिंग पैरामीटर ने आउटपुट रचनात्मकता पर सूक्ष्म नियंत्रण दिया, जो विभिन्न अनुप्रयोगों के लिए उपयोगी था।

लागत और पहुंच

मूल्य निर्धारण लॉन्च की एक केंद्रीय विशेषता थी। $0.15 प्रति मिलियन इनपुट टोकन और $0.60 प्रति मिलियन आउटपुट टोकन पर, GPT-4o mini GPT-4o से 60% से अधिक सस्ता था, जो क्रमशः $5 और $15 चार्ज करता था। इसने इसे स्टार्टअप और उद्यमों के लिए व्यवहार्य बना दिया जो प्रतिदिन लाखों अनुरोध संसाधित करते हैं। मॉडल को Amazon Web Services में AWS Trainium अनुकूलित इंस्टेंस के माध्यम से एकीकृत किया गया था, और Google Cloud और Oracle Cloud ने इसे अपने मार्केटप्लेस के माध्यम से पेश किया। Groq और SambaNova ने भी समर्थन की घोषणा की, कम-विलंबता सर्विसिंग के लिए अपने कस्टम हार्डवेयर का लाभ उठाते हुए।

OpenAI ने मॉडल को GPT-3.5 Turbo के प्रतिस्थापन के रूप में स्थान दिया, जो कई डेवलपर्स के लिए डिफ़ॉल्ट था। कंपनी ने बेहतर प्रदर्शन और कम लागत का हवाला देते हुए प्रवासन को प्रोत्साहित किया। Apple और Samsung डिवाइस एकीकरण के लिए, छोटे मॉडल आकार ने कुछ मामलों में ऑन-डिवाइस अनुमान सक्षम किया, हालांकि अधिकांश तैनाती क्लाउड-आधारित रही। API ने निर्धारक आउटपुट के लिए बीम सर्च और टॉप-के सैंपलिंग का समर्थन किया, जो उद्यम उपयोगकर्ताओं को आकर्षित करता था।

उद्योग संदर्भ

यह लॉन्च मशीन लर्निंग क्षेत्र में तीव्र प्रतिस्पर्धा के बीच हुआ। Anthropic का Claude 3 Haiku और Google DeepMind का Gemini 1.5 Flash सीधे प्रतिद्वंद्वी थे, प्रत्येक लागत और क्षमता के बीच समान ट्रेड-ऑफ पेश करता था। GPT-4o mini की आक्रामक मूल्य निर्धारण ने इन कंपनियों को अपने स्वयं के स्तरों को समायोजित करने के लिए दबाव डाला। विश्लेषकों ने नोट किया कि मॉडल की दक्षता स्वास्थ्य सेवा, वित्त, और शिक्षा जैसे क्षेत्रों में जनरेटिव AI के गोद लेने में तेजी ला सकती है, जहां बजट की कमी ने पहले उपयोग को सीमित कर दिया था।

रिलीज़ ने छोटे, विशेष मॉडलों की ओर एक प्रवृत्ति को भी उजागर किया। MIT CSAIL और Stanford AI Lab के शोधकर्ताओं ने ऐसे दृष्टिकोणों की वकालत की थी, यह तर्क देते हुए कि हर कार्य के लिए एक विशाल तंत्रिका नेटवर्क की आवश्यकता नहीं होती। GPT-4o mini ने इस दर्शन को मूर्त रूप दिया, एक ऐसा संतुलन पेश किया जो कई डेवलपर्स को आकर्षक लगा। मॉडल की सफलता ने मॉडल प्रूनिंग और डिस्टिलेशन तकनीकों में और निवेश को प्रोत्साहित किया, जिसमें Alibaba Damo Academy और AI21 Labs ने समान पहल की घोषणा की।

तकनीकी नवाचार

जबकि GPT-4o mini ने मौलिक रूप से नए आर्किटेक्चर पेश नहीं किए, इसने मौजूदा लोगों को परिष्कृत किया। मॉडल ने मल्टीमोडल फ्यूजन के लिए क्रॉस-अटेंशन परतों के साथ एक डिकोडर-ओनली ट्रांसफॉर्मर का उपयोग किया, जिससे यह दृश्य और पाठ्य सुविधाओं को संरेखित कर सके। प्रशिक्षण में Adam ऑप्टिमाइज़र का उपयोग लर्निंग रेट शेड्यूल के साथ किया गया जो गर्म होकर फिर घटता गया, एक मानक लेकिन प्रभावी दृष्टिकोण। प्रारंभिक प्रशिक्षण को स्थिर करने के लिए बैच नॉर्मलाइज़ेशन लागू किया गया था, हालांकि बाद की परतें स्थिरता के लिए लेयर नॉर्मलाइज़ेशन पर निर्भर थीं।

मॉडल में अवशिष्ट कनेक्शन भी शामिल थे ताकि लुप्त होते ग्रेडिएंट को कम किया जा सके, जिससे प्रदर्शन हानि के बिना गहरे स्टैक सक्षम हो सकें। वेट इनिशियलाइज़ेशन ने Xavier इनिशियलाइज़ेशन का एक प्रकार उपयोग किया, और लॉस फ़ंक्शन लेबल स्मूथिंग के साथ मानक क्रॉस-एन्ट्रॉपी थे। ये विकल्प, हालांकि नए नहीं थे, AMD और Intel हार्डवेयर, साथ ही NVIDIA GPU पर दक्षता को अधिकतम करने के लिए ट्यून किए गए थे। OpenAI ने दावा किया कि मॉडल कुछ कार्यों के लिए एक एकल TSMC-निर्मित चिप पर चल सकता है, हालांकि यह स्वतंत्र रूप से सत्यापित नहीं किया गया था।

तैनाती और उपयोग के मामले

प्रारंभिक अपनाने वालों में TomTom शामिल था, जिसने वास्तविक समय नेविगेशन सहायता के लिए GPT-4o mini का उपयोग किया, और Intuitive Surgical, जिसने सर्जिकल दस्तावेज़ीकरण के लिए इसकी खोज की। Commure ने रोगी ट्राइएज के लिए मॉडल को अपने स्वास्थ्य सेवा प्लेटफ़ॉर्म में एकीकृत किया, जबकि BigBear.ai ने इसे आपूर्ति श्रृंखला विश्लेषण पर लागू किया। मॉडल की कम विलंबता ने इसे Waymo की स्वायत्त वाहन संचार प्रणालियों के लिए उपयुक्त बना दिया, जहां त्वरित प्रतिक्रियाएं महत्वपूर्ण हैं।

डेवलपर्स ने फ़ंक्शन कॉलिंग के लिए मॉडल के समर्थन की सराहना की, जिसने इसे बाहरी API और डेटाबेस के साथ बातचीत करने की अनुमति दी। यह क्षमता, RLAIF-ट्यून किए गए निर्देश पालन के साथ मिलकर, AI एजेंटों के निर्माण के लिए एक मजबूत उम्मीदवार बना दिया। Figure AI और Sanctuary AI ने रोबोटिक नियंत्रण के लिए मॉडल का उपयोग करने का प्रयोग किया, हालांकि उन्होंने नोट किया कि भौतिक-दुनिया के कार्यों के लिए अतिरिक्त फाइन-ट्यूनिंग की आवश्यकता थी। मॉडल के छोटे आकार ने डेटा ऑग्मेंटेशन पाइपलाइनों को भी सुविधाजनक बनाया, जहां इसने अन्य मॉडलों को प्रशिक्षित करने के लिए सिंथेटिक उदाहरण उत्पन्न किए।

स्वागत और आलोचना

स्वागत काफी हद तक सकारात्मक था, डेवलपर्स ने लागत-प्रदर्शन अनुपात की प्रशंसा की। हालांकि, कुछ आलोचकों ने बताया कि मॉडल में अभी भी पूर्वाग्रह और कभी-कभी तथ्यात्मक त्रुटियां प्रदर्शित होती हैं, जो बड़े भाषा मॉडल में आम मुद्दे हैं। गोपनीयता अधिवक्ताओं ने डेटा हैंडलिंग के बारे में चिंता उठाई, हालांकि OpenAI ने कहा कि API इनपुट डिफ़ॉल्ट रूप से प्रशिक्षण के लिए उपयोग नहीं किए जाते थे। मॉडल का अक्टूबर 2023 का ज्ञान कटऑफ का मतलब था कि इसमें हाल की घटनाओं के बारे में जागरूकता की कमी थी, जो समय-संवेदनशील अनुप्रयोगों के लिए एक सीमा थी।

प्रतिस्पर्धियों ने तेजी से प्रतिक्रिया दी। Google DeepMind ने Gemini 1.5 Flash के लिए कीमतें कम कीं, और Anthropic ने Claude 3 Haiku के लिए एक सस्ता स्तर पेश किया। Meta और Mistral ने भी अपने छोटे-मॉडल प्रयासों को तेज किया। लॉन्च ने कुशल AI की ओर दौड़ को तेज कर दिया, जिसमें Nokia Bell Labs और Xerox PARC ने गुणवत्ता का त्याग किए बिना मॉडल आकार को और कम करने पर शोध प्रकाशित किया।

भविष्य का दृष्टिकोण

OpenAI ने संकेत दिया कि GPT-4o mini को नियमित अपडेट मिलेंगे, जिसमें बेहतर तर्क और विस्तारित मल्टीमोडल समर्थन शामिल है। कंपनी ने एक उत्तराधिकारी का भी संकेत दिया, संभवतः GPT-4o mini 2 नामित, जो उपयोगकर्ता फीडबैक से सबक शामिल करेगा। 2024 के अंत तक, मॉडल डेवलपर्स के लिए एक लोकप्रिय विकल्प बना रहा, API के माध्यम से प्रतिदिन 100 मिलियन से अधिक टोकन संसाधित होते थे। GPT-4o mini की सफलता ने इस विचार को मजबूत किया कि छोटे, लागत प्रभावी मॉडल बड़े लोगों के पूरक हो सकते हैं, एक दृष्टिकोण जो Berkeley AI Research और University of Toronto के शोधकर्ताओं द्वारा प्रतिध्वनित किया गया।

मॉडल का प्रभाव वाणिज्यिक उपयोग से परे बढ़ा। Carnegie Mellon University और Oxford University जैसे शैक्षणिक संस्थानों ने मशीन लर्निंग अवधारणाओं को पढ़ाने के लिए इसे अपनाया, इसकी पहुंच का हवाला देते हुए। गैर-लाभकारी संगठनों ने कम सेवा वाले क्षेत्रों में दस्तावेज़ विश्लेषण और अनुवाद के लिए इसका उपयोग किया। जैसे-जैसे AI विकसित होता रहता है, GPT-4o mini दक्षता के लिए एक बेंचमार्क के रूप में खड़ा है, यह प्रदर्शित करता है कि उच्च प्रदर्शन को प्रीमियम मूल्य पर आने की आवश्यकता नहीं है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:openai·large-language-model·generative-ai·ai-launch
इस पृष्ठ को अंतिम बार संपादित किया गया 12 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास