GPT Image 1.5 एक जनरेटिव आर्टिफिशियल इंटेलिजेंस मॉडल है जिसे OpenAI द्वारा छवि निर्माण और संपादन के लिए विकसित किया गया है। 2025 में जारी, यह GPT Image 1 का उत्तराधिकारी है और ChatGPT तथा OpenAI API में एकीकृत है, जिससे उपयोगकर्ता प्राकृतिक भाषा संकेतों से छवियां उत्पन्न और संशोधित कर सकते हैं। यह मॉडल OpenAI के बड़े भाषा मॉडल आर्किटेक्चर पर आधारित है, जो मल्टीमॉडल समझ को डिफ्यूजन-आधारित छवि संश्लेषण के साथ जोड़ता है।
GPT Image 1.5 की घोषणा OpenAI द्वारा 2025 की शुरुआत में की गई थी, जिसका सार्वजनिक रिलीज़ मार्च 2025 में हुआ। यह ChatGPT Plus, Pro, और Team सब्सक्राइबर्स के साथ-साथ डेवलपर्स के लिए API के माध्यम से उपलब्ध हुआ। यह मॉडल OpenAI के एंटरप्राइज़ ऑफरिंग के माध्यम से भी सुलभ है, जिसमें Microsoft Azure का Azure OpenAI Service शामिल है।
क्षमताएँ
GPT Image 1.5 अपने पूर्ववर्ती की तुलना में कई सुधार प्रस्तुत करता है, जिसमें उच्च रिज़ॉल्यूशन आउटपुट (2048x2048 पिक्सेल तक), जटिल संकेतों का बेहतर पालन, और छवियों के भीतर पाठ का अधिक सटीक प्रतिपादन शामिल है। यह मॉडल मल्टी-टर्न संपादन का समर्थन करता है, जिससे उपयोगकर्ता संवादात्मक निर्देशों के माध्यम से छवियों को परिष्कृत कर सकते हैं। यह कई आउटपुट में सुसंगत पात्रों और शैलियों के साथ छवियां भी उत्पन्न कर सकता है, जो रचनात्मक पेशेवरों के लिए लक्षित एक विशेषता है।
OpenAI के तकनीकी दस्तावेज़ के अनुसार, GPT Image 1.5 एक हाइब्रिड दृष्टिकोण का उपयोग करता है जो लेआउट और संरचना के लिए एक ऑटोरेग्रेसिव ट्रांसफॉर्मर को पिक्सेल-स्तरीय विवरण के लिए एक डिफ्यूजन डिकोडर के साथ जोड़ता है। यह अधिक सुसंगत दृश्यों को सक्षम बनाता है और विकृत हाथों या गड़बड़ पाठ जैसे सामान्य कलाकृतियों को कम करता है।
प्रदर्शन और बेंचमार्क
आंतरिक मूल्यांकन में, OpenAI ने बताया कि GPT Image 1.5 ने MMMU (मल्टीमॉडल मल्टीडिसिप्लिनरी अंडरस्टैंडिंग) बेंचमार्क और फोटोरियलिज्म तथा संकेत संरेखण के लिए मानव प्राथमिकता परीक्षणों पर GPT Image 1 से बेहतर प्रदर्शन किया। स्वतंत्र बेंचमार्क, जैसे कि आर्टिफिशियल एनालिसिस इंटेलिजेंस इंडेक्स से, ने GPT Image 1.5 को 2025 में शीर्ष छवि निर्माण मॉडलों में स्थान दिया, जो Google DeepMind और अन्य प्रयोगशालाओं के सिस्टम को टक्कर देता है।
मॉडल ने बारीक विवरणों, जैसे छोटे पाठ, लोगो, और वैज्ञानिक आरेखों के साथ छवियां उत्पन्न करने में भी बेहतर क्षमताओं का प्रदर्शन किया। OpenAI ने नोट किया कि GPT Image 1.5 ने पिछले संस्करण की तुलना में लंबे पाठ के अंशों को प्रस्तुत करने में त्रुटियों को लगभग 40% कम किया।
API और मूल्य निर्धारण
GPT Image 1.5 OpenAI API के माध्यम से एक स्तरीय मूल्य संरचना के साथ उपलब्ध है। रिलीज़ के समय, मॉडल की कीमत मानक रिज़ॉल्यूशन (1024x1024) के लिए $0.02 प्रति छवि और उच्च रिज़ॉल्यूशन (2048x2048) के लिए $0.08 प्रति छवि थी। API गुणवत्ता, आकार, और शैली के लिए पैरामीटर का समर्थन करता है, और मौजूदा चैट पूर्णता एंडपॉइंट के साथ एकीकृत होता है।
डेवलपर्स GPT Image 1.5 का उपयोग मार्केटिंग सामग्री निर्माण से लेकर डिज़ाइन प्रोटोटाइपिंग तक के अनुप्रयोगों के लिए कर सकते हैं। OpenAI एंटरप्राइज़ ग्राहकों के लिए फाइन-ट्यूनिंग विकल्प भी प्रदान करता है, जो विशिष्ट डेटासेट पर अनुकूलन की अनुमति देता है, हालांकि यह सुविधा चुनिंदा भागीदारों तक सीमित है।
सुरक्षा और सीमाएँ
OpenAI ने GPT Image 1.5 के लिए कई सुरक्षा उपाय लागू किए हैं, जिसमें हानिकारक या भ्रामक कल्पना की पीढ़ी को रोकने के लिए सामग्री फ़िल्टर शामिल हैं। मॉडल में AI-जनित सामग्री को इंगित करने के लिए एक C2PA वॉटरमार्क शामिल है, और OpenAI ने सहमति के बिना सार्वजनिक हस्तियों के यथार्थवादी चेहरों की पीढ़ी को प्रतिबंधित किया है। इन उपायों के बावजूद, मॉडल अभी भी पक्षपाती या गलत प्रतिनिधित्व उत्पन्न कर सकता है, और OpenAI उपयोगकर्ताओं को तथ्यात्मक शुद्धता के लिए आउटपुट की समीक्षा करने की सलाह देता है।
अन्य तंत्रिका नेटवर्क मॉडल की तरह, GPT Image 1.5 में अमूर्त अवधारणाओं को समझने में सीमाएँ हैं और यह अत्यधिक विशिष्ट या अस्पष्ट संकेतों के साथ संघर्ष कर सकता है। मॉडल के प्रशिक्षण डेटा में इंटरनेट से सार्वजनिक रूप से उपलब्ध छवियां और पाठ शामिल हैं, जो सांस्कृतिक पूर्वाग्रहों को पेश कर सकते हैं।
स्वागत
GPT Image 1.5 को प्रौद्योगिकी मीडिया और रचनात्मक समुदायों से इसकी बेहतर पाठ प्रतिपादन और संपादन क्षमताओं के लिए सकारात्मक समीक्षा मिली। आलोचकों ने नोट किया कि हालांकि यह पेशेवर डिज़ाइन टूल को पूरी तरह से प्रतिस्थापित नहीं करता है, यह तेजी से दृश्य प्रोटोटाइपिंग के लिए बाधा को काफी कम करता है। भ्रामक छवियां बनाने में दुरुपयोग की संभावना के बारे में कुछ चिंताएं उठाई गईं, जिससे OpenAI को अपनी उपयोग नीतियों को अद्यतन करने के लिए प्रेरित किया गया।
2025 के मध्य तक, GPT Image 1.5 को विज्ञापन, ई-कॉमर्स, और शिक्षा जैसे उद्योगों में व्यापक रूप से अपनाया गया था। यह उदाहरणात्मक आंकड़े और डेटा विज़ुअलाइज़ेशन उत्पन्न करने के लिए अकादमिक अनुसंधान में भी एक सामान्य उपकरण बन गया।