GPT Image 1 एक पाठ-से-छवि निर्माण मॉडल है जिसे OpenAI द्वारा विकसित किया गया और अप्रैल 2025 में OpenAI API के माध्यम से जारी किया गया। यह मूल छवि निर्माण क्षमता का उत्पादित संस्करण है जो मार्च 2025 में ChatGPT के भीतर शामिल की गई थी, जिसका लॉन्च उपभोक्ता AI में सबसे वायरल क्षणों में से एक बन गया: स्टूडियो घिबली-शैली पोर्ट्रेट प्रवृत्ति ने इतना ट्रैफ़िक उत्पन्न किया कि OpenAI ने अस्थायी रूप से मुफ्त उपयोगकर्ताओं के लिए छवि निर्माण को सीमित कर दिया।
GPT Image 1 ने DALL-E 3 को OpenAI की छवि मॉडल के रूप में सफल बनाया। वास्तुशिल्प परिवर्तन महत्वपूर्ण था: एक मध्यस्थ के माध्यम से संकेतित प्रसार मॉडल के बजाय, GPT Image 1 एक बहुविध ट्रांसफॉर्मर के भीतर मूल रूप से छवियाँ उत्पन्न करता है, जिससे इसे संवादात्मक संदर्भ जागरूकता और काफी बेहतर निर्देश पालन मिलता है।
क्षमताएँ
रिलीज़ के समय, GPT Image 1 ने दो क्षेत्रों में क्षेत्र का नेतृत्व किया जिन्होंने वर्षों से प्रसार मॉडल उपयोगकर्ताओं को निराश किया था:
- छवियों में सुपाठ्य पाठ। संकेत, पोस्टर, उत्पाद लेबल और इंटरफ़ेस मॉकअप सटीक वर्तनी के साथ उन दरों पर प्रस्तुत किए गए जिन्हें पहले के मॉडल मेल नहीं खा सकते थे।
- संकेत पालन। बहु-बाधा ब्रीफ़ (विशिष्ट वस्तु गणना, स्थानिक लेआउट, शैली मिश्रण) विश्वसनीय रूप से अनुसरण किए गए, जिससे संरचित लंबे-रूप संकेत व्यावहारिक हो गए।
यह मास्क के साथ छवि संपादन, संदर्भ-छवि इनपुट और पारदर्शी पृष्ठभूमि का भी समर्थन करता था, जिससे यह उत्पाद फोटोग्राफी और डिज़ाइन वर्कफ़्लो के लिए लोकप्रिय हो गया।
विरासत
GPT Image 1 ने उस संकेत शैली को परिभाषित किया जो वर्तमान युग पर हावी है: अनुभागों में आयोजित लंबी प्राकृतिक-भाषा ब्रीफ़, अक्सर फोटोग्राफी से उधार ली गई कैमरा शब्दावली के साथ। इसके बाद GPT Image 1.5 और फिर GPT Image 2 आया, जिसने उसी दृष्टिकोण का विस्तार किया। देखें GPT Image परिवार।