GPT Image, टेक्स्ट-टू-इमेज जनरेशन मॉडलों का एक परिवार है, जिसे OpenAI द्वारा विकसित किया गया है। इसने OpenAI की इमेज जनरेशन श्रृंखला के रूप में पहले के DALL-E श्रृंखला का स्थान ले लिया है, और DALL-E के विपरीत यह स्वाभाविक रूप से मल्टीमोडल है: इमेज जनरेशन उसी मॉडल परिवार द्वारा किया जाता है जो ChatGPT को शक्ति प्रदान करता है, न कि एक अलग डिफ्यूजन मॉडल द्वारा जिसे ब्रिज प्रॉम्प्ट के माध्यम से बुलाया जाता है।
सदस्य
- GPT Image 1 (अप्रैल 2025)। ChatGPT की मूल इमेज जनरेशन तकनीक का पहला API रिलीज़, जो कुछ सप्ताह पहले स्टूडियो घिब्ली-शैली पोर्ट्रेट लहर के माध्यम से वायरल हो गया था। इसने परिवार की प्रमुख विशेषताओं को स्थापित किया: सुपाठ्य इन-इमेज टेक्स्ट और मजबूत निर्देश-पालन।
- GPT Image 1.5 (2025 के अंत)। एक अंतरिम अपग्रेड जिसमें बेहतर संपादन सटीकता और तेज़ जनरेशन है।
- GPT Image 2 (2026)। वर्तमान प्रमुख मॉडल, जिसमें बेहतर फोटोरियलिज्म, लंबे टेक्स्ट रेंडरिंग और पहचान-संरक्षण संपादन है।
महत्व
इस परिवार की मूल मल्टीमोडैलिटी ने प्रॉम्प्ट-लेखन अभ्यास को बदल दिया। चूंकि जनरेटर संवादात्मक संदर्भ और संरचित ब्रीफ को सीधे समझता है, प्रॉम्प्ट इंजीनियर कीवर्ड सूचियों (डिफ्यूजन-युग शैली जो अभी भी Stable Diffusion चेकपॉइंट्स की विशिष्ट है) से लंबे-प्रारूप प्राकृतिक भाषा ब्रीफ की ओर चले गए, जिसमें स्पष्ट प्रतिबंध शामिल हैं - एक शैली जो अब प्रॉम्प्ट-साझाकरण प्लेटफार्मों पर हावी है। विकिप्रॉम्प्ट पर, GPT Image परिवार के मॉडल मिलकर कैटलॉग में इमेज प्रॉम्प्ट का सबसे बड़ा हिस्सा रखते हैं।
यह भी देखें
- DALL-E, पूर्ववर्ती श्रृंखला
- नैनो बनाना, Google की प्रतिस्पर्धी इमेज मॉडल लाइन
- मिडजर्नी