अंग्रेज़ी से अनुवादित

टेक्स्ट-टू-3D जनरेशन प्राकृतिक-भाषा विवरणों से त्रि-आयामी मॉडल या दृश्य उत्पन्न करता है, यह एक प्रारंभिक-चरण का क्षेत्र है जो डिफ्यूज़न मॉडल, न्यूरल रेडियंस फील्ड्स, और 3D गाऊसी स्प्लैटिंग में प्रगति पर आधारित है।

टेक्स्ट-टू-3D जनरेशन एक प्राकृतिक-भाषा Prompt से त्रि-आयामी मॉडल, मेश, या दृश्य उत्पन्न करने का कार्य है, न कि एक सपाट छवि या वीडियो। यह Text-to-image generation जनरेशन और 3D कंप्यूटर ग्राफिक्स के प्रतिच्छेदन पर स्थित है, और 2020 के दशक के मध्य तक यह अपने 2D समकक्षों की तुलना में कम परिपक्व रहा, जिससे उत्पन्न ज्यामिति और बनावट को अक्सर उत्पादन उपयोग के लिए मैन्युअल सफाई की आवश्यकता होती थी।

आधार

यह क्षेत्र दो ग्राफिक्स तकनीकों पर आधारित है जो गहन शिक्षा के साथ परिपक्व हुईं। न्यूरल रेडियंस फील्ड्स (NeRF), जिसे 2020 में पेश किया गया, एक 3D दृश्य को एक तंत्रिका नेटवर्क के रूप में दर्शाता है जो अंतरिक्ष में किसी भी बिंदु पर रंग और घनत्व की भविष्यवाणी करता है, जिससे इनपुट तस्वीरों के एक विरल सेट से फोटोरियलिस्टिक नए दृश्य प्रस्तुत किए जा सकते हैं। 3D गाऊसी स्प्लैटिंग, जिसे 2023 में पेश किया गया, एक दृश्य को नरम, रंगीन दीर्घवृत्तों के एक बड़े संग्रह के रूप में दर्शाता है जो इनपुट दृश्यों से मेल खाने के लिए अनुकूलित होते हैं, जो तुलनीय दृश्य गुणवत्ता के साथ बहुत तेज़ रेंडरिंग प्रदान करता है, और वास्तविक समय के अनुप्रयोगों के लिए NeRF का एक लोकप्रिय विकल्प बन गया। दोनों में से कोई भी तकनीक अकेले पाठ से नई सामग्री उत्पन्न नहीं करती; दोनों ऐसे प्रतिनिधित्व हैं जिन्हें प्रारंभिक टेक्स्ट-टू-3D सिस्टम ने 2D मॉडल से मार्गदर्शन का उपयोग करके अनुकूलित करना सीखा।

टेक्स्ट-टू-3D के दृष्टिकोण

प्रारंभिक टेक्स्ट-टू-3D विधियों, जैसे कि 2022 में DreamFusion, ने एक पूर्व-प्रशिक्षित टेक्स्ट-टू-इमेज Diffusion model को पर्यवेक्षी संकेत के रूप में उपयोग किया: एक 3D प्रतिनिधित्व को बार-बार यादृच्छिक दृष्टिकोण से प्रस्तुत किया गया, और प्रत्येक प्रस्तुत छवि को 2D प्रसार मॉडल के अनुसार पाठ संकेत से बेहतर मिलान करने के लिए प्रेरित किया गया, जो एक धीमी, प्रति-वस्तु अनुकूलन प्रक्रिया थी जो एक एकल परिणाम के लिए महत्वपूर्ण कंप्यूट संसाधन ले सकती थी। बाद के सिस्टम फीड-फॉरवर्ड जनरेशन की ओर बढ़े, एक नेटवर्क को प्रशिक्षित करके सीधे पाठ या एक एकल इनपुट छवि से एक 3D प्रतिनिधित्व की भविष्यवाणी करने के लिए, कुछ गुणवत्ता को नाटकीय रूप से तेज़ जनरेशन के लिए व्यापार करते हुए, जो कि टेक्स्ट-टू-इमेज मॉडल के अनुकूलन-आधारित से प्रत्यक्ष जनरेशन तक परिपक्व होने के करीब था।

अनुप्रयोग

टेक्स्ट-टू-3D उपकरण गेम विकास में तेज़ प्रोटोटाइपिंग, उत्पाद विज़ुअलाइज़ेशन, आभासी और संवर्धित वास्तविकता सामग्री, और फिल्म प्रीविज़ुअलाइज़ेशन के लिए संपत्ति निर्माण के लिए उपयोग किए जाते हैं, जहां एक मोटा 3D ड्राफ्ट महत्वपूर्ण मॉडलर समय बचा सकता है, भले ही इसे मैन्युअल परिष्करण की आवश्यकता हो। यह तकनीक World model अनुसंधान और Embodied AI के लिए संभावित इनपुट के रूप में बारीकी से देखी जाती है, क्योंकि एजेंट जो भौतिक या सिम्युलेटेड 3D वातावरण में योजना बनाते हैं और कार्य करते हैं, वे पूर्व-निर्मित संपत्तियों पर केवल निर्भर रहने के बजाय प्रशंसनीय 3D सामग्री और दृश्य उत्पन्न करने में सक्षम होने से लाभान्वित होते हैं।

सीमाएँ

2D छवि और वीडियो जनरेशन की तुलना में, टेक्स्ट-टू-3D आउटपुट आम तौर पर ज्यामितीय स्थिरता, बनावट गुणवत्ता, और मानक 3D सॉफ्टवेयर पाइपलाइनों में सीधे उपयोग योग्य स्वच्छ, संपादन योग्य मेश उत्पन्न करने की क्षमता में पीछे रहा है। मल्टी-व्यू स्थिरता, एक आकृति उत्पन्न करना जो हर कोण से सही दिखती है, न कि केवल अनुकूलन के दौरान देखे गए कोणों से, एक मुख्य तकनीकी चुनौती बनी रही। 2025 तक, टेक्स्ट-टू-3D को टेक्स्ट-टू-इमेज या टेक्स्ट-टू-वीडियो जनरेशन की तुलना में एक प्रारंभिक चरण का क्षेत्र माना जाता था, जिसमें प्रमुख प्रयोगशालाओं और विशेष स्टार्टअप दोनों से सक्रिय शोध था, लेकिन छवि डोमेन में Midjourney या Stable Diffusion के बराबर कोई एक प्रमुख वाणिज्यिक उत्पाद नहीं था।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:generative-ai·3d-graphics
इस पृष्ठ को अंतिम बार संपादित किया गया 2 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास