अंग्रेज़ी से अनुवादित

लैटेंट स्पेस एक संपीड़ित, निम्न-आयामी प्रतिनिधित्व है जो एक तंत्रिका नेटवर्क अपने प्रशिक्षण डेटा की अंतर्निहित संरचना को एन्कोड करने के लिए सीखता है, जहाँ अर्थगत रूप से समान इनपुट एक-दूसरे के पास स्थित होते हैं।

एक लेटेंट स्पेस एक संपीड़ित, निम्न-आयामी स्थान है जिसे एक तंत्रिका नेटवर्क अपने प्रशिक्षण डेटा की संरचना का प्रतिनिधित्व करने के लिए आंतरिक रूप से सीखता है। कच्चे पिक्सेल, शब्दों या ऑडियो नमूनों को संग्रहीत करने के बजाय, जो मॉडल लेटेंट स्पेस का उपयोग करते हैं, वे इनपुट को अमूर्त संख्यात्मक निर्देशांकों या वैक्टरों के एक समूह में मैप करते हैं, जिन्हें इस प्रकार चुना जाता है कि समान अर्थ या रूप वाले इनपुट एक-दूसरे के पास स्थित हों। यह विचार Deep learning में व्यापक रूप से उपयोग किया जाता है, जिसमें Autoencoder और Generative adversarial network से लेकर आधुनिक Diffusion model और Embedding-आधारित खोज प्रणालियाँ शामिल हैं।

उत्पत्ति

यह विचार सांख्यिकी में पहले की आयाम-न्यूनीकरण विधियों से जुड़ा हुआ है, लेकिन यह ऑटोएन्कोडर के माध्यम से मुख्यधारा की मशीन लर्निंग में आया, जो एक Neural network है जिसे एक इनपुट को बाधा परत में संपीड़ित करने और फिर उसका पुनर्निर्माण करने के लिए प्रशिक्षित किया जाता है। बाधा परत के मान ही लेटेंट प्रतिनिधित्व होते हैं। 2013 में पेश किए गए वैरिएशनल ऑटोएन्कोडर ने लेटेंट स्पेस को एक सहज संभाव्यता वितरण का पालन करने के लिए बाध्य करके इसे विस्तारित किया, जिससे उस स्थान में यादृच्छिक बिंदु चुनकर नए, प्रशंसनीय आउटपुट का नमूना लेना संभव हो गया। कार्य की एक समानांतर श्रृंखला, Word2vec (2013) ने दिखाया कि पाठ पर प्रशिक्षित एक लेटेंट स्पेस शब्दों के बीच अनुरूप संबंधों को पकड़ सकता है, जिससे यह विचार लोकप्रिय हुआ कि लेटेंट स्पेस में दिशा और दूरी अर्थ रखती है।

जनरेटिव मॉडल में भूमिका

जनरेटिव एडवरसैरियल नेटवर्क के साथ लेटेंट स्पेस छवि निर्माण का केंद्र बन गया, जिसका जनरेटर यादृच्छिक लेटेंट वैक्टरों को यथार्थवादी छवियों में मैप करना सीखता है। यह लेटेंट डिफ्यूजन के साथ और भी महत्वपूर्ण हो गया, जो Stable Diffusion और संबंधित प्रणालियों के पीछे की तकनीक है: सीधे पिक्सेल पर धीमी डीनॉइज़िंग प्रक्रिया चलाने के बजाय, मॉडल एक ऑटोएन्कोडर के साथ एक छवि को एक छोटे लेटेंट ग्रिड में संपीड़ित करता है, वहाँ डिफ्यूजन-मॉडल चरणों को निष्पादित करता है, और केवल अंत में पिक्सेल में डिकोड करता है। इसने उच्च-रिज़ॉल्यूशन Text-to-image generation निर्माण को चलाने के लिए नाटकीय रूप से सस्ता बना दिया। CLIP जैसी मल्टीमोडल प्रणालियाँ छवियों और पाठ के लिए एक साझा लेटेंट स्पेस सीखती हैं, ताकि एक कैप्शन और उसकी मेल खाती तस्वीर एक-दूसरे के पास स्थित हों, जो कि पहले स्थान पर एक डिफ्यूजन मॉडल को टेक्स्ट प्रॉम्प्ट द्वारा निर्देशित करने की अनुमति देता है।

इंटरपोलेशन, अंकगणित और खोज

क्योंकि एक अच्छी तरह से निर्मित लेटेंट स्पेस में निकटवर्ती बिंदु अर्थपूर्ण रूप से समान होते हैं, चिकित्सक एक आउटपुट को दूसरे में रूपांतरित करने के लिए दो बिंदुओं के बीच सुचारू रूप से इंटरपोलेट कर सकते हैं, या वेक्टर अंकगणित कर सकते हैं, जिसका एक प्रसिद्ध प्रारंभिक उदाहरण शब्द एम्बेडिंग में "राजा घटा आदमी जोड़ स्त्री बराबर रानी" है। यही गुण Semantic search का आधार है: दस्तावेज़ और क्वेरी एक साझा लेटेंट स्पेस में एम्बेड किए जाते हैं, और एक Vector database सटीक कीवर्ड मिलान के बजाय निकटवर्ती वैक्टर ढूँढता है। छवि मॉडल में, एक खोजी गई दिशा के साथ एक लेटेंट वेक्टर को संपादित करना मॉडल को फिर से प्रशिक्षित किए बिना आउटपुट की एक विशेषता, जैसे प्रकाश या मुद्रा, को बदल सकता है।

सीमाएँ

लेटेंट स्पेस सीखे जाते हैं, डिज़ाइन नहीं किए जाते, इसलिए उनकी संरचना व्याख्या योग्य या समान रूप से व्यवस्थित होने की गारंटी नहीं है; क्षेत्र उलझे हुए हो सकते हैं, जिसका अर्थ है कि एक एकल आयाम कई दृश्य विशेषताओं को एक साथ प्रभावित करता है। Mechanistic interpretability में काम ने लेटेंट प्रतिनिधित्व को अधिक पारदर्शी बनाने की कोशिश की है, मिश्रित सफलता के साथ, और एक लेटेंट स्पेस की ज्यामिति मॉडल संस्करणों के बीच काफी बदल सकती है, जिससे सीखी गई दिशाओं को मॉडलों के बीच पुन: उपयोग करने के प्रयास जटिल हो जाते हैं।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:deep-learning·generative-ai·representation-learning
इस पृष्ठ को अंतिम बार संपादित किया गया 2 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास