ऑर्थोगोनैलिटी थीसिस AI सुरक्षा के दर्शन में एक दावा है, जिसमें कहा गया है कि बुद्धिमत्ता और अंतिम लक्ष्य स्वतंत्र, या ऑर्थोगोनल, आयाम हैं: सिद्धांत रूप में, लगभग किसी भी स्तर की क्षमता को लगभग किसी भी अंतिम उद्देश्य के साथ जोड़ा जा सकता है। इस दृष्टिकोण पर, एक अतिबुद्धिमान प्रणाली स्वचालित रूप से मानव-अनुकूल मूल्यों पर केंद्रित नहीं होगी; यह एक तुच्छ या हानिकारक लक्ष्य पर असाधारण दक्षता लागू कर सकती है।
उत्पत्ति और कथन
यह थीसिस दार्शनिक निक बोस्ट्रॉम द्वारा उनके 2012 के पेपर "द सुपरइंटेलिजेंट विल" में प्रतिपादित की गई थी और उनकी 2014 की पुस्तक सुपरइंटेलिजेंस में विकसित की गई थी, जो एलीज़र युडकोव्स्की और तर्कवादी समुदाय के पहले के तर्कों पर आधारित थी। बोस्ट्रॉम ने इसे वाद्य अभिसरण थीसिस के साथ जोड़ा: अपने अंतिम लक्ष्य के बावजूद, एक पर्याप्त रूप से सक्षम एजेंट संसाधनों को प्राप्त करने, खुद को संरक्षित करने और शटडाउन का विरोध करने की प्रवृत्ति रखता है, क्योंकि ये उप-लक्ष्य लगभग किसी भी उद्देश्य को प्राप्त करने में मदद करते हैं। क्लासिक उदाहरण पेपरक्लिप मैक्सिमाइज़र है, एक काल्पनिक प्रणाली जो बिना किसी दुर्भावना के और त्रुटिहीन दक्षता के साथ सब कुछ पेपरक्लिप में बदल देती है।
AI जोखिम तर्कों में भूमिका
साथ में, ऑर्थोगोनैलिटी और वाद्य अभिसरण उस मामले की रीढ़ बनाते हैं जो AI से अस्तित्वगत जोखिम के लिए दुर्भावनापूर्ण मशीनों की आवश्यकता नहीं होती, केवल अपूर्ण रूप से निर्दिष्ट लक्ष्यों वाली सक्षम मशीनों की होती है। यह संरेखण अनुसंधान को प्रेरित करता है: यदि मूल्य बुद्धिमत्ता से डिफ़ॉल्ट रूप से उत्पन्न नहीं होते हैं, तो उन्हें इंजीनियर किया जाना चाहिए। यह तर्क एंथ्रोपिक और OpenAI में सुरक्षा एजेंडों और जेफ्री हिंटन और योशुआ बेंगियो सहित शोधकर्ताओं की सार्वजनिक चेतावनियों को प्रभावित करता है।
आलोचना
आलोचकों का तर्क है कि यह थीसिस तार्किक संभावना के बारे में एक दावा है, संभावना के बारे में नहीं: मानव डेटा पर प्रशिक्षित प्रणालियाँ, जैसे कि बड़े भाषा मॉडल जो RLHF द्वारा आकार दिए गए हैं, व्यवहार में मानव-समान लक्ष्य संरचनाओं को अवशोषित कर सकती हैं। अन्य, जिनमें यान लेकुन शामिल हैं, का तर्क है कि लक्ष्य इंजीनियर किए गए विकल्प हैं और पेपरक्लिप फ्रेमिंग वास्तविक प्रणालियों की स्वायत्तता को बढ़ा-चढ़ाकर पेश करती है। रक्षक जवाब देते हैं कि तैनात मॉडलों में देखा गया पुरस्कार हैकिंग अंतर्निहित गतिशीलता का छोटे पैमाने पर सबूत है।