एक एआई एजेंट, जिसे एजेंटिक एआई के रूप में भी जाना जाता है, एक स्वायत्त इकाई है जो सेंसर के माध्यम से अपने वातावरण को समझती है और विशिष्ट लक्ष्यों को प्राप्त करने के लिए एक्चुएटर्स के माध्यम से उस पर कार्य करती है। यह अवधारणा कृत्रिम बुद्धिमत्ता की एजेंट-आधारित परिभाषा के केंद्र में है, जो एआई को बुद्धिमान एजेंटों के अध्ययन और डिजाइन के रूप में वर्णित करती है। एजेंट सरल नियंत्रण प्रणालियों, जैसे थर्मोस्टेट, से लेकर अत्यधिक जटिल प्रणालियों, जैसे स्व-चालित कार या मानव, तक हो सकते हैं, और वे समय के साथ मशीन-लर्निंग या ज्ञान प्राप्त करके अपने प्रदर्शन में सुधार कर सकते हैं।
"बुद्धिमान एजेंट" शब्द कृत्रिम-बुद्धिमत्ता के व्यापक क्षेत्र से उत्पन्न हुआ है, जहां स्टुअर्ट रसेल और पीटर नॉरविग की पाठ्यपुस्तकें इसे किसी भी चीज़ के रूप में परिभाषित करती हैं जो अपने वातावरण को समझती है और क्रियाएं करती है। एक तर्कसंगत एजेंट उन क्रियाओं का चयन करता है जो उसके प्रदर्शन माप को अधिकतम करने की उम्मीद होती है, उसके अवधारणात्मक अनुक्रम, पूर्व ज्ञान और उपलब्ध क्रियाओं को देखते हुए। यह तर्कसंगतता सर्वज्ञता या गारंटीकृत सफलता की मांग नहीं करती; यह उपलब्ध जानकारी के आधार पर अपेक्षित परिणाम से संबंधित है। एजेंटों को स्वायत्तता, पर्यावरणीय परिवर्तनों के प्रति प्रतिक्रियाशीलता, और लक्ष्य-निर्देशित या सक्रिय व्यवहार जैसे गुणों द्वारा भी चित्रित किया जाता है, जिन्हें अक्सर विश्वास-इच्छा-इरादा (बीडीआई) जैसी वास्तुकलाओं का उपयोग करके मॉडल किया जाता है।
उद्देश्य फलन
उद्देश्य फलन, जिसे लक्ष्य फलन भी कहा जाता है, एक बुद्धिमान एजेंट के लक्ष्यों को निर्दिष्ट करता है और सफलता के माप के रूप में कार्य करता है। एक एजेंट को अधिक बुद्धिमान माना जाता है यदि वह लगातार ऐसी क्रियाओं का चयन करता है जो इस फलन के साथ बेहतर संरेखित परिणाम उत्पन्न करती हैं। फलन सरल हो सकता है, जैसे गो खेल में जीत के लिए +1 और हार के लिए -1 निर्धारित करना, या जटिल, जिसमें एजेंट को पिछली क्रियाओं का मूल्यांकन और सीखना आवश्यक हो। यह सभी लक्ष्यों को समाहित करता है और संघर्षरत उद्देश्यों के बीच समझौते को शामिल करता है, जैसा कि एक स्व-चालित कार में सुरक्षा, गति और यात्री आराम को संतुलित करने में देखा जाता है।
विभिन्न संदर्भ इस अवधारणा के लिए विभिन्न शब्दों का उपयोग करते हैं। अर्थशास्त्र और निर्णय सिद्धांत में, यह एक उपयोगिता फलन है; अनुकूलन में, एक उद्देश्य फलन; मशीन-लर्निंग में, एक हानि फलन; सुदृढीकरण-लर्निंग में, एक पुरस्कार फलन; और विकासवादी प्रणालियों में, एक फिटनेस फलन। लक्ष्यों को स्पष्ट रूप से प्रोग्राम किया जा सकता है या सीखने या विकास के माध्यम से प्रेरित किया जा सकता है। उदाहरण के लिए, एक सुदृढीकरण लर्निंग एजेंट संचयी पुरस्कार को अधिकतम करना सीखता है, जबकि एक विकासवादी एल्गोरिदम का व्यवहार एक फिटनेस फलन द्वारा निर्देशित होता है जो निर्धारित करता है कि कौन से एजेंट प्रजनन करते हैं, जो प्राकृतिक चयन के समान है।
एआई की एजेंट-आधारित परिभाषा
रसेल और नॉरविग का ढांचा एआई को एजेंटों के अध्ययन के रूप में वर्णित करता है जो वातावरण से अवधारणाएं प्राप्त करते हैं और क्रियाएं करते हैं। इस दृष्टिकोण में, एक एजेंट कुछ भी है जो सेंसर के माध्यम से समझता है और एक्चुएटर्स के माध्यम से कार्य करता है। एक तर्कसंगत एजेंट उस क्रिया का चयन करता है जो उसके प्रदर्शन माप को अधिकतम करने की उम्मीद होती है, उसके अवधारणात्मक अनुक्रम, पूर्व ज्ञान और उपलब्ध क्रियाओं को देखते हुए। यह परिभाषा इस बात पर जोर देती है कि लक्ष्य-निर्देशित व्यवहार बुद्धिमत्ता का केंद्र है, और यह सरल और जटिल दोनों प्रणालियों पर लागू होती है।
एजेंट-उन्मुख कंप्यूटिंग एजेंटों को स्वायत्तता, प्रतिक्रियाशीलता और सक्रिय व्यवहार द्वारा और अधिक चित्रित करती है। बीडीआई वास्तुकला दुनिया के बारे में एजेंट के विश्वासों, इच्छाओं (उद्देश्यों) और इरादों (प्रतिबद्ध कार्य योजनाओं) का प्रतिनिधित्व करके व्यावहारिक तर्क को मॉडल करती है। यह दृष्टिकोण बहु-एजेंट प्रणालियों और रोबोटिक्स में व्यापक रूप से उपयोग किया जाता है, जहां एजेंटों को गतिशील वातावरण में काम करना पड़ता है।
प्रकार और उदाहरण
बुद्धिमान एजेंटों को उनकी जटिलता और सीखने की क्षमताओं द्वारा वर्गीकृत किया जा सकता है। सरल प्रतिवर्त एजेंट केवल वर्तमान अवधारणाओं पर कार्य करते हैं, जबकि मॉडल-आधारित एजेंट एक आंतरिक स्थिति बनाए रखते हैं। लक्ष्य-आधारित एजेंट उद्देश्यों को प्राप्त करने के लिए भविष्य की क्रियाओं पर विचार करते हैं, और उपयोगिता-आधारित एजेंट एक उपयोगिता फलन को अधिकतम करते हैं। सीखने वाले एजेंट प्रतिक्रिया के माध्यम से अपने प्रदर्शन में सुधार करते हैं, जैसे सुदृढीकरण लर्निंग या विकासवादी गणना।
उदाहरणों में एक बुनियादी थर्मोस्टेट शामिल है, जो एक सरल प्रतिवर्त एजेंट है, और अल्फाज़ीरो, एक शतरंज कार्यक्रम जिसमें जीत के लिए +1 और हार के लिए -1 का सरल उद्देश्य फलन है। अधिक जटिल एजेंटों में स्व-चालित कारें शामिल हैं, जो कई उद्देश्यों को संतुलित करती हैं, और सॉफ्टवेयर एजेंट जो उपयोगकर्ताओं की ओर से कार्य करते हैं, जैसे वेमो के स्वायत्त वाहन या टेस्ला-ऑटोपायलट प्रणालियाँ। अर्थशास्त्र में, एजेंट तर्कसंगत एजेंटों से निकटता से संबंधित हैं, और यह प्रतिमान संज्ञानात्मक विज्ञान, नैतिकता और दर्शन में अध्ययन किया जाता है।
सीखना और अनुकूलन
एजेंट अक्सर सीखने के एल्गोरिदम के माध्यम से सुधार करते हैं। सुदृढीकरण-लर्निंग में, एक पुरस्कार फलन प्रतिक्रिया प्रदान करता है, वांछित व्यवहार को प्रोत्साहित करता है और अवांछनीय व्यवहार को हतोत्साहित करता है। प्रोग्रामर प्रगति के लिए वृद्धिशील पुरस्कार देने के लिए पुरस्कार आकारण का उपयोग कर सकते हैं, जैसा कि यान लेकुन ने 2018 में नोट किया: "अधिकांश सीखने के एल्गोरिदम जो लोगों ने सोचे हैं, वे अनिवार्य रूप से कुछ उद्देश्य फलन को न्यूनतम करने से मिलकर बने हैं।" विकासवादी कंप्यूटिंग एजेंटों को विकसित कर सकती है जो जानबूझकर कार्य करते प्रतीत होते हैं, एक फिटनेस फलन द्वारा निर्देशित।
कुछ प्रणालियाँ, जैसे निकटतम-पड़ोसी वर्गीकरणकर्ता, स्पष्ट रूप से लक्ष्य-संचालित होने के बजाय सादृश्य द्वारा तर्क करते हैं, लेकिन उन्हें अभी भी अपने प्रशिक्षण डेटा में निहित लक्ष्यों के साथ एजेंटों के रूप में तैयार किया जा सकता है। इसी तरह, ज्ञान-प्रतिनिधित्व प्रणालियों को सटीक रूप से प्रश्नों का उत्तर देने के लक्ष्य के साथ एजेंटों के रूप में देखा जा सकता है, जो "क्रिया" की अवधारणा को उत्तर प्रदान करने तक विस्तारित करता है। 2010 के दशक के जनरेटिव एडवर्सेरियल नेटवर्क (जीएएन) में, एक जनरेटर मानव पाठ रचना की नकल करता है, एक फलन को अधिकतम करता है जो एक विभेदक को मूर्ख बनाने का प्रतिनिधित्व करता है, जो नकल-संचालित लक्ष्य फलनों को दर्शाता है।
अनुप्रयोग और निहितार्थ
एआई एजेंट उद्योगों में तैनात हैं, स्वायत्त वाहनों और रोबोटिक्स से लेकर आभासी सहायकों और अनुशंसा प्रणालियों तक। ओपनएआई, एंथ्रोपिक, और गूगल-डीपमाइंड जैसी कंपनियाँ एजेंट-आधारित एआई प्रणालियाँ विकसित करती हैं, जबकि अमेज़न-वेब-सर्विसेज़ और एज़्योर उन्हें तैनात करने के लिए क्लाउड बुनियादी ढांचा प्रदान करते हैं। यह प्रतिमान संज्ञानात्मक-विज्ञान और सामाजिक-संज्ञानात्मक मॉडलिंग में अनुसंधान को भी प्रभावित करता है, जहां एजेंट सामाजिक व्यवहारों का अनुकरण करते हैं।
उद्देश्य फलनों का डिज़ाइन नैतिक विचारों को उठाता है, क्योंकि एजेंट अनपेक्षित परिणामों के लिए अनुकूलन कर सकते हैं। उदाहरण के लिए, एक स्व-चालित कार के उद्देश्य को सुरक्षा और गति को सावधानीपूर्वक संतुलित करना चाहिए। जैसे-जैसे एजेंट अधिक स्वायत्त होते जाते हैं, मानव मूल्यों के साथ संरेखण सुनिश्चित करना महत्वपूर्ण हो जाता है। इससे एआई सुरक्षा और व्याख्यात्मकता में अनुसंधान हुआ है, जिसमें एमआईटी-सीएसएआईएल और स्टैनफोर्ड-एआई-लैब जैसे संस्थान इन चुनौतियों की खोज कर रहे हैं।
भविष्य की दिशाएँ
बड़े-भाषा-मॉडल और ट्रांसफॉर्मर वास्तुकलाओं में प्रगति ने अधिक परिष्कृत एजेंटों को सक्षम किया है जो विस्तारित अवधियों में तर्क और योजना बना सकते हैं। ये एजेंट, जिन्हें अक्सर एजेंटिक एआई कहा जाता है, सक्रिय रूप से लक्ष्यों का पीछा करते हैं और गतिशील वातावरण में निर्णय लेते हैं। अनुसंधान सीखने की दक्षता, मजबूती और सामान्यीकरण में सुधार पर जारी है, जिसमें बर्कले-एआई-रिसर्च और कार्नेगी-मेलन-यूनिवर्सिटी जैसी शैक्षणिक प्रयोगशालाओं का योगदान है।
एआई एजेंटों का विकास संभवतः अधिक एकीकृत प्रणालियों की ओर ले जाएगा जो मनुष्यों और एक-दूसरे के साथ सहयोग करती हैं, जवाबदेही और नियंत्रण के बारे में प्रश्न उठाती हैं। 2020 के दशक की शुरुआत तक, एजेंट-आधारित एआई एक जीवंत क्षेत्र बना हुआ है, जिसमें बुद्धिमत्ता की प्रकृति और व्यवहार को आकार देने में उद्देश्य फलनों की भूमिका के बारे में चल रही बहसें हैं।