कंप्यूटर उपयोग एक ऐसी क्षमता है जो एक बड़े भाषा मॉडल को सीधे एक मानक ग्राफिकल कंप्यूटर इंटरफ़ेस संचालित करने की अनुमति देती है, स्क्रीन सामग्री देखकर और माउस तथा कीबोर्ड क्रियाएँ जारी करके, बजाय केवल विशेष रूप से उसके लिए लिखे गए समर्पित APIs के माध्यम से सॉफ़्टवेयर के साथ बातचीत करने के। जहाँ सामान्य उपकरण उपयोग के लिए डेवलपर को प्रत्येक क्षमता को एक अलग फ़ंक्शन कॉल के रूप में उजागर करने की आवश्यकता होती है, वहीं कंप्यूटर उपयोग मॉडल को किसी भी सॉफ़्टवेयर पर कार्य करने देता है जिसमें एक दृश्य इंटरफ़ेस होता है, जिसमें वेबसाइटें, डेस्कटॉप अनुप्रयोग, और ऑपरेटिंग सिस्टम नियंत्रण शामिल हैं, उसी तरह जैसे एक मानव उपयोगकर्ता करता है - स्क्रीन पर देखकर और क्लिक, टाइपिंग, या स्क्रॉलिंग के माध्यम से प्रतिक्रिया देकर।
एंथ्रोपिक ने इस तकनीक को अक्टूबर 2024 में अपने क्लॉड मॉडल की एक विशेषता के रूप में सार्वजनिक रूप से पेश किया, इसे मॉडल को स्क्रीनशॉट लेने, कर्सर स्थानांतरित करने, बटन क्लिक करने, और एक नियंत्रित आभासी वातावरण के भीतर टेक्स्ट टाइप करने की अनुमति देने के रूप में वर्णित किया। यह क्षमता मॉडल की स्क्रीन की छवियों की व्याख्या करने और उस समझ को समन्वय-आधारित क्रियाओं में अनुवाद करने की क्षमता पर निर्भर करती है, जिसने इसे मल्टीमॉडल एआई और दृष्टि-भाषा मॉडल क्षमताओं का एक स्वाभाविक विस्तार बनाया, बजाय एक विशुद्ध रूप से पाठ-आधारित तकनीक के। अन्य प्रयोगशालाओं, जिनमें Google DeepMind और OpenAI शामिल हैं, ने 2024 और 2025 के दौरान तुलनीय ब्राउज़र- और कंप्यूटर-संचालन एजेंट सुविधाएँ जारी कीं, क्योंकि यह दृष्टिकोण व्यापक एजेंटिक लहर के भीतर एक स्थापित श्रेणी बन गया।
यह कैसे काम करता है
एक कंप्यूटर उपयोग लूप आमतौर पर एक अनुभव-निर्णय-कार्य चक्र का पालन करता है: मॉडल को वर्तमान स्क्रीन स्थिति का एक स्क्रीनशॉट उपयोगकर्ता के समग्र लक्ष्य के साथ दिया जाता है, यह एक एकल अगली क्रिया पर निर्णय लेता है, जैसे किसी विशिष्ट समन्वय पर क्लिक करना, एक स्ट्रिंग टाइप करना, या एक कुंजी दबाना, वह क्रिया वातावरण में निष्पादित की जाती है, और अगले निर्णय के लिए एक नया स्क्रीनशॉट कैप्चर करके मॉडल के संदर्भ-विंडो में लौटाया जाता है। यह चक्र तब तक दोहराता है जब तक मॉडल यह निर्धारित नहीं करता कि कार्य पूरा हो गया है या एक सीमा तक पहुँच गया है। क्योंकि यह उसी दृश्य और इनपुट सतह के माध्यम से संचालित होता है जिसका उपयोग एक मानव करता है, कंप्यूटर उपयोग को किसी अनुप्रयोग को API उजागर करने की आवश्यकता नहीं होती है, जो इसे विरासत सॉफ़्टवेयर, आंतरिक उद्यम उपकरण, और बिना किसी सार्वजनिक एकीकरण वाली वेबसाइटों के साथ काम करने देता है।
अनुप्रयोग
कंप्यूटर उपयोग को अनुसंधान और डेटा प्रविष्टि के लिए ब्राउज़र स्वचालन, एक वास्तविक उपयोगकर्ता के क्लिक और इनपुट का अनुकरण करके सॉफ़्टवेयर का परीक्षण, और उन प्रणालियों में फ़ॉर्म भरने जैसे नियमित कार्यालय कार्यों को स्वचालित करने के लिए लागू किया गया है जो कभी स्क्रिप्टिंग के लिए डिज़ाइन नहीं किए गए थे। इसे अक्सर व्यापक एआई एजेंट श्रेणी के एक परिभाषित टूलसेट से परे वातावरण में विस्तार के रूप में चर्चा किया जाता है, और इसे उसी एजेंट के भीतर अधिक पारंपरिक टूल कॉलिंग के साथ जोड़ा जा सकता है, कभी-कभी एक साझा इंटरफ़ेस जैसे मॉडल-संदर्भ-प्रोटोकॉल के माध्यम से जोड़ा जाता है, जब एक समर्पित API मौजूद हो तो उसे कॉल करके और जब नहीं हो तो सीधे इंटरफ़ेस नियंत्रण पर वापस आकर।
सीमाएँ और जोखिम
प्रारंभिक कंप्यूटर उपयोग प्रणालियाँ API-आधारित उपकरण उपयोग की तुलना में काफी धीमी और कम विश्वसनीय थीं, क्योंकि प्रत्येक क्रिया के लिए अगले चरण से पहले छवि व्याख्या के माध्यम से एक पूर्ण राउंड ट्रिप की आवश्यकता होती है, और मॉडल गलत क्लिक कर सकते थे, छोटे टेक्स्ट को गलत पढ़ सकते थे, या अपरिचित इंटरफ़ेस लेआउट से भ्रमित हो सकते थे। एंथ्रोपिक और अन्य प्रयोगशालाओं ने लॉन्च के समय इस क्षमता को प्रयोगात्मक बताया और अनपेक्षित क्रियाओं के जोखिम को देखते हुए इसे सैंडबॉक्स किए गए वातावरण में चलाने की सिफारिश की। सुरक्षा निहितार्थ भी संकीर्ण उपकरण उपयोग की तुलना में अधिक गंभीर हैं, क्योंकि एक पूर्ण कंप्यूटर इंटरफ़ेस संचालित करने वाले मॉडल के पास सिद्धांत रूप में वही सीमा की संभावित क्रियाएँ उपलब्ध होती हैं जो एक मानव उपयोगकर्ता के पास होती हैं, जिनमें वित्तीय, सुरक्षा, या अपरिवर्तनीय परिणामों वाली क्रियाएँ शामिल हैं, जो एक कारण है कि कंप्यूटर उपयोग एजेंटों को प्रॉम्प्ट-इंजेक्शन हमलों के लिए एक उच्च लक्ष्य माना जाता है और आमतौर पर सुरक्षा उपायों, मानव निगरानी, और प्रतिबंधित निष्पादन वातावरण के साथ तैनात किया जाता है। 2025 तक, कंप्यूटर उपयोग एक तेज़ी से बदलती लेकिन अभी भी परिपक्व होती श्रेणी बनी रही, जिसमें सटीकता और विश्वसनीयता क्रमिक मॉडल पीढ़ियों में काफी सुधार हुई, लेकिन उन कार्यों के लिए जहाँ एक समर्पित API मौजूद है, उद्देश्य-निर्मित API एकीकरणों से अभी भी पीछे रही।