अक्टूबर 2024 में, Anthropic ने अपने क्लॉड श्रृंखला के बड़े भाषा मॉडल के लिए "कंप्यूटर उपयोग" सुविधा पेश की। यह क्षमता किसी एप्लिकेशन को क्लॉड API को कॉल करने की अनुमति देती है ताकि स्क्रीन सामग्री की क्लॉड की व्याख्या और कीबोर्ड और माउस इनपुट के अनुकरण के माध्यम से एप्लिकेशन को नेविगेशनल नियंत्रण देने का प्रयास किया जा सके। इसने Generative AI की दिशा में एक महत्वपूर्ण कदम उठाया, जिससे AI एजेंट ग्राफिकल यूज़र इंटरफेस के साथ मानव-समान तरीके से बातचीत कर सकें।
यह सुविधा Anthropic के व्यापक प्रयास का हिस्सा थी, जिसमें क्लॉड को चैटबॉट इंटरैक्शन से आगे बढ़ाकर एजेंटिक टूल्स में विस्तारित किया गया। यह मार्च 2023 में क्लॉड के AI-आधारित चैटबॉट के रूप में जारी होने और जून 2024 में आर्टिफैक्ट्स की शुरुआत के बाद आया। कंप्यूटर उपयोग को क्लॉड को फॉर्म भरने, वेबसाइटों पर नेविगेट करने और सॉफ्टवेयर संचालित करने जैसे कार्य करने में सक्षम बनाने के लिए डिज़ाइन किया गया था, जिसमें केवल स्क्रीन से दृश्य जानकारी और अनुकरणित इनपुट इवेंट का उपयोग किया जाता था।
तकनीकी आधार
कंप्यूटर उपयोग स्क्रीनशॉट को संसाधित करने और क्रियाएँ उत्पन्न करने की क्लॉड की क्षमता पर निर्भर करता है। मॉडल एक स्क्रीन छवि प्राप्त करता है, प्रासंगिक तत्वों की पहचान करता है, और माउस क्लिक, कीस्ट्रोक्स या स्क्रॉल क्रियाओं जैसे कमांड आउटपुट करता है। यह दृष्टिकोण पारंपरिक स्वचालन से भिन्न है जो APIs या एक्सेसिबिलिटी ट्री पर निर्भर करता है। Anthropic ने सामान्यीकरण में सुधार के लिए मॉडल को विभिन्न डेस्कटॉप वातावरणों पर प्रशिक्षित किया।
अंतर्निहित वास्तुकला Transformer (architecture) मॉडल पर आधारित है, जिसका उपयोग अन्य Large language model प्रणालियों में भी किया जाता है। क्लॉड का प्रशिक्षण एक संविधान का उपयोग करता है, जो नैतिक और कानूनी अनुपालन में सुधार के लिए Anthropic द्वारा विकसित एक तकनीक है। कंप्यूटर उपयोग सुविधा शुरू में क्लॉड API के माध्यम से उपलब्ध थी, जिससे डेवलपर्स इसे अपने स्वयं के अनुप्रयोगों में एकीकृत कर सकते थे।
क्षमताएँ और सीमाएँ
अपने प्रारंभिक संस्करण में, कंप्यूटर उपयोग वेब खोज, फॉर्म भरने और बहु-चरणीय वर्कफ़्लो को नेविगेट करने जैसे कार्य कर सकता था। Anthropic ने बताया कि मॉडल मध्यम सटीकता के साथ सरल कार्यों को पूरा कर सकता है, लेकिन यह जटिल या उच्च-जोखिम वाले कार्यों के लिए अभी तक विश्वसनीय नहीं था। कंपनी ने जोर देकर कहा कि यह सुविधा प्रयोगात्मक थी और मानव निगरानी की सिफारिश की।
एक उल्लेखनीय सीमा अपरिचित इंटरफेस या स्क्रीन लेआउट बदलने पर मॉडल की त्रुटियाँ करने की प्रवृत्ति थी। Anthropic ने यह भी नोट किया कि कंप्यूटर उपयोग प्रॉम्प्ट-इंजेक्शन हमलों के प्रति संवेदनशील हो सकता है, जहाँ वेब पेजों में एम्बेडेड दुर्भावनापूर्ण निर्देश मॉडल की क्रियाओं को प्रभावित कर सकते हैं। कंपनी ने डेवलपर्स को सुरक्षा उपाय लागू करने की सलाह दी।
अन्य AI प्रणालियों के साथ तुलना
कंप्यूटर उपयोग ने Anthropic को एजेंटिक क्षमताओं की खोज करने वाले अन्य AI डेवलपर्स के साथ स्थापित किया। OpenAI और Google DeepMind ने भी ऐसे मॉडल प्रदर्शित किए थे जो सॉफ्टवेयर के साथ बातचीत कर सकते थे, लेकिन Anthropic का दृष्टिकोण API एकीकरण के बजाय स्क्रीन-आधारित नियंत्रण पर केंद्रित था। इसने इसे विरासत प्रणालियों और प्रोग्रामेटिक इंटरफेस के बिना अनुप्रयोगों पर लागू करने योग्य बना दिया।
यह सुविधा Artificial intelligence प्रणालियों की ओर एक प्रवृत्ति का हिस्सा थी जो कंप्यूटर को स्वायत्त रूप से संचालित कर सकती हैं। Machine learning मॉडलों के विपरीत जो केवल पाठ उत्पन्न करते हैं, कंप्यूटर स्थानिक लेआउट को समझने और अनुक्रमिक क्रियाओं को निष्पादित करने की आवश्यकता थी। इसने दृश्य समझ और निर्णय लेने में प्रगति की मांग की।
डेवलपर अपनाना और पारिस्थितिकी तंत्र
अक्टूबर 2024 के लॉन्च के बाद, डेवलपर्स ने कंप्यूटर उपयोग को विभिन्न टूल्स में एकीकृत करना शुरू किया। इसका उपयोग डेटा प्रविष्टि को स्वचालित करने, सॉफ्टवेयर का परीक्षण करने और वर्कफ़्लो प्रबंधित करने के लिए किया गया। यह उन कार्यों के लिए विशेष रूप से उपयोगी था जिनमें कई अनुप्रयोगों के साथ बातचीत की आवश्यकता होती है, जैसे स्प्रेडशीट से डेटा को वेब फॉर्म में कॉपी करना।
Anthropic ने डेवलपर्स को शुरू करने में मदद करने के लिए दस्तावेज़ीकरण और उदाहरण प्रदान किए। API ने मॉडल की क्रियाओं पर सूक्ष्म-नियंत्रण की अनुमति दी, जिसमें कार्यों को रोकने और फिर से शुरू करने की क्षमता शामिल थी। कुछ डेवलपर्स ने अधिक परिष्कृत अनुप्रयोग बनाने के लिए कंप्यूटर उपयोग को आर्टिफैक्ट्स जैसी अन्य क्लॉड सुविधाओं के साथ जोड़ा।
बाद के विकास
कंप्यूटर उपयोग सुविधा समय के साथ विकसित हुई। फरवरी 2025 में, Anthropic ने क्लॉड कोड जारी किया, जो कोडिंग कार्यों के लिए एक टर्मिनल-आधारित एजेंटिक टूल है। जबकि क्लॉड कोड पाठ-आधारित इंटरैक्शन पर केंद्रित था, कंप्यूटर उपयोग ग्राफिकल वातावरण के लिए प्रासंगिक बना रहा। अगस्त 2025 में, Anthropic ने क्लॉड फॉर क्रोम जारी किया, एक ब्राउज़र एक्सटेंशन जो क्लॉड को वेबसाइटों को ब्राउज़ करने और उपयोगकर्ता की ओर से फॉर्म क्लिक करने और भरने की अनुमति देता था। यह एक्सटेंशन समान स्क्रीन-व्याख्या तकनीक का लाभ उठाता था।
जनवरी 2026 में, Anthropic ने क्लॉड कोवर्क पेश किया, जो गैर-तकनीकी उपयोगकर्ताओं के लिए एक ग्राफिकल टूल है। कोवर्क ने क्लॉड को सैंडबॉक्स किए गए शेल और उपयोगकर्ता-चयनित फ़ोल्डरों तक पहुंच प्रदान की, जिससे मॉडल फ़ाइलों को पढ़, लिख और संपादित कर सके, कोड निष्पादित कर सके और बहु-चरणीय कार्यों को श्रृंखलाबद्ध कर सके। जबकि कोवर्क केवल कंप्यूटर उपयोग पर निर्भर नहीं था, इसने क्लॉड को उपयोगकर्ता के कंप्यूटर पर सॉफ्टवेयर संचालित करने में सक्षम बनाने के लक्ष्य को साझा किया।
सुरक्षा और नैतिक विचार
कंप्यूटर उपयोग की शुरुआत ने सुरक्षा चिंताओं को उठाया। क्योंकि मॉडल डेस्कटॉप इंटरफेस को नियंत्रित कर सकता था, इसे अनधिकृत क्रियाएँ करने के लिए संभावित रूप से शोषित किया जा सकता था। Anthropic ने संवेदनशील कार्यों के लिए उपयोगकर्ता की पुष्टि की आवश्यकता और कुछ सिस्टम कार्यों तक मॉडल की पहुंच को सीमित करने जैसे सुरक्षा उपाय लागू किए।
प्रॉम्प्ट-इंजेक्शन हमले एक विशेष चिंता थे। अगस्त 2025 में, Anthropic ने बताया कि क्लॉड फॉर क्रोम में शमन के बाद ऐसे हमले 11.2% समय सफल हुए। कंपनी ने मजबूती में सुधार के तरीकों पर शोध जारी रखा। Deep learning और Neural network सुरक्षा के लिए व्यापक निहितार्थ शैक्षणिक और उद्योग मंडलों में चर्चा किए गए।
प्रभाव और स्वागत
कंप्यूटर उपयोग लॉन्च को प्रौद्योगिकी मीडिया में व्यापक रूप से कवर किया गया। इसे AI एजेंटों के विकास में एक मील का पत्थर के रूप में देखा गया जो डिजिटल दुनिया के साथ बातचीत कर सकते हैं। कुछ पर्यवेक्षकों ने इसकी तुलना Chess computer और अन्य डोमेन में पहले के प्रयासों से की जहाँ AI ने प्रतिबंधित वातावरण में क्षमता प्रदर्शित की, लेकिन नोट किया कि कंप्यूटर उपयोग ने अधिक सामान्य और असंरचित समस्या को संबोधित किया।
Anthropic के कदम ने AI कंपनियों के बीच प्रतिस्पर्धा को भी तेज किया। Microsoft और Google अपने ऑपरेटिंग सिस्टम और उत्पादकता टूल्स में AI को एकीकृत कर रहे थे, जबकि Amazon Web Services और अन्य क्लाउड प्रदाताओं ने AI सेवाएँ प्रदान कीं। कंप्यूटर उपयोग ने Anthropic को एजेंटिक AI स्थान में एक विशिष्ट पेशकश दी।
भविष्य की दिशाएँ
2026 तक, कंप्यूटर उपयोग को परिष्कृत किया जा रहा था। Anthropic ने मॉडल की सटीकता, गति और जटिल इंटरफेस को संभालने की क्षमता में सुधार करने की योजना बनाई। कंपनी ने क्लॉड कोड और कोवर्क जैसी अन्य एजेंटिक सुविधाओं के साथ कंप्यूटर उपयोग को जोड़ने के तरीकों का भी खोजा, ताकि अधिक सहज स्वचालन बनाया जा सके।
कंप्यूटर उपयोग का विकास Generative AI प्रणालियों की ओर एक व्यापक आंदोलन का हिस्सा था जो केवल पाठ उत्पन्न करने के बजाय दुनिया में क्रियाएँ कर सकती हैं। MIT CSAIL और Stanford AI Lab जैसे संस्थानों के शोधकर्ताओं ने समान दृष्टिकोणों का अध्ययन किया। दीर्घकालिक लक्ष्य AI सहायक बनाना था जो न्यूनतम मानव हस्तक्षेप के साथ कंप्यूटर-आधारित कार्यों की एक विस्तृत श्रृंखला को संभाल सकते थे।
Anthropic की कंप्यूटर उपयोग सुविधा AI को अधिक व्यावहारिक और इंटरैक्टिव बनाने में एक उल्लेखनीय प्रगति का प्रतिनिधित्व करती थी। क्लॉड को डेस्कटॉप इंटरफेस संचालित करने में सक्षम बनाकर, इसने स्वचालन और सहायता के लिए नई संभावनाएँ खोलीं, साथ ही सुरक्षा और नियंत्रण के बारे में महत्वपूर्ण प्रश्न भी उठाए।