कंप्यूटर का उपयोग करने वाले एजेंट
कंप्यूटर का उपयोग करने वाले एजेंट कंप्यूटर को उसी तरह संचालित करते हैं जैसे कोई व्यक्ति करता है: स्क्रीन देखना, कर्सर घुमाना, क्लिक करना और टाइप करना।
सिंहावलोकन
This lets AI use any software with a graphical interface, even apps with no API.
गहरा गोता
एक कंप्यूटर-उपयोगकर्ता एजेंट (सीयूए) कोड-स्तरीय एपीआई के बजाय अपनी स्क्रीन और इनपुट डिवाइस के माध्यम से एक वास्तविक या आभासी डेस्कटॉप को नियंत्रित करता है। मॉडल डिस्प्ले के स्क्रीनशॉट प्राप्त करता है, वह जो देखता है उसके बारे में कारण बताता है, और 'समन्वय पर क्लिक करें (412, 230)', 'इस टेक्स्ट को टाइप करें', या 'नीचे स्क्रॉल करें' जैसी निम्न-स्तरीय क्रियाओं को आउटपुट करता है। यह धारणा-क्रिया लूप दोहराता है: कार्य करें, एक ताज़ा स्क्रीनशॉट कैप्चर करें, अगला कदम तय करें। क्योंकि यह पिक्सेल-और-कीस्ट्रोक स्तर पर काम करता है, एक सीयूए वेब ब्राउज़र चला सकता है, फॉर्म भर सकता है, मेनू नेविगेट कर सकता है, और विरासत अनुप्रयोगों का उपयोग कर सकता है जो कोई प्रोग्रामेटिक इंटरफ़ेस नहीं दिखाते हैं। उदाहरणों में Anthropic का Claude कंप्यूटर उपयोग और OpenAI का ऑपरेटर शामिल हैं। ट्रेड-ऑफ वास्तविक हैं: स्क्रीन रीडिंग धीमी हो सकती है, क्लिक मिस हो सकते हैं, और किसी एजेंट को मशीन का नियंत्रण देने से सुरक्षा संबंधी चिंताएं बढ़ जाती हैं, इसलिए अधिकांश सैंडबॉक्स या पर्यवेक्षित वातावरण में चलते हैं।
तकनीकी अंतर्दृष्टि
एजेंट को एक स्क्रीनशॉट और कार्य दिया जाता है, और एक दृष्टि-सक्षम मॉडल तत्वों (बटन, फ़ील्ड) को पिक्सेल निर्देशांक पर आधारित करता है। यह एक संरचित क्रिया उत्सर्जित करता है जिसे एक स्वचालन परत ओएस या ब्राउज़र के विरुद्ध निष्पादित करती है। प्रत्येक कार्रवाई के बाद एक नया स्क्रीनशॉट लूप को बंद कर देता है, ताकि एजेंट दोबारा कार्रवाई करने से पहले परिणाम को समझ सके। विश्वसनीयता काफी हद तक सटीक दृश्य ग्राउंडिंग और गलत तत्व पर क्लिक होने पर पुनः प्रयास या सत्यापन तर्क पर निर्भर करती है।
सामरिक प्रभाव
विकल्प बनाएं
एप्लिकेशन-स्तरीय डिज़ाइन यह निर्धारित करता है कि AI वास्तविक परिणामों में सुधार करता है या नहीं।
टीम और वर्कफ़्लो
अच्छा वर्कफ़्लो एकीकरण उत्पादकता लाभ पैदा करता है जिस पर उपयोगकर्ता भरोसा कर सकते हैं।
जोखिम और सुरक्षा
अच्छी तरह से उपयोग के मामले परिवर्तन की थकान और कार्यान्वयन जोखिम को कम करते हैं।
कंप्यूटर का उपयोग करने वाले एजेंटों का भविष्य
सटीकता और गति में सुधार होगा क्योंकि मॉडल ग्राउंडिंग यूआई तत्वों में बेहतर हो जाएंगे और कुछ इंटरैक्शन कच्चे पिक्सल के बजाय तेज पहुंच वाले पेड़ों पर स्थानांतरित हो जाएंगे। मजबूत रेलिंग की अपेक्षा करें: जोखिम भरे कार्यों से पहले पुष्टि संकेत, प्रतिबंधित सैंडबॉक्स और ऑडिट लॉग। डेस्कटॉप और वेब कार्यों के लिए मानक बेंचमार्क परिपक्व हो रहे हैं, जिससे मापने योग्य प्रगति बढ़ रही है। लंबी अवधि में, सीयूए भुगतान जैसे संवेदनशील कार्यों के लिए मानव अनुमोदन कदम रखते हुए, प्रति ऐप जो भी अधिक विश्वसनीय हो, उसका उपयोग करके सीधे एपीआई कॉल के साथ पिक्सेल नियंत्रण को मिश्रित कर सकता है।
वास्तविक विश्व कार्यान्वयन
एक एजेंट जो ब्राउज़र खोलकर, आरक्षण साइट पर जाकर, समय चुनकर और संपर्क विवरण दर्ज करके एक रेस्तरां बुक करता है।
स्क्रीन पर रसीदें पढ़कर और बिना एपीआई वाले डेस्कटॉप अकाउंटिंग ऐप में मान टाइप करके व्यय रिपोर्ट को स्वचालित करना।
क्यूए परीक्षण जहां एजेंट प्रत्येक बटन और फॉर्म के काम करने की पुष्टि करने के लिए वेब ऐप के साइनअप प्रवाह पर क्लिक करता है।
प्रत्येक फ़ील्ड लेबल को पढ़कर और सही जानकारी टाइप करके दोहराए जाने वाले सरकारी या बीमा वेब फॉर्म भरना।
जोखिम और रेलिंग
किसी टूटी हुई प्रक्रिया को स्वचालित करने से मौजूदा समस्याएँ बढ़ सकती हैं।
टीमें अति-स्वचालित हो सकती हैं और आवश्यक मानवीय निर्णय को हटा सकती हैं।
यदि आउटपुट का लगातार मूल्यांकन नहीं किया गया तो गुणवत्ता में गिरावट आ सकती है।
कार्यान्वयन रोडमैप
वर्तमान वर्कफ़्लो को मैप करें और उच्चतम-घर्षण चरण की पहचान करें।
पूर्ण स्वचालन से पहले मानव चौकियों को परिभाषित करें।
उपयोगकर्ताओं को संकेतों, वृद्धि पथों और गुणवत्ता मानकों पर प्रशिक्षित करें।
निरंतर मूल्य की पुष्टि के लिए कार्य-स्तर के परिणामों को ट्रैक करें।
अन्वेषण करते रहें
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Computer-Using Agents quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
अगली गाइड
परावर्तन और स्व-सुधार करने वाले एजेंट
अक्सर पूछे जाने वाले प्रश्नों
What is Computer-Using Agents?
कंप्यूटर का उपयोग करने वाले एजेंट कंप्यूटर को उसी तरह संचालित करते हैं जैसे कोई व्यक्ति करता है: स्क्रीन देखना, कर्सर घुमाना, क्लिक करना और टाइप करना। यह AI को ग्राफ़िकल इंटरफ़ेस वाले किसी भी सॉफ़्टवेयर का उपयोग करने देता है, यहां तक कि बिना API वाले ऐप्स भी।
कंप्यूटर का उपयोग करने वाला एजेंट मुख्य रूप से सॉफ़्टवेयर के साथ कैसे इंटरैक्ट करता है?
सीयूए स्क्रीनशॉट को समझता है और क्लिक और कीस्ट्रोक्स जैसी मानव-जैसी इनपुट क्रियाएं जारी करता है।
पिक्सेल-और-कीस्ट्रोक स्तर पर संचालन का मुख्य लाभ क्या है?
क्योंकि यह एक मानव उपयोगकर्ता की तरह कार्य करता है, एक सीयूए विरासत या एपीआई-कम अनुप्रयोगों को चला सकता है।
एजेंट को अपनी अगली कार्रवाई तय करने के लिए क्या मिलता है?
प्रत्येक क्रिया के बाद एजेंट एक धारणा-क्रिया लूप बनाते हुए एक नया स्क्रीनशॉट कैप्चर करता है।
इनमें से कौन सा कंप्यूटर का उपयोग करने वाले एजेंट उत्पाद का वास्तविक उदाहरण है?
Claude कंप्यूटर उपयोग और OpenAI के ऑपरेटर प्रसिद्ध कंप्यूटर-उपयोग एजेंट हैं।
कंप्यूटर का उपयोग करने वाले एजेंट अक्सर सैंडबॉक्स वाले वातावरण में क्यों चलते हैं?
किसी एजेंट को वास्तविक कंप्यूटर का नियंत्रण देने में जोखिम होता है, इसलिए अलगाव और पर्यवेक्षण संभावित नुकसान को कम करता है।