ایپلیکیشن گائیڈ

کمپیوٹر استعمال کرنے والے ایجنٹ

کمپیوٹر استعمال کرنے والے ایجنٹ کمپیوٹر کو اس طرح چلاتے ہیں جیسے کوئی شخص کرتا ہے: اسکرین دیکھنا، کرسر کو حرکت دینا، کلک کرنا اور ٹائپ کرنا۔

2 منٹ پڑھیںآخری بار اپ ڈیٹ کیا گیا۔

جائزہ

This lets AI use any software with a graphical interface, even apps with no API.

گہرا غوطہ

کمپیوٹر استعمال کرنے والا ایجنٹ (CUA) حقیقی یا ورچوئل ڈیسک ٹاپ کو اس کی سکرین اور ان پٹ ڈیوائسز کے ذریعے کنٹرول کرتا ہے نہ کہ کوڈ لیول APIs کے ذریعے۔ ماڈل ڈسپلے کے اسکرین شاٹس حاصل کرتا ہے، اس کے بارے میں وجوہات جو اسے دیکھتا ہے، اور 'کلک ایٹ کوآرڈینیٹ (412، 230)'، 'اس متن کو ٹائپ کریں'، یا 'اسکرول ڈاؤن' جیسے نچلے درجے کی کارروائیوں کو آؤٹ پٹ کرتا ہے۔ یہ پرسیپشن ایکشن لوپ دہراتا ہے: عمل کریں، ایک تازہ اسکرین شاٹ کیپچر کریں، اگلے اقدام کا فیصلہ کریں۔ چونکہ یہ پکسل اور کی اسٹروک کی سطح پر کام کرتا ہے، ایک CUA ویب براؤزرز کو چلا سکتا ہے، فارم بھر سکتا ہے، مینوز کو نیویگیٹ کر سکتا ہے، اور پرانی ایپلی کیشنز کا استعمال کر سکتا ہے جو کسی پروگرامی انٹرفیس کو ظاہر نہیں کرتی ہیں۔ مثالوں میں Anthropic کا Claude کمپیوٹر استعمال اور OpenAI کا آپریٹر شامل ہیں۔ ٹریڈ آف حقیقی ہیں: اسکرین ریڈنگ سست ہوسکتی ہے، کلکس چھوٹ سکتے ہیں، اور ایجنٹ کو مشین پر کنٹرول دینے سے حفاظتی خدشات پیدا ہوتے ہیں، لہذا زیادہ تر سینڈ باکس یا زیر نگرانی ماحول میں چلتے ہیں۔

تکنیکی بصیرت

ایجنٹ کو اسکرین شاٹ کے علاوہ ٹاسک دیا جاتا ہے، اور وژن کے قابل ماڈل عناصر (بٹن، فیلڈز) کو پکسل کوآرڈینیٹس کے لیے بنیاد بناتا ہے۔ یہ ایک منظم کارروائی کا اخراج کرتا ہے جسے آٹومیشن پرت OS یا براؤزر کے خلاف انجام دیتی ہے۔ ہر ایکشن کے بعد ایک نیا اسکرین شاٹ لوپ کو بند کر دیتا ہے، لہذا ایجنٹ دوبارہ کام کرنے سے پہلے نتیجہ کو سمجھ لیتا ہے۔ بھروسے کا بہت زیادہ انحصار درست بصری بنیاد پر اور دوبارہ کوشش یا تصدیقی منطق پر ہوتا ہے جب ایک کلک غلط عنصر پر اترتا ہے۔

اسٹریٹجک اثر

Build choices

ایپلیکیشن لیول ڈیزائن اس بات کا تعین کرتا ہے کہ آیا AI حقیقی نتائج کو بہتر بناتا ہے۔

Team and workflow

اچھا ورک فلو انضمام پیداواری صلاحیت پیدا کرتا ہے جس پر صارفین بھروسہ کر سکتے ہیں۔

خطرہ اور حفاظت

اچھی طرح سے دائرہ کار کے استعمال کے معاملات تبدیلی کی تھکاوٹ اور نفاذ کے خطرے کو کم کرتے ہیں۔

کمپیوٹر استعمال کرنے والے ایجنٹوں کا مستقبل

درستگی اور رفتار میں بہتری آئے گی کیونکہ ماڈلز UI عناصر کو گراؤنڈ کرنے میں بہتر ہو جائیں گے اور کچھ تعاملات خام پکسلز کی بجائے تیز تر رسائی کے درختوں پر منتقل ہو جائیں گے۔ مضبوط گارڈریلز کی توقع کریں: خطرناک کارروائیوں، محدود سینڈ باکسز، اور آڈٹ لاگ سے پہلے تصدیقی اشارے۔ ڈیسک ٹاپ اور ویب کاموں کے لیے معیاری بینچ مارکس پختہ ہو رہے ہیں، جو قابل پیمائش پیش رفت کو آگے بڑھا رہے ہیں۔ طویل مدتی، CUAs ادائیگیوں جیسی حساس کارروائیوں کے لیے انسانی منظوری کے مرحلے کو برقرار رکھتے ہوئے، فی ایپ جو بھی زیادہ قابل اعتماد ہو، استعمال کرتے ہوئے، براہ راست API کالز کے ساتھ پکسل کنٹرول کو ملا سکتے ہیں۔

حقیقی دنیا کا نفاذ

ایک ایجنٹ جو براؤزر کھول کر، ریزرویشن سائٹ پر نیویگیٹ کر کے، وقت کا انتخاب کر کے، اور رابطے کی تفصیلات درج کر کے ریستوراں بک کرتا ہے۔

اسکرین پر رسیدیں پڑھ کر اور کسی ڈیسک ٹاپ اکاؤنٹنگ ایپ میں اقدار ٹائپ کرکے اخراجات کی رپورٹوں کو خودکار بنانا جس میں API نہیں ہے۔

QA ٹیسٹنگ جہاں ایجنٹ ہر بٹن اور فارم کے کام کرنے کی تصدیق کرنے کے لیے ویب ایپ کے سائن اپ فلو کے ذریعے کلک کرتا ہے۔

ہر فیلڈ لیبل کو پڑھ کر اور صحیح معلومات ٹائپ کرکے بار بار حکومتی یا انشورنس ویب فارم پُر کرنا۔

خطرات اور گارڈریلز

ٹوٹے ہوئے عمل کو خودکار کرنا موجودہ مسائل کو بڑھا سکتا ہے۔

ٹیمیں ضرورت سے زیادہ انسانی فیصلے کو خودکار اور ہٹا سکتی ہیں۔

اگر آؤٹ پٹس کا مسلسل جائزہ نہ لیا جائے تو معیار بڑھ سکتا ہے۔

نفاذ کا روڈ میپ

1

موجودہ ورک فلو کا نقشہ بنائیں اور سب سے زیادہ رگڑ والے مرحلے کی نشاندہی کریں۔

2

مکمل آٹومیشن سے پہلے انسانی چوکیوں کی وضاحت کریں۔

3

صارفین کو اشارے، ترقی کے راستے، اور معیار کے معیار پر تربیت دیں۔

4

پائیدار قدر کی تصدیق کے لیے ٹاسک لیول کے نتائج کو ٹریک کریں۔

دریافت کرتے رہیں

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Computer-Using Agents quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

کوئز شروع کریں۔

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

اگلا گائیڈ

اضطراری اور خود کو درست کرنے والے ایجنٹ

اکثر پوچھے گئے سوالات

What is Computer-Using Agents?

کمپیوٹر استعمال کرنے والے ایجنٹ کمپیوٹر کو اس طرح چلاتے ہیں جیسے کوئی شخص کرتا ہے: اسکرین دیکھنا، کرسر کو حرکت دینا، کلک کرنا اور ٹائپ کرنا۔ یہ AI کو گرافیکل انٹرفیس کے ساتھ کوئی بھی سافٹ ویئر استعمال کرنے دیتا ہے، یہاں تک کہ بغیر API کے ایپس۔

کمپیوٹر استعمال کرنے والا ایجنٹ بنیادی طور پر سافٹ ویئر کے ساتھ کیسے تعامل کرتا ہے؟

ایک CUA اسکرین شاٹس کو سمجھتا ہے اور انسانوں کی طرح کی ان پٹ کارروائیوں جیسے کلکس اور کی اسٹروکس کو جاری کرتا ہے۔

پکسل اور کی اسٹروک کی سطح پر کام کرنے کا بنیادی فائدہ کیا ہے؟

چونکہ یہ انسانی صارف کی طرح کام کرتا ہے، ایک CUA میراثی یا API سے کم ایپلی کیشنز چلا سکتا ہے۔

ایجنٹ کو اپنی اگلی کارروائی کا فیصلہ کرنے کے لیے کیا ملتا ہے؟

ہر ایکشن کے بعد ایجنٹ ایک نیا اسکرین شاٹ حاصل کرتا ہے، جس سے پرسیپشن ایکشن لوپ بنتا ہے۔

ان میں سے کون سا کمپیوٹر استعمال کرنے والے ایجنٹ کی مصنوعات کی حقیقی مثال ہے؟

Claude کمپیوٹر کا استعمال اور OpenAI کا آپریٹر معروف کمپیوٹر استعمال کرنے والے ایجنٹ ہیں۔

کمپیوٹر استعمال کرنے والے ایجنٹ اکثر سینڈ باکس والے ماحول میں کیوں چلتے ہیں؟

ایجنٹ کو حقیقی کمپیوٹر پر کنٹرول دینے سے خطرہ ہوتا ہے، اس لیے تنہائی اور نگرانی ممکنہ نقصان کو کم کرتی ہے۔