اضطراری اور خود کو درست کرنے والے ایجنٹ
Reflexion ایک تکنیک ہے جہاں ایک AI ایجنٹ اپنی ناکامیوں پر تحریری طور پر عکاسی کرتا ہے اور ان اسباق کو اپنی اگلی کوشش میں فیڈ کرتا ہے۔
جائزہ
It matters because it lets agents improve on a task without retraining the underlying model.
گہرا غوطہ
Reflexion، شن اور ساتھیوں کے 2023 کے ایک مقالے میں متعارف کرایا گیا، ایک ایجنٹ کو ایک لوپ دیتا ہے: وہ کسی کام کی کوشش کرتا ہے، اس کے بارے میں ایک سگنل حاصل کرتا ہے کہ اس نے کیسے کیا (ایک ٹیسٹ کا نتیجہ، انعام، یا تنقید)، پھر ایک مختصر قدرتی زبان کا 'عکاس' لکھتا ہے جس میں بتایا گیا ہے کہ کیا غلط ہوا اور آگے کیا کوشش کرنی ہے۔ اس عکاسی کو میموری میں محفوظ کیا جاتا ہے اور اگلی کوشش کے پرامپٹ پر پیش کیا جاتا ہے۔ اہم بات یہ ہے کہ ماڈل کا وزن کبھی تبدیل نہیں ہوتا ہے۔ سیکھنا مکمل طور پر متن کے طور پر سیاق و سباق کی ونڈو میں ہوتا ہے۔ یہ 'زبانی کمک سیکھنے' ایجنٹوں کو کوڈنگ کے مسائل، ویب نیویگیشن، اور استدلال کے کاموں پر اعادہ کرنے دیتا ہے۔ HumanEval کوڈنگ بینچ مارک پر، Reflexion طرز کی خود تصحیح نے پاس کی شرح کو سنگل شاٹ کی کوششوں سے کافی زیادہ دھکیل دیا، صرف ایجنٹ کو چند کوششوں میں اپنی غلطیوں کو ڈیبگ کرنے کی اجازت دے کر۔
تکنیکی بصیرت
Reflexion تین کرداروں کو الگ کرتا ہے: ایک اداکار جو اعمال پیدا کرتا ہے، ایک ایویلیویٹر جو نتائج کو اسکور کرتا ہے (یونٹ ٹیسٹ، ایک عین مطابق میچ چیک، یا LLM جج)، اور ایک سیلف ریفلیکشن ماڈل جو اس اسکور کو متنی سبق میں بدل دیتا ہے۔ سبق اگلی آزمائش پر دوبارہ استعمال ہونے والے ایپیسوڈک میموری بفر میں آتا ہے۔ چونکہ فیڈ بیک میلان کی بجائے زبان ہے، اس لیے کسی GPU ٹریننگ کی ضرورت نہیں ہے، لیکن یہ اعتماد کو تقویت دینے سے بچنے کے لیے ایک قابل اعتماد تشخیصی سگنل پر بہت زیادہ انحصار کرتا ہے لیکن غلط عکاسی کرتا ہے۔
اسٹریٹجک اثر
Build choices
ایپلیکیشن لیول ڈیزائن اس بات کا تعین کرتا ہے کہ آیا AI حقیقی نتائج کو بہتر بناتا ہے۔
Team and workflow
اچھا ورک فلو انضمام پیداواری صلاحیت پیدا کرتا ہے جس پر صارفین بھروسہ کر سکتے ہیں۔
خطرہ اور حفاظت
اچھی طرح سے دائرہ کار کے استعمال کے معاملات تبدیلی کی تھکاوٹ اور نفاذ کے خطرے کو کم کرتے ہیں۔
اضطراری اور خود کو درست کرنے والے ایجنٹوں کا مستقبل
خود تصحیح ایجنٹ کے فریم ورک میں ایک تحقیقی چال کے بجائے پہلے سے طے شدہ پرت بن رہی ہے۔ خودکار تصدیق کنندگان کے ساتھ سخت انضمام کی توقع کریں، جیسے کہ کوڈ سینڈ باکس، رسمی چیکرز، اور بازیافت جو حقائق کی تصدیق کرتی ہے، اس لیے عکاسی ماڈل کے دوسرے اندازے کے بجائے معروضی اشاروں پر مبنی ہوتی ہے۔ کھلے چیلنجز ایسے لوپس سے گریز کر رہے ہیں جہاں ایک ایجنٹ نہ ختم ہونے والے کام کی پیداوار کو 'ٹھیک کرتا ہے'، یہ فیصلہ کرتا ہے کہ کب اعادہ کرنا بند کیا جائے، اور عکاسی کو قابل فہم لیکن غیر تصدیق شدہ معقولیت میں جانے سے روکنا ہے۔
حقیقی دنیا کا نفاذ
ایک کوڈنگ ایجنٹ جو یونٹ ٹیسٹ چلاتا ہے، ناکام ہونے والے دعوے کو پڑھتا ہے، بگ پر ایک نوٹ لکھتا ہے، اور سوٹ کو دوبارہ چلانے سے پہلے اس کے کوڈ میں ترمیم کرتا ہے۔
ایک ریسرچ اسسٹنٹ جو ایک فریب شدہ حوالہ پکڑتا ہے جب بازیافت کی جانچ ناکام ہوجاتی ہے، پھر صرف تصدیق شدہ ذرائع استعمال کرنے کے لیے جواب پر نظر ثانی کرتا ہے۔
ایک ویب نیویگیشن ایجنٹ (مثال کے طور پر، AlfWorld یا WebShop بینچ مارکس پر) جو ریکارڈ کرتا ہے کہ 'میں نے غلط فلٹر پر کلک کیا' اور دوبارہ کوشش کرنے پر اس غلطی سے بچتا ہے۔
ایک ریاضی کا مسئلہ حل کرنے والا جو اپنے حتمی جواب کو کسی رکاوٹ کے خلاف چیک کرتا ہے، نشانی کی غلطی کو نوٹ کرتا ہے، اور متعلقہ قدم پر دوبارہ کام کرتا ہے۔
خطرات اور گارڈریلز
ٹوٹے ہوئے عمل کو خودکار کرنا موجودہ مسائل کو بڑھا سکتا ہے۔
ٹیمیں ضرورت سے زیادہ انسانی فیصلے کو خودکار اور ہٹا سکتی ہیں۔
اگر آؤٹ پٹس کا مسلسل جائزہ نہ لیا جائے تو معیار بڑھ سکتا ہے۔
نفاذ کا روڈ میپ
موجودہ ورک فلو کا نقشہ بنائیں اور سب سے زیادہ رگڑ والے مرحلے کی نشاندہی کریں۔
مکمل آٹومیشن سے پہلے انسانی چوکیوں کی وضاحت کریں۔
صارفین کو اشارے، ترقی کے راستے، اور معیار کے معیار پر تربیت دیں۔
پائیدار قدر کی تصدیق کے لیے ٹاسک لیول کے نتائج کو ٹریک کریں۔
دریافت کرتے رہیں
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Reflexion and Self-Correcting Agents quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
اگلا گائیڈ
ایجنٹ لوپس میں خود کی عکاسی
اکثر پوچھے گئے سوالات
What is Reflexion and Self-Correcting Agents?
Reflexion ایک تکنیک ہے جہاں ایک AI ایجنٹ اپنی ناکامیوں پر تحریری طور پر عکاسی کرتا ہے اور ان اسباق کو اپنی اگلی کوشش میں فیڈ کرتا ہے۔ یہ اہم ہے کیونکہ یہ ایجنٹوں کو بنیادی ماڈل کی دوبارہ تربیت کیے بغیر کسی کام میں بہتری لانے دیتا ہے۔
Reflexion ایجنٹ کس طرح سیکھتا ہے اس کی وضاحتی خصوصیت کیا ہے؟
اضطراری کو بعض اوقات 'زبانی کمک سیکھنے' کہا جاتا ہے کیونکہ اسباق کو میموری میں قدرتی زبان کے متن کے طور پر محفوظ کیا جاتا ہے، ماڈل کے پیرامیٹرز میں انکوڈ نہیں کیا جاتا ہے۔
Reflexion فریم ورک میں، Evaluator کیا کرتا ہے؟
ایویلیویٹر (یونٹ ٹیسٹ، عین مطابق میچ چیک، یا ایل ایل ایم جج) یہ اشارہ دیتا ہے کہ سیلف ریفلیکشن مرحلہ متنی سبق میں بدل جاتا ہے۔
Reflexion میں تشخیص کے سگنل کا معیار اتنا کیوں اہم ہے؟
اگر تشخیص کنندہ ناقابل اعتماد ہے، تو ایجنٹ غلط تاثرات کی بنیاد پر پراعتماد عکاسی لکھ سکتا ہے، مستقبل کی کوششوں کو غلط سمت میں آگے بڑھا سکتا ہے۔
کس بینچ مارک پر اضطراری طرز کی خود تصحیح نے کوڈنگ پاس کی شرح کو خاص طور پر بہتر کیا؟
ہیومن ایول ایک کوڈ جنریشن بینچ مارک ہے، اور ایجنٹ کو متعدد کوششوں میں ڈیبگ کرنے دینے سے پاس کی شرحیں سنگل شاٹ پرفارمنس سے بہت زیادہ بڑھ جاتی ہیں۔
خود کو درست کرنے والے ایجنٹوں کے ساتھ ایک حقیقی کھلا خطرہ کون سا ہے؟
ایک اچھے رکنے کے اصول کے بغیر، ایک ایجنٹ درست جوابات پر نظر ثانی کرتا رہتا ہے، حساب ضائع کرتا ہے اور بعض اوقات اچھی پیداوار کو کم کرتا ہے۔