ایجنٹ لوپس میں خود کی عکاسی
خود عکاسی ایک AI ایجنٹ کو اس کے اپنے نتائج اور کام کے درمیانی کام پر تنقید کرنے دیتا ہے، پھر اس تنقید کی بنیاد پر نظر ثانی کرتا ہے۔
جائزہ
It turns a one-shot guesser into a system that catches and fixes its own mistakes.
گہرا غوطہ
ایجنٹ لوپ میں، ایک لینگوئج ماڈل ایکشن لیتا ہے (کالنگ ٹولز، کوڈ لکھنا، جواب دینا)، نتائج کا مشاہدہ کرتا ہے، اور فیصلہ کرتا ہے کہ آگے کیا کرنا ہے۔ خود کی عکاسی ایک جان بوجھ کر قدم جوڑتی ہے جہاں ماڈل جاری رکھنے سے پہلے اپنے حالیہ کام کا جائزہ لیتا ہے۔ Reflexion (2023) جیسے فریم ورک اس کو ٹھوس بناتے ہیں: ایک ناکام کوشش کے بعد، ایجنٹ ایک مختصر زبانی تنقید لکھتا ہے ('میں خالی فہرست کیس کو ہینڈل کرنا بھول گیا تھا') اور اسے میموری میں محفوظ کرتا ہے، لہذا اگلی کوشش اس سبق پر مشروط ہے۔ سیلف ریفائن فیڈ بیک پیدا کرنے کے لیے اسی ماڈل کا استعمال کرتا ہے اور پھر اس کے جواب کو بار بار لکھتا ہے۔ عکاسی آؤٹ پٹ کا کسی مقصد سے موازنہ کرنے، غلطی کے پیغامات کی جانچ کرنے، یا ٹیسٹ چلانے سے آ سکتی ہے۔ کوڈنگ، ویب نیویگیشن، اور ریاضی جیسے کثیر قدمی کاموں پر ادائیگی زیادہ قابل اعتماد ہے، جہاں ایک ہی پاس اکثر ناکام ہو جاتا ہے لیکن تنقید اور دوبارہ کوشش کرنے والا لوپ کامیاب ہو جاتا ہے۔
تکنیکی بصیرت
عکاسی کو عام طور پر ایک اضافی پرامپٹ کے طور پر لاگو کیا جاتا ہے: ماڈل سے کہا جاتا ہے کہ وہ اپنے اعمال کی نقل پر ایک نقاد کے طور پر کام کرے، جس سے فطری زبان کی رائے پیدا ہوتی ہے جسے اگلی کوشش کے لیے سیاق و سباق میں شامل کیا جاتا ہے۔ Reflexion ان تنقیدوں کو ایک ایپیسوڈک میموری بفر میں ٹرائلز میں فائن ٹیوننگ وزن کے بجائے محفوظ کرتا ہے، لہذا سیکھنا مکمل طور پر سیاق و سباق میں ہوتا ہے۔ سگنل ڈرائیونگ ریفلیکشن بیرونی ہو سکتا ہے (ٹیسٹ پاس/فیل، ٹول کی غلطیاں) یا خود پیدا کردہ، اور بیرونی سگنلز زیادہ قابل اعتماد ہوتے ہیں۔
اسٹریٹجک اثر
لاگت اور بجٹ
فن تعمیر کے فیصلے سالوں تک کارکردگی اور آپریٹنگ لاگت کو آگے بڑھاتے ہیں۔
واضح فیصلے
تکنیکی تعلیم ٹیموں کو صحیح اسٹیک منتخب کرنے میں مدد کرتی ہے، نہ صرف جدید ترین۔
کوالٹی کنٹرول
انجینئرنگ کے بہتر انتخاب پیداوار میں قابل اعتماد واقعات کو کم کرتے ہیں۔
ایجنٹ لوپس میں خود کی عکاسی کا مستقبل
توقع کریں کہ عکاسی ایک بلٹ ان ایجنٹ پرائمٹیو بننے کی بجائے پرامپٹ ٹرک کے، ماڈلز کو یہ جاننے کے لیے تربیت دی جاتی ہے کہ کب عکاسی اضافی ٹوکن کے قابل ہے اور کب یہ صرف کمپیوٹ جلاتا ہے۔ تصدیق کنندگان کے ماڈلز اور عمل درآمد کے تاثرات تیزی سے خود تنقیدی کی بنیاد ڈالیں گے تاکہ ایجنٹ غلط جوابات کے درست ہونے کا فریب دینا چھوڑ دیں۔ تحقیق ناکامی کے موڈ کو بھی نشانہ بنا رہی ہے جہاں ماڈل اعتماد کے ساتھ خراب کام کی تصدیق کرتے ہیں، کیلیبریٹڈ، شواہد پر مبنی عکاسی کی طرف دھکیلتے ہیں اور لوپ کو روکنے کے معیار کو سیکھتے ہیں۔
حقیقی دنیا کا نفاذ
ایک کوڈنگ ایجنٹ ناکام یونٹ ٹیسٹ چلاتا ہے، ٹریس بیک کو پڑھتا ہے، ایک بار کی غلطی کو نوٹ کرتے ہوئے ایک عکاسی لکھتا ہے، اور اگلے لوپ تکرار پر فنکشن کو دوبارہ لکھتا ہے۔
ایک ویب براؤزنگ ایجنٹ جس نے غلط لنک پر کلک کیا ہے وہ اس صفحے پر ظاہر ہوتا ہے جس پر وہ اترا ہے، اپنے مقصد سے مماثلت کو پہچانتا ہے، اور ایک مختلف لنک کو آزمانے کے لیے پیچھے ہٹ جاتا ہے۔
ایک تحقیقی معاون جواب کا مسودہ تیار کرتا ہے، غیر تعاون یافتہ دعووں کے لیے اس پر تنقید کرتا ہے، اور اسے واپس کرنے سے پہلے اقتباسات شامل کرنے یا غیر یقینی بیانات کو ہیج کرنے کے لیے نظر ثانی کرتا ہے۔
ریاضی کو حل کرنے والا ایجنٹ مسئلہ کی رکاوٹوں کے خلاف اس کے حتمی جواب کی جانچ کرتا ہے، یونٹ کی مماثلت کو نوٹس کرتا ہے، اور ناقص نتیجہ جمع کرانے کے بجائے حساب کتاب پر دوبارہ کام کرتا ہے۔
خطرات اور گارڈریلز
ایک بینچ مارک کو بہتر بنانا نظام کی وسیع تر کمزوریوں کو چھپا سکتا ہے۔
بنیادی ڈھانچے اور دیکھ بھال کے اخراجات کو اکثر کم سمجھا جاتا ہے۔
سیکورٹی اور مشاہداتی فرق بڑھ سکتا ہے کیونکہ نظام زیادہ پیچیدہ ہو جاتا ہے۔
نفاذ کا روڈ میپ
نفاذ سے پہلے تاخیر، معیار اور لاگت کے اہداف کی وضاحت کریں۔
حقیقت پسندانہ بوجھ اور ڈیٹا کی شرائط کے تحت بینچ مارک۔
غلطیوں، بڑھے ہوئے، اور صارف کے اثرات کے لیے آلے کی نگرانی۔
اسکیلنگ سے پہلے رول بیک اور واقعہ کے ردعمل کے راستے تیار کریں۔
دریافت کرتے رہیں
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Self-Reflection in Agent Loops quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
اگلا گائیڈ
اضطراری اور خود کو درست کرنے والے ایجنٹ
اکثر پوچھے گئے سوالات
What is Self-Reflection in Agent Loops?
خود عکاسی ایک AI ایجنٹ کو اس کے اپنے نتائج اور کام کے درمیانی کام پر تنقید کرنے دیتا ہے، پھر اس تنقید کی بنیاد پر نظر ثانی کرتا ہے۔ یہ ایک شاٹ اندازہ لگانے والے کو ایک ایسے نظام میں بدل دیتا ہے جو اپنی غلطیوں کو خود پکڑتا اور ٹھیک کرتا ہے۔
خود کی عکاسی معیاری ایجنٹ لوپ میں کیا اضافہ کرتی ہے؟
خود عکاسی ایک تشخیصی مرحلہ داخل کرتا ہے جس میں ایجنٹ اپنے حالیہ اقدامات یا آؤٹ پٹ پر تنقید کرتا ہے اور اس تنقید کو اپنے اگلے اقدام کی رہنمائی کے لیے استعمال کرتا ہے۔
Reflexion فریم ورک میں، ماڈل کی خود تنقیدی باتیں کہاں محفوظ ہیں؟
Reflexion زبانی خود تنقیدوں کو ایک ایپیسوڈک میموری بفر میں رکھتا ہے اور بعد میں ہونے والے ٹرائلز میں انہیں سیاق و سباق میں کھلاتا ہے، لہذا سیکھنا وزن کی تازہ کاریوں کے بجائے سیاق و سباق میں ہے۔
عکاسی کے لیے کون سا فیڈ بیک سگنل سب سے زیادہ قابل اعتماد ہوتا ہے؟
گراؤنڈڈ بیرونی سگنلز جیسے ٹیسٹوں میں ناکام ہونا یا رن ٹائم کی غلطیاں ٹھوس، قابل اعتماد رائے دیتے ہیں، جبکہ خالصتاً خود تخلیق کردہ تنقید غلط ہو سکتی ہے۔
خود کی عکاسی کا معروف ناکامی موڈ کیا ہے؟
بنیاد پرستانہ رائے کے بغیر، ماڈل بعض اوقات ناقص کام کا جائزہ لیتے ہیں اور غلط نتیجہ اخذ کرتے ہیں کہ یہ ٹھیک ہے، اس لیے بیرونی تصدیق ضروری ہے۔
سیلف ریفائن اپروچ عام طور پر فیڈ بیک کیسے پیدا کرتا ہے؟
سیلف ریفائن کے پاس اس کے مسودے پر ایک ہی ماڈل پروڈکٹ فیڈ بیک ہوتا ہے اور پھر اس فیڈ بیک کا استعمال کرتے ہوئے آؤٹ پٹ پر دوبارہ نظر ثانی کرتا ہے۔