एजेंट लूप्स में आत्म-प्रतिबिंब
आत्म-प्रतिबिंब एक एआई एजेंट को कार्य के मध्य में अपने स्वयं के आउटपुट और कार्यों की आलोचना करने देता है, फिर उस आलोचना के आधार पर संशोधित करता है।
सिंहावलोकन
It turns a one-shot guesser into a system that catches and fixes its own mistakes.
गहरा गोता
एजेंट लूप में, एक भाषा मॉडल कार्रवाई करता है (कॉलिंग टूल, कोड लिखना, उत्तर देना), परिणामों का निरीक्षण करता है, और निर्णय लेता है कि आगे क्या करना है। आत्म-प्रतिबिंब एक जानबूझकर कदम जोड़ता है जहां मॉडल जारी रखने से पहले अपने हाल के काम का मूल्यांकन करता है। रिफ्लेक्सियन (2023) जैसे फ्रेमवर्क इसे ठोस बनाते हैं: एक असफल प्रयास के बाद, एजेंट एक संक्षिप्त मौखिक आलोचना लिखता है ('मैं खाली सूची मामले को संभालना भूल गया') और इसे स्मृति में संग्रहीत करता है, इसलिए अगला प्रयास उस पाठ पर आधारित होता है। सेल्फ-रिफाइन फीडबैक उत्पन्न करने के लिए उसी मॉडल का उपयोग करता है और फिर उसके उत्तर को पुनरावृत्त रूप से फिर से लिखता है। प्रतिबिंब आउटपुट की किसी लक्ष्य से तुलना करने, त्रुटि संदेशों की जाँच करने या परीक्षण चलाने से आ सकता है। कोडिंग, वेब नेविगेशन और गणित जैसे बहु-चरणीय कार्यों पर भुगतान उच्च विश्वसनीयता है, जहां एक एकल पास अक्सर विफल हो जाता है लेकिन एक आलोचना-और-पुनः प्रयास लूप सफल होता है।
तकनीकी अंतर्दृष्टि
प्रतिबिंब को आम तौर पर एक अतिरिक्त संकेत के रूप में कार्यान्वित किया जाता है: मॉडल को अपने स्वयं के कार्यों की प्रतिलेख पर एक आलोचक के रूप में कार्य करने के लिए कहा जाता है, जो प्राकृतिक-भाषा प्रतिक्रिया उत्पन्न करता है जिसे फिर अगले प्रयास के लिए संदर्भ में जोड़ा जाता है। रिफ्लेक्सियन इन समालोचनाओं को भार को ठीक करने के बजाय परीक्षणों के दौरान एक एपिसोडिक मेमोरी बफर में संग्रहीत करता है, इसलिए सीखना पूरी तरह से संदर्भ में होता है। सिग्नल ड्राइविंग प्रतिबिंब बाहरी (परीक्षण पास/असफल, उपकरण त्रुटियां) या स्वयं-उत्पन्न हो सकता है, और बाहरी सिग्नल कहीं अधिक विश्वसनीय होते हैं।
सामरिक प्रभाव
लागत और बजट
वास्तुकला संबंधी निर्णय वर्षों तक प्रदर्शन और परिचालन लागत को संचालित करते हैं।
स्पष्ट निर्णय
तकनीकी शिक्षा टीमों को सही स्टैक चुनने में मदद करती है, न कि केवल नवीनतम स्टैक चुनने में।
गुणवत्ता नियंत्रण
बेहतर इंजीनियरिंग विकल्प उत्पादन में विश्वसनीयता की घटनाओं को कम करते हैं।
एजेंट लूप्स में आत्म-प्रतिबिंब का भविष्य
उम्मीद करें कि प्रतिबिंब एक प्रेरक चाल के बजाय एक अंतर्निहित एजेंट आदिम बन जाएगा, मॉडलों को यह जानने के लिए प्रशिक्षित किया जाएगा कि प्रतिबिंब कब अतिरिक्त टोकन के लायक है और कब यह बस गणना को जला देता है। सत्यापनकर्ता मॉडल और निष्पादन प्रतिक्रिया तेजी से आत्म-आलोचना को आधार बनाएगी ताकि एजेंट यह भ्रम करना बंद कर दें कि गलत उत्तर सही हैं। अनुसंधान विफलता मोड को भी लक्षित कर रहा है जहां मॉडल आत्मविश्वास से खराब काम की पुष्टि करते हैं, लूप के लिए कैलिब्रेटेड, साक्ष्य-आधारित प्रतिबिंब और सीखे गए रोक मानदंडों की ओर बढ़ते हैं।
वास्तविक विश्व कार्यान्वयन
एक कोडिंग एजेंट एक असफल इकाई परीक्षण चलाता है, ट्रेसबैक पढ़ता है, ऑफ-बाय-वन त्रुटि को नोट करते हुए एक प्रतिबिंब लिखता है, और अगले लूप पुनरावृत्ति पर फ़ंक्शन को फिर से लिखता है।
एक वेब-ब्राउज़िंग एजेंट जिसने गलत लिंक पर क्लिक किया है, वह उस पृष्ठ को दर्शाता है जिस पर वह आया है, अपने लक्ष्य के साथ बेमेल को पहचानता है, और एक अलग लिंक का प्रयास करने के लिए पीछे हट जाता है।
एक शोध सहायक एक उत्तर का मसौदा तैयार करता है, असमर्थित दावों के लिए इसकी आलोचना करता है, और इसे वापस करने से पहले उद्धरण जोड़ने या अनिश्चित बयानों को हेज करने के लिए संशोधित करता है।
एक गणित-समाधान एजेंट समस्या की बाधाओं के विरुद्ध अपने अंतिम उत्तर की जांच करता है, एक इकाई बेमेल को नोटिस करता है, और त्रुटिपूर्ण परिणाम प्रस्तुत करने के बजाय गणना को फिर से करता है।
जोखिम और रेलिंग
एक बेंचमार्क को अनुकूलित करने से व्यापक सिस्टम कमजोरियों को छुपाया जा सकता है।
बुनियादी ढांचे और रखरखाव की लागत को अक्सर कम करके आंका जाता है।
जैसे-जैसे सिस्टम अधिक जटिल होते जाएंगे सुरक्षा और अवलोकन संबंधी अंतराल बढ़ सकते हैं।
कार्यान्वयन रोडमैप
कार्यान्वयन से पहले विलंबता, गुणवत्ता और लागत लक्ष्य परिभाषित करें।
यथार्थवादी लोड और डेटा स्थितियों के तहत बेंचमार्क।
त्रुटियों, बहाव और उपयोगकर्ता प्रभाव के लिए उपकरण निगरानी।
स्केलिंग से पहले रोलबैक और घटना प्रतिक्रिया पथ तैयार करें।
अन्वेषण करते रहें
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Self-Reflection in Agent Loops quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
अगली गाइड
परावर्तन और स्व-सुधार करने वाले एजेंट
अक्सर पूछे जाने वाले प्रश्नों
What is Self-Reflection in Agent Loops?
आत्म-प्रतिबिंब एक एआई एजेंट को कार्य के मध्य में अपने स्वयं के आउटपुट और कार्यों की आलोचना करने देता है, फिर उस आलोचना के आधार पर संशोधित करता है। यह एक बार में अनुमान लगाने वाले को एक ऐसे सिस्टम में बदल देता है जो अपनी गलतियों को पकड़ता है और ठीक करता है।
मानक एजेंट लूप में आत्म-प्रतिबिंब क्या जोड़ता है?
आत्म-प्रतिबिंब एक मूल्यांकन चरण सम्मिलित करता है जिसमें एजेंट अपने हालिया कार्यों या आउटपुट की आलोचना करता है और उस आलोचना का उपयोग अपने अगले कदम का मार्गदर्शन करने के लिए करता है।
रिफ्लेक्सियन फ्रेमवर्क में, मॉडल की आत्म-आलोचनाएँ कहाँ संग्रहीत की जाती हैं?
रिफ्लेक्सियन मौखिक आत्म-आलोचना को एक एपिसोडिक मेमोरी बफर में रखता है और उन्हें बाद के परीक्षणों के संदर्भ में फीड करता है, इसलिए सीखना वजन अपडेट के बजाय संदर्भ में होता है।
प्रतिबिंब के लिए कौन सा फीडबैक संकेत सबसे अधिक विश्वसनीय होता है?
असफल परीक्षण या रनटाइम त्रुटियां जैसे जमीनी बाहरी संकेत ठोस, भरोसेमंद प्रतिक्रिया देते हैं, जबकि पूरी तरह से स्व-निर्मित आलोचना गलत हो सकती है।
आत्म-चिंतन की ज्ञात विफलता पद्धति क्या है?
जमीनी फीडबैक के बिना, मॉडल कभी-कभी त्रुटिपूर्ण काम की समीक्षा करते हैं और गलत तरीके से निष्कर्ष निकालते हैं कि यह ठीक है, इसलिए बाहरी सत्यापन महत्वपूर्ण है।
सेल्फ-रिफाइन दृष्टिकोण आम तौर पर फीडबैक कैसे उत्पन्न करता है?
सेल्फ-रिफाइन में एक एकल मॉडल अपने ड्राफ्ट पर फीडबैक उत्पन्न करता है और फिर उस फीडबैक का उपयोग करके आउटपुट को पुनरावृत्त रूप से संशोधित करता है।