एप्लीकेशन गाइड

परावर्तन और स्व-सुधार करने वाले एजेंट

रिफ्लेक्सियन एक ऐसी तकनीक है जहां एक एआई एजेंट अपनी विफलताओं पर लिखित रूप से प्रतिबिंबित करता है और उन पाठों को अपने अगले प्रयास में वापस डालता है।

2 मिनट लालअंतिम बार अद्यतन किया गया

सिंहावलोकन

It matters because it lets agents improve on a task without retraining the underlying model.

गहरा गोता

शिन और सहकर्मियों द्वारा 2023 के पेपर में पेश किया गया रिफ्लेक्सियन, एक एजेंट को एक लूप देता है: यह एक कार्य का प्रयास करता है, एक संकेत प्राप्त करता है कि यह कैसे हुआ (एक परीक्षा परिणाम, एक इनाम, या एक आलोचना), फिर एक संक्षिप्त प्राकृतिक-भाषा 'प्रतिबिंब' लिखता है जिसमें बताया गया है कि क्या गलत हुआ और आगे क्या प्रयास करना है। वह प्रतिबिंब स्मृति में संग्रहीत होता है और अगले प्रयास के संकेत से जुड़ा होता है। महत्वपूर्ण बात यह है कि मॉडल का वज़न कभी नहीं बदलता; सीखना पूरी तरह से पाठ के रूप में संदर्भ विंडो में होता है। यह 'मौखिक सुदृढीकरण सीखना' एजेंटों को कोडिंग समस्याओं, वेब नेविगेशन और तर्क कार्यों पर पुनरावृत्ति करने देता है। ह्यूमनइवल कोडिंग बेंचमार्क पर, रिफ्लेक्सियन-शैली स्व-सुधार ने एकल-शॉट प्रयासों की तुलना में पास दर को काफी अधिक बढ़ा दिया, बस एजेंट को कुछ प्रयासों में अपनी गलतियों को डीबग करने की अनुमति देकर।

तकनीकी अंतर्दृष्टि

रिफ्लेक्सियन तीन भूमिकाओं को अलग करता है: एक अभिनेता जो क्रियाएं उत्पन्न करता है, एक मूल्यांकनकर्ता जो परिणाम स्कोर करता है (यूनिट परीक्षण, एक सटीक-मिलान जांच, या एक एलएलएम जज), और एक सेल्फ-रिफ्लेक्शन मॉडल जो उस स्कोर को एक पाठ्य पाठ में बदल देता है। पाठ अगले परीक्षण में पुन: उपयोग किए जाने वाले एपिसोडिक मेमोरी बफ़र में आ जाता है। चूँकि फीडबैक ग्रेडिएंट के बजाय भाषा है, इसलिए किसी GPU प्रशिक्षण की आवश्यकता नहीं है, लेकिन यह आत्मविश्वासपूर्ण लेकिन गलत प्रतिबिंबों को मजबूत करने से बचने के लिए एक विश्वसनीय मूल्यांकन संकेत पर बहुत अधिक निर्भर करता है।

सामरिक प्रभाव

विकल्प बनाएं

एप्लिकेशन-स्तरीय डिज़ाइन यह निर्धारित करता है कि AI वास्तविक परिणामों में सुधार करता है या नहीं।

टीम और वर्कफ़्लो

अच्छा वर्कफ़्लो एकीकरण उत्पादकता लाभ पैदा करता है जिस पर उपयोगकर्ता भरोसा कर सकते हैं।

जोखिम और सुरक्षा

अच्छी तरह से उपयोग के मामले परिवर्तन की थकान और कार्यान्वयन जोखिम को कम करते हैं।

परावर्तन और स्व-सुधार करने वाले एजेंटों का भविष्य

स्व-सुधार एक शोध युक्ति के बजाय एजेंट ढांचे में एक डिफ़ॉल्ट परत बनता जा रहा है। स्वचालित सत्यापनकर्ताओं, जैसे कोड सैंडबॉक्स, औपचारिक चेकर्स और तथ्यों की पुष्टि करने वाली पुनर्प्राप्ति के साथ सख्त एकीकरण की अपेक्षा करें, इसलिए प्रतिबिंबों को मॉडल के दूसरे-अनुमान लगाने के बजाय उद्देश्य संकेतों पर आधारित किया जाता है। खुली चुनौतियाँ उन लूपों से बचने की हैं जहाँ एक एजेंट कार्यशील आउटपुट को अंतहीन रूप से 'ठीक' करता है, यह तय करता है कि कब पुनरावृत्ति बंद करनी है, और प्रतिबिंबों को प्रशंसनीय-लगने वाले लेकिन असत्यापित तर्कसंगतताओं में बहने से रोकना है।

वास्तविक विश्व कार्यान्वयन

एक कोडिंग एजेंट जो यूनिट परीक्षण चलाता है, असफल दावे को पढ़ता है, बग पर एक नोट लिखता है, और सुइट को फिर से चलाने से पहले उसके कोड को संपादित करता है।

एक शोध सहायक जो पुनर्प्राप्ति जांच विफल होने पर मतिभ्रम उद्धरण पकड़ता है, फिर केवल सत्यापित स्रोतों का उपयोग करने के लिए उत्तर को संशोधित करता है।

एक वेब-नेविगेशन एजेंट (उदाहरण के लिए, अल्फवर्ल्ड या वेबशॉप बेंचमार्क पर) जो 'मैंने गलत फ़िल्टर पर क्लिक किया' रिकॉर्ड करता है और पुनः प्रयास करने पर उस गलत कदम से बचता है।

एक गणित समस्या-समाधानकर्ता जो किसी बाधा के विरुद्ध अपने अंतिम उत्तर की जाँच करता है, एक संकेत त्रुटि को नोटिस करता है, और प्रासंगिक चरण पर फिर से काम करता है।

जोखिम और रेलिंग

किसी टूटी हुई प्रक्रिया को स्वचालित करने से मौजूदा समस्याएँ बढ़ सकती हैं।

टीमें अति-स्वचालित हो सकती हैं और आवश्यक मानवीय निर्णय को हटा सकती हैं।

यदि आउटपुट का लगातार मूल्यांकन नहीं किया गया तो गुणवत्ता में गिरावट आ सकती है।

कार्यान्वयन रोडमैप

1

वर्तमान वर्कफ़्लो को मैप करें और उच्चतम-घर्षण चरण की पहचान करें।

2

पूर्ण स्वचालन से पहले मानव चौकियों को परिभाषित करें।

3

उपयोगकर्ताओं को संकेतों, वृद्धि पथों और गुणवत्ता मानकों पर प्रशिक्षित करें।

4

निरंतर मूल्य की पुष्टि के लिए कार्य-स्तर के परिणामों को ट्रैक करें।

अन्वेषण करते रहें

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Reflexion and Self-Correcting Agents quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

प्रश्नोत्तरी प्रारंभ करें

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

अगली गाइड

एजेंट लूप्स में आत्म-प्रतिबिंब

अक्सर पूछे जाने वाले प्रश्नों

What is Reflexion and Self-Correcting Agents?

रिफ्लेक्सियन एक ऐसी तकनीक है जहां एक एआई एजेंट अपनी विफलताओं पर लिखित रूप से प्रतिबिंबित करता है और उन पाठों को अपने अगले प्रयास में वापस डालता है। यह मायने रखता है क्योंकि यह एजेंटों को अंतर्निहित मॉडल को फिर से प्रशिक्षित किए बिना किसी कार्य में सुधार करने देता है।

एक रिफ्लेक्सियन एजेंट 'सीखता' कैसे है इसकी परिभाषित विशेषता क्या है?

रिफ्लेक्सियन को कभी-कभी 'मौखिक सुदृढीकरण सीखना' कहा जाता है क्योंकि पाठों को स्मृति में प्राकृतिक-भाषा पाठ के रूप में संग्रहीत किया जाता है, मॉडल के मापदंडों में एन्कोड नहीं किया जाता है।

रिफ्लेक्सियन फ्रेमवर्क में, मूल्यांकनकर्ता क्या करता है?

मूल्यांकनकर्ता (एक इकाई परीक्षण, सटीक-मिलान जांच, या एलएलएम जज) संकेत उत्पन्न करता है कि आत्म-प्रतिबिंब कदम एक पाठ्य पाठ में बदल जाता है।

रिफ्लेक्सियन में मूल्यांकन संकेत की गुणवत्ता इतनी अधिक क्यों मायने रखती है?

यदि मूल्यांकनकर्ता अविश्वसनीय है, तो एजेंट खराब फीडबैक के आधार पर आत्मविश्वासपूर्ण विचार लिख सकता है, जिससे भविष्य के प्रयासों को गलत दिशा में ले जाया जा सकता है।

किस बेंचमार्क पर रिफ्लेक्सियन-शैली स्व-सुधार ने कोडिंग पास दरों में उल्लेखनीय सुधार किया?

ह्यूमनइवल एक कोड-जनरेशन बेंचमार्क है, और एजेंट को कई प्रयासों में डिबग करने से पास दर एकल-शॉट प्रदर्शन से काफी ऊपर बढ़ जाती है।

स्व-सुधार एजेंटों के साथ वास्तविक खुला जोखिम कौन सा है?

एक अच्छे रोक नियम के बिना, एक एजेंट सही उत्तरों को संशोधित करता रह सकता है, गणना बर्बाद कर सकता है और कभी-कभी अच्छे आउटपुट को ख़राब कर सकता है।