भाषा एआई गाइड

स्व-परिष्कृत पुनरावर्ती आउटपुट सुधार

सेल्फ-रिफाइन एक संकेत देने वाली तकनीक है जहां एक भाषा मॉडल अपने स्वयं के आउटपुट की आलोचना करता है और इसे फिर से लिखता है, जब तक कि उत्तर में सुधार नहीं हो जाता।

2 मिनट लालअंतिम बार अद्यतन किया गया

सिंहावलोकन

It matters because models can often spot and fix their own mistakes without any extra training or human feedback.

गहरा गोता

2023 में मदान और उनके सहयोगियों द्वारा शुरू किया गया सेल्फ-रिफाइन, एक ही मॉडल को तीन भूमिकाओं में चलाता है: जनरेटर, आलोचक और पुनरीक्षक। सबसे पहले मॉडल प्रारंभिक उत्तर तैयार करता है। फिर उसे उस उत्तर पर विशिष्ट, कार्रवाई योग्य प्रतिक्रिया देने के लिए कहा जाता है (उदाहरण के लिए, "इस कोड में त्रुटि प्रबंधन का अभाव है" या "यह सारांश लागत के आंकड़े से चूक गया")। अंत में, यह उस फीडबैक का उपयोग करके उत्तर को फिर से लिखता है। चक्र तब तक दोहराया जाता है जब तक कि मॉडल यह तय नहीं कर लेता कि आउटपुट काफी अच्छा है या चरण सीमा पूरी नहीं हो जाती। महत्वपूर्ण रूप से, किसी अतिरिक्त प्रशिक्षण, इनाम मॉडल या बाहरी उपकरण की आवश्यकता नहीं है, बस चतुर संकेत की आवश्यकता है। कोड अनुकूलन, संवाद और भावना पुनर्लेखन जैसे कार्यों पर, इस लूप ने एकल-शॉट पीढ़ी की तुलना में गुणवत्ता में उल्लेखनीय सुधार किया।

तकनीकी अंतर्दृष्टि

मुख्य तंत्र मॉडल को अपने स्वयं के फीडबैक ओरेकल के रूप में उपयोग कर रहा है। पीढ़ी और समालोचक अलग-अलग संकेतों का उपयोग करते हैं, इसलिए मॉडल अपने पहले ड्राफ्ट का बचाव करने के बजाय नए सिरे से मूल्यांकन करता है। फीडबैक विशिष्ट और कार्रवाई योग्य होना चाहिए, न कि केवल "इसे बेहतर बनाएं", क्योंकि अस्पष्ट आलोचना अस्पष्ट संपादन उत्पन्न करती है। पुनरीक्षक को संदर्भ देते हुए पूरा इतिहास (ड्राफ्ट और सभी फीडबैक) वापस फीड किया जाता है। लाभ तब सबसे बड़ा होता है जब मॉडल वास्तव में दोष का पता लगाने में सक्षम होता है और फिर उसे ठीक करता है।

सामरिक प्रभाव

गति और पैमाना

भाषा वर्कफ़्लो निरंतरता से समझौता किए बिना तेज़ी से आगे बढ़ सकता है।

पहुंच और पहुंच

यह सभी भाषाओं और संचार शैलियों तक पहुंच का विस्तार करता है।

स्पष्ट निर्णय

टीमें निर्णय लेने में अधिक समय व्यतीत कर सकती हैं जबकि स्वचालन पुनरावृत्ति को संभालता है।

सेल्फ-रिफाइन इटरेटिव आउटपुट सुधार का भविष्य

सेल्फ-रिफाइन एजेंटिक सिस्टम के लिए एक बिल्डिंग ब्लॉक बनता जा रहा है, जहां मॉडल कार्य करने से पहले पुनरावृत्त रूप से कोड या योजनाओं का मसौदा तैयार करते हैं, परीक्षण करते हैं और मरम्मत करते हैं। बाहरी सत्यापनकर्ताओं (इकाई परीक्षण, कैलकुलेटर, खोज) के साथ सख्त एकीकरण की अपेक्षा करें ताकि आलोचना मॉडल की राय के बजाय वास्तविक संकेतों पर आधारित हो। अनुसंधान इस बात की जांच कर रहा है कि आत्म-आलोचना कब मदद करती है बनाम जब मॉडल हठपूर्वक त्रुटियों को दोहराते हैं, और अनुकूली नियंत्रक जो यह तय करते हैं कि किसी दिए गए कार्य को लागत के मुकाबले गुणवत्ता को संतुलित करने के लिए वास्तव में कितने परिशोधन दौर की आवश्यकता है।

वास्तविक विश्व कार्यान्वयन

मॉडल फ़्लैग में किनारे के मामले गायब होने से उत्पन्न कोड में सुधार करना, फिर उन्हें संभालने के लिए फ़ंक्शन को फिर से लिखना

किसी ड्राफ्ट ईमेल या निबंध को आत्म-आलोचना के लहजे और स्पष्टता से निखारना, फिर लक्षित दर्शकों के लिए संशोधित करना

प्रत्येक चरण की जाँच करके और अंकगणितीय गलतियों को सुधारकर गणित या तर्क समस्या के उत्तर को अनुकूलित करना

ग्राहक-सहायता उत्तर को परिष्कृत करना ताकि यह सामान्य प्रतिक्रिया देने के बजाय सीधे उपयोगकर्ता के प्रश्न का समाधान कर सके

जोखिम और रेलिंग

मतिभ्रम वाले तथ्य चुपचाप रिपोर्ट में प्रवेश कर सकते हैं, प्रवाह का समर्थन कर सकते हैं, या अनुसंधान आउटपुट का समर्थन कर सकते हैं।

त्वरित संवेदनशीलता समान अनुरोधों में असंगत परिणाम पैदा कर सकती है।

यदि पहुंच नियंत्रण कमजोर हैं तो संवेदनशील पाठ डेटा उजागर हो सकता है।

कार्यान्वयन रोडमैप

1

रोलआउट से पहले आउटपुट स्वरूप, टोन और गुणवत्ता मानकों को परिभाषित करें।

2

जब भी सटीकता मायने रखती है तो विश्वसनीय स्रोतों के साथ जमीनी प्रतिक्रियाएँ।

3

उच्च जोखिम वाले आउटपुट के लिए एक मानव समीक्षा चेकपॉइंट रखें।

4

विफलता पैटर्न को ट्रैक करें और संकेतों या वर्कफ़्लो को नियमित रूप से पुनः प्रशिक्षित करें।

अन्वेषण करते रहें

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Self-Refine Iterative Output Improvement quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

प्रश्नोत्तरी प्रारंभ करें

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

अगली गाइड

रेलिंग और आउटपुट मॉडरेशन

अक्सर पूछे जाने वाले प्रश्नों

What is Self-Refine Iterative Output Improvement?

सेल्फ-रिफाइन एक संकेत देने वाली तकनीक है जहां एक भाषा मॉडल अपने स्वयं के आउटपुट की आलोचना करता है और इसे फिर से लिखता है, जब तक कि उत्तर में सुधार नहीं हो जाता। यह मायने रखता है क्योंकि मॉडल अक्सर बिना किसी अतिरिक्त प्रशिक्षण या मानवीय प्रतिक्रिया के अपनी गलतियों को पहचान सकते हैं और उन्हें ठीक कर सकते हैं।

सेल्फ-रिफाइन लूप में एक एकल मॉडल कौन सी तीन भूमिकाएँ निभाता है?

सेल्फ-रिफाइन तीन प्रेरित भूमिकाओं में एक मॉडल का उपयोग करता है: यह एक मसौदा तैयार करता है, इसकी आलोचना करता है, फिर इसे संशोधित करता है।

सेल्फ-रिफाइन को काम करने के लिए प्रेरित करने के अलावा और क्या चाहिए?

सेल्फ-रिफाइन की एक परिभाषित विशेषता यह है कि इसके लिए किसी अतिरिक्त प्रशिक्षण, इनाम मॉडल या मानवीय प्रतिक्रिया की आवश्यकता नहीं है, केवल संकेत देने की आवश्यकता है।

ड्राफ्ट तैयार करने से अलग प्रॉम्प्ट में फीडबैक तैयार करना क्यों सहायक है?

किसी नए संकेत में आलोचना करना मूल उत्तर को तर्कसंगत बनाने के बजाय वस्तुनिष्ठ मूल्यांकन को प्रोत्साहित करता है।

किस प्रकार की प्रतिक्रिया परिशोधन कदम को सबसे प्रभावी बनाती है?

विशिष्ट, कार्रवाई योग्य आलोचना (उदाहरण के लिए, 'त्रुटि प्रबंधन जोड़ें') लक्षित संपादन संचालित करती है; अस्पष्ट प्रतिक्रिया से अस्पष्ट संशोधन उत्पन्न होते हैं।

सेल्फ-रिफाइन किसी आउटपुट को बेहतर बनाने में कब विफल हो जाता है?

यदि मॉडल किसी समस्या को नहीं पहचान सकता है, तो उसकी आत्म-आलोचना उसे सामने नहीं लाएगी, इसलिए संशोधन उसे ठीक नहीं कर सकता है।