स्व-आरएजी और चिंतनशील पुनर्प्राप्ति
सेल्फ-आरएजी एक ढांचा है जहां एक भाषा मॉडल यह तय करता है कि कब पुनर्प्राप्त करना है, फिर विशेष प्रतिबिंब टोकन का उपयोग करके पुनर्प्राप्त मार्ग और अपने स्वयं के आउटपुट दोनों की आलोचना करता है।
सिंहावलोकन
It matters because it makes retrieval-augmented generation adaptive and self-checking instead of blindly fetching documents for every query.
गहरा गोता
मानक RAG प्रत्येक इनपुट के लिए एक निश्चित संख्या में अंशों को पुनः प्राप्त करता है, तब भी जब किसी की आवश्यकता नहीं होती है, और कभी भी यह सत्यापित नहीं करता है कि उत्तर वास्तव में समर्थित है या नहीं। 2023 में असाई और उनके सहयोगियों द्वारा पेश किया गया सेल्फ-आरएजी, मांग पर तीन काम करने के लिए एक एकल मॉडल को प्रशिक्षित करता है। सबसे पहले, यह एक 'पुनर्प्राप्ति' टोकन उत्सर्जित करता है जो यह तय करता है कि बाहरी ज्ञान की बिल्कुल आवश्यकता है या नहीं। दूसरा, पुनः प्राप्त करने के बाद, यह 'IsRelevant' समालोचना टोकन जारी करता है कि क्या प्रत्येक मार्ग मदद करता है। तीसरा, यह 'IsSupported' और 'IsUseful' टोकन उत्पन्न करता है जो यह आकलन करता है कि क्या इसके स्वयं के बयान सबूतों पर आधारित हैं और प्रतिक्रिया कितनी अच्छी है। ये प्रतिबिंब टोकन सिस्टम को केवल आवश्यक होने पर ही पुनर्प्राप्त करने देते हैं, अप्रासंगिक मार्गों को फ़िल्टर करते हैं, और उन आउटपुट को प्राथमिकता देते हैं जिन्हें मॉडल स्वयं अच्छी तरह से समर्थित मानता है, जिससे मतिभ्रम कम हो जाता है।
तकनीकी अंतर्दृष्टि
स्व-आरएजी को प्रतिबिंब टोकन के साथ लेबल किए गए डेटा पर पर्यवेक्षित शिक्षण के माध्यम से प्रशिक्षित किया जाता है, जिसे अक्सर जीपीटी -4 जैसे मजबूत मॉडल से आसुत किया जाता है। अनुमान के अनुसार, मॉडल इन विशेष नियंत्रण टोकन के साथ साधारण टेक्स्ट टोकन को इंटरलीव करता है। एक खंड-स्तरीय बीम खोज क्रिटिक टोकन की संभावनाओं का उपयोग करके उम्मीदवार की निरंतरता को स्कोर कर सकती है, जिससे डेवलपर्स को रन टाइम पर व्यवहार को ट्यून करने की सुविधा मिलती है - उदाहरण के लिए, तथ्यात्मक ग्राउंडिंग बनाम प्रवाह को अधिकतम करने के लिए 'समर्थित' को अधिक भारी महत्व देना।
सामरिक प्रभाव
गति और पैमाना
भाषा वर्कफ़्लो निरंतरता से समझौता किए बिना तेज़ी से आगे बढ़ सकता है।
पहुंच और पहुंच
यह सभी भाषाओं और संचार शैलियों तक पहुंच का विस्तार करता है।
स्पष्ट निर्णय
टीमें निर्णय लेने में अधिक समय व्यतीत कर सकती हैं जबकि स्वचालन पुनरावृत्ति को संभालता है।
सेल्फ-आरएजी और रिफ्लेक्टिव रिट्रीवल का भविष्य
चिंतनशील पुनर्प्राप्ति एजेंटिक आरएजी के साथ अभिसरण कर रही है, जहां मॉडल बहु-चरण खोज, कॉल टूल और पुनरावृत्तियों में स्वयं-सही की योजना बनाते हैं। सत्यापनकर्ता मॉडल के साथ आत्म-आलोचना के सख्त एकीकरण, ज्ञान ग्राफ पर पुनर्प्राप्ति, और सुदृढीकरण सीखने की अपेक्षा करें जो वफादार, अच्छी तरह से उद्धृत उत्तरों को पुरस्कृत करता है। जैसे-जैसे तर्क मॉडल परिपक्व होते हैं, ऑन-डिमांड और स्व-मूल्यांकन पुनर्प्राप्ति एक अलग ढांचे के बजाय एक डिफ़ॉल्ट व्यवहार बनने की संभावना है, मॉडल गतिशील रूप से निर्णय लेता है कि प्रत्येक दावे को कितने सबूत की आवश्यकता है।
वास्तविक विश्व कार्यान्वयन
एक चिकित्सा प्रश्नोत्तर सहायक केवल नैदानिक प्रश्नों के लिए दिशानिर्देश पुनर्प्राप्त करता है और अपने 'पुनर्प्राप्ति' निर्णय टोकन का उपयोग करके अभिवादन के लिए पुनर्प्राप्ति को छोड़ देता है।
एक शोध सहायक लिखने से पहले प्रत्येक अनुच्छेद की 'प्रासंगिक है' आलोचना की जाँच करके ऑफ-टॉपिक खोज हिट को फ़िल्टर करता है।
एक एंटरप्राइज़ चैटबॉट 'IsSupported' टैग किए गए उत्तरों को प्राथमिकता देता है, ताकि उसके बयान कंपनी के दस्तावेज़ों पर आधारित रहें, मतिभ्रम को खत्म किया जा सके।
एक तथ्य-जाँच उपकरण कई उम्मीदवारों के उत्तरों को रैंक करने और सर्वोत्तम-प्रमाणित उत्तर को सामने लाने के लिए 'इज़यूज़फुल' स्कोर का उपयोग करता है।
जोखिम और रेलिंग
मतिभ्रम वाले तथ्य चुपचाप रिपोर्ट में प्रवेश कर सकते हैं, प्रवाह का समर्थन कर सकते हैं, या अनुसंधान आउटपुट का समर्थन कर सकते हैं।
त्वरित संवेदनशीलता समान अनुरोधों में असंगत परिणाम पैदा कर सकती है।
यदि पहुंच नियंत्रण कमजोर हैं तो संवेदनशील पाठ डेटा उजागर हो सकता है।
कार्यान्वयन रोडमैप
रोलआउट से पहले आउटपुट स्वरूप, टोन और गुणवत्ता मानकों को परिभाषित करें।
जब भी सटीकता मायने रखती है तो विश्वसनीय स्रोतों के साथ जमीनी प्रतिक्रियाएँ।
उच्च जोखिम वाले आउटपुट के लिए एक मानव समीक्षा चेकपॉइंट रखें।
विफलता पैटर्न को ट्रैक करें और संकेतों या वर्कफ़्लो को नियमित रूप से पुनः प्रशिक्षित करें।
अन्वेषण करते रहें
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Self-RAG and Reflective Retrieval quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
अगली गाइड
सट्टा आरएजी और पुनर्प्राप्ति-संवर्धित प्रारूपण
अक्सर पूछे जाने वाले प्रश्नों
What is Self-RAG and Reflective Retrieval?
सेल्फ-आरएजी एक ढांचा है जहां एक भाषा मॉडल यह तय करता है कि कब पुनर्प्राप्त करना है, फिर विशेष प्रतिबिंब टोकन का उपयोग करके पुनर्प्राप्त मार्ग और अपने स्वयं के आउटपुट दोनों की आलोचना करता है। यह मायने रखता है क्योंकि यह प्रत्येक क्वेरी के लिए दस्तावेज़ों को आँख बंद करके लाने के बजाय पुनर्प्राप्ति-संवर्धित पीढ़ी को अनुकूली और स्व-जांच बनाता है।
सेल्फ-आरएजी कौन सा महत्वपूर्ण निर्णय लेता है जो मानक आरएजी नहीं करता है?
सेल्फ-आरएजी हमेशा पुनर्प्राप्त करने के बजाय मांग पर निर्णय लेने के लिए एक 'पुनर्प्राप्ति' टोकन उत्सर्जित करता है कि क्या बाहरी दस्तावेजों की आवश्यकता है।
सेल्फ-आरएजी में 'प्रतिबिंब टोकन' क्या हैं?
IsRelevant, IsSupported, और IsUseful जैसे प्रतिबिंब टोकन मॉडल को समालोचना अंश और उसके स्वयं के आउटपुट देते हैं।
कौन सा प्रतिबिंब टोकन यह आकलन करता है कि उत्पन्न कथन पुनर्प्राप्त साक्ष्य पर आधारित है या नहीं?
IsSupported टोकन यह निर्धारित करता है कि क्या मॉडल का दावा वास्तव में पुनर्प्राप्त अंशों द्वारा समर्थित है, जिससे मतिभ्रम को कम करने में मदद मिलती है।
सेल्फ-आरएजी मॉडल को आम तौर पर प्रतिबिंब टोकन उत्पन्न करने के लिए कैसे प्रशिक्षित किया जाता है?
स्व-आरएजी प्रतिबिंब टोकन के साथ एनोटेट किए गए प्रशिक्षण डेटा से सीखता है, जो अक्सर जीपीटी -4 जैसे अधिक सक्षम शिक्षक मॉडल द्वारा उत्पन्न होता है।
प्रत्येक अनुच्छेद के लिए 'प्रासंगिक है' आलोचना जारी करने से क्या लाभ मिलता है?
प्रत्येक परिच्छेद की प्रासंगिकता की आलोचना करके, सेल्फ-आरएजी विषय से बाहर की पुनर्प्राप्तियों को उत्तर में भरने के बजाय उन्हें अनदेखा कर सकता है।