आगेअगली गाइड
सट्टा आरएजी और पुनर्प्राप्ति-संवर्धित प्रारूपण
तकनीकी
तकनीकी गाइड
मूल दस्तावेज़ पुनर्प्राप्ति, जिसे छोटी-से-बड़ी पुनर्प्राप्ति भी कहा जाता है, छोटे, सटीक पाठ खंडों पर खोज करता है लेकिन भाषा मॉडल को उस बड़े खंड या दस्तावेज़ को सौंप देता है जिससे प्रत्येक खंड आया है।
यह मायने रखता है क्योंकि यह सामान्य खंड-खंड व्यापार-बंद को हटा देता है: छोटे खंड प्रश्नों से सटीक रूप से मेल खाते हैं, और बड़े माता-पिता मॉडल को सही उत्तर देने के लिए पर्याप्त संदर्भ देते हैं।
निश्चित आकार का टुकड़ा व्यापार बंद करने के लिए बाध्य करता है। छोटे-छोटे टुकड़े, जैसे कुछ वाक्य, तीक्ष्ण एम्बेडिंग उत्पन्न करते हैं: वेक्टर एक विचार का प्रतिनिधित्व करता है, इसलिए उस विचार के बारे में एक प्रश्न उससे निकटता से मेल खाता है। लेकिन मॉडल के अच्छे उत्तर देने के लिए दो-वाक्य वाले खंड में शायद ही कभी पर्याप्त संदर्भ होता है; यह परिभाषा को तीन पैराग्राफ पहले या अगले वाक्य में अपवाद को छोड़ सकता है। बड़े खंड उस संदर्भ को ले जाते हैं, लेकिन उनकी एम्बेडिंग कई विचारों को एक साथ धुंधला कर देती है, इसलिए पुनर्प्राप्ति कम सटीक हो जाती है और प्रासंगिक मार्ग को उस खंड द्वारा रेखांकित किया जा सकता है जो केवल विषय पर है। छोटी से बड़ी पुनर्प्राप्ति दो नौकरियों को विभाजित करती है। सिस्टम खोज के लिए छोटे बच्चों के हिस्सों को अनुक्रमित करता है, और प्रत्येक बच्चा बड़े माता-पिता के लिए एक संकेतक रखता है: एक अनुभाग, एक पृष्ठ, या संपूर्ण दस्तावेज़। पूछताछ के समय यह सबसे अच्छे बच्चों को ढूंढता है, फिर उनके माता-पिता को ढूंढता है और लौटा देता है। यदि कई बच्चे एक ही माता-पिता को साझा करते हैं, तो माता-पिता को एक बार भेजा जाता है, जो डुप्लिकेट को भी हटा देता है। LangChain का ParentDocumentRetriever इसे बच्चों के लिए एक वेक्टर स्टोर और माता-पिता के लिए एक अलग दस्तावेज़ स्टोर के साथ लागू करता है। LlamaIndex संबंधित पैटर्न प्रदान करता है: वाक्य-विंडो पुनर्प्राप्ति, जो एक मिलान वाक्य और पड़ोसी वाक्यों की एक निश्चित संख्या लौटाता है, और ऑटो-मर्जिंग पुनर्प्राप्ति, जो कई पुनर्प्राप्त पत्ते के टुकड़ों को उनके साझा मूल नोड के साथ बदल देता है जब उनमें से पर्याप्त मेल खाते हैं। यह दृष्टिकोण मैनुअल, अनुबंध, नीतियों और पाठ्यपुस्तकों जैसे संरचित दस्तावेजों पर निश्चित आकार के खंडन को मात देता है, जहां अर्थ आसपास के अनुभाग पर निर्भर करता है। यह कम मदद करता है जब दस्तावेज़ पहले से ही कम होते हैं, या जब माता-पिता इतने बड़े होते हैं कि उनमें से कुछ संदर्भ विंडो को ओवरफ्लो कर देते हैं या अप्रासंगिक पाठ में उत्तर को दफन कर देते हैं। एक आम ग़लतफ़हमी यह है कि यह केवल बड़े टुकड़ों का उपयोग है। ऐसा नहीं है: पुनर्प्राप्ति इकाई और पीढ़ी इकाई जानबूझकर अलग-अलग आकार की हैं, इसलिए आप संदर्भ के मॉडल को कम किए बिना सटीक मिलान बनाए रखते हैं।
वास्तुकला संबंधी निर्णय वर्षों तक प्रदर्शन और परिचालन लागत को संचालित करते हैं।
तकनीकी शिक्षा टीमों को सही स्टैक चुनने में मदद करती है, न कि केवल नवीनतम स्टैक चुनने में।
बेहतर इंजीनियरिंग विकल्प उत्पादन में विश्वसनीयता की घटनाओं को कम करते हैं।
छोटा-से-बड़ा एक चाल के बजाय एक डिफ़ॉल्ट बनता जा रहा है, और प्रमुख ढांचे पहले से ही कॉन्फ़िगरेशन विकल्पों के रूप में पदानुक्रमित या विंडो पुनर्प्राप्ति को उजागर करते हैं। बड़ी संदर्भ विंडो बड़े माता-पिता को भेजने के दंड को कम करती है, जिससे पैटर्न को अपनाना सस्ता हो जाता है। मूल सीमाओं को स्वचालित रूप से चुनने के बारे में खुले प्रश्न बने रहते हैं, उदाहरण के लिए शीर्षकों पर भरोसा करने के बजाय दस्तावेज़ लेआउट विश्लेषण या सीखे गए विभाजन का उपयोग करना। इसे पुनर्रैंकर्स और प्रासंगिक-एम्बेडिंग दृष्टिकोणों के साथ तेजी से जोड़ा जा रहा है जो अनुक्रमण के समय छोटे टुकड़ों को उनके परिवेश के बारे में जागरूकता देने का प्रयास करते हैं। सामान्य बेंचमार्क के बजाय अपने स्वयं के दस्तावेज़ों पर परीक्षण करना, बच्चे और माता-पिता के आकार को चुनने का विश्वसनीय तरीका है।
एक आंतरिक आईटी सहायता बॉट प्रत्येक समस्या निवारण चरण को एक अलग चाइल्ड चंक के रूप में अनुक्रमित करता है, लेकिन जब एक चरण मेल खाता है तो यह पूरी प्रक्रिया लौटाता है, इसलिए मॉडल उपयोगकर्ताओं को चरण 1 से 3 के बिना चरण 4 करने के लिए नहीं कहता है।
एक कानूनी अनुसंधान उपकरण समाप्ति नोटिस अवधि के बारे में एक एकल खंड से मेल खाता है, फिर मॉडल को पूर्ण अनुबंध अनुभाग से गुजरता है, जिसमें परिभाषाएँ और अपवाद शामिल होते हैं जो खंड का अर्थ बदल देते हैं।
एक विश्वविद्यालय पाठ्यक्रम सहायक व्याख्यान नोट्स से वाक्य-स्तरीय खंड खोजता है और आसपास का पृष्ठ लौटाता है, इसलिए किसी सूत्र के बारे में उत्तर में वे शर्तें भी शामिल होती हैं जिनके तहत यह लागू होता है।
एक बीमा दावा सहायक एक पॉलिसी दस्तावेज़ से कई छोटे मिलान प्राप्त करता है, उन्हें माता-पिता द्वारा समूहित करता है, और उस पॉलिसी अनुभाग को पांच ओवरलैपिंग टुकड़ों के बजाय एक बार भेजता है।
एक बेंचमार्क को अनुकूलित करने से व्यापक सिस्टम कमजोरियों को छुपाया जा सकता है।
बुनियादी ढांचे और रखरखाव की लागत को अक्सर कम करके आंका जाता है।
जैसे-जैसे सिस्टम अधिक जटिल होते जाएंगे सुरक्षा और अवलोकन संबंधी अंतराल बढ़ सकते हैं।
कार्यान्वयन से पहले विलंबता, गुणवत्ता और लागत लक्ष्य परिभाषित करें।
यथार्थवादी लोड और डेटा स्थितियों के तहत बेंचमार्क।
त्रुटियों, बहाव और उपयोगकर्ता प्रभाव के लिए उपकरण निगरानी।
स्केलिंग से पहले रोलबैक और घटना प्रतिक्रिया पथ तैयार करें।
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
मूल दस्तावेज़ पुनर्प्राप्ति, जिसे छोटी-से-बड़ी पुनर्प्राप्ति भी कहा जाता है, छोटे, सटीक पाठ खंडों पर खोज करता है लेकिन भाषा मॉडल को उस बड़े खंड या दस्तावेज़ को सौंप देता है जिससे प्रत्येक खंड आया है। यह मायने रखता है क्योंकि यह सामान्य खंड-खंड व्यापार-बंद को हटा देता है: छोटे खंड प्रश्नों से सटीक रूप से मेल खाते हैं, और बड़े माता-पिता मॉडल को सही उत्तर देने के लिए पर्याप्त संदर्भ देते हैं।
छोटे हिस्से केंद्रित एम्बेडिंग देते हैं लेकिन बहुत कम संदर्भ देते हैं; बड़े हिस्से संदर्भ देते हैं लेकिन धुंधली एम्बेडिंग। छोटा-से-बड़ा, छोटा खोजता है और दोनों पाने के लिए बड़ा लौटाता है।
सटीक मिलान के लिए बच्चों को अनुक्रमित किया जाता है; बच्चे के मैच होने के बाद ही माता-पिता की ओर ध्यान दिया जाता है।
माता-पिता द्वारा समूहीकरण का मतलब है कि अनुभाग को एक बार शामिल किया गया है, जो टोकन बचाता है और डुप्लिकेट टुकड़े हटा देता है।
बच्चों को खोज के लिए एक वेक्टर स्टोर में एम्बेड किया जाता है, जबकि पूर्ण माता-पिता एक दस्तावेज़ स्टोर में बैठते हैं और आईडी द्वारा प्राप्त किए जाते हैं।
वाक्य-विंडो पुनर्प्राप्ति वाक्य स्तर पर मेल खाती है और फिर संदर्भ प्रदान करने के लिए आसपास के वाक्यों की विंडो तक विस्तारित होती है।
सीखते रहो
इस विषय के लिए अधिक मार्गदर्शिकाएँ चुनी गईं
आगेअगली गाइड
सट्टा आरएजी और पुनर्प्राप्ति-संवर्धित प्रारूपण
तकनीकी