तकनीकी गाइड

मूल दस्तावेज़ और छोटे से बड़े पुनर्प्राप्ति

मूल दस्तावेज़ पुनर्प्राप्ति, जिसे छोटी-से-बड़ी पुनर्प्राप्ति भी कहा जाता है, छोटे, सटीक पाठ खंडों पर खोज करता है लेकिन भाषा मॉडल को उस बड़े खंड या दस्तावेज़ को सौंप देता है जिससे प्रत्येक खंड आया है।

  • 4 मिनट पढ़ें
  • अंतिम बार अद्यतन किया गया
इस पृष्ठ पर4 मिनट पढ़ें
  1. सिंहावलोकन
  2. गहरा गोता
  3. सामरिक प्रभाव
  4. मूल दस्तावेज़ और छोटे से बड़े पुनर्प्राप्ति का भविष्य
  5. वास्तविक विश्व कार्यान्वयन
  6. जोखिम और रेलिंग
  7. कार्यान्वयन रोडमैप
  8. अन्वेषण करते रहें
  9. अक्सर पूछे जाने वाले प्रश्नों

सिंहावलोकन

यह मायने रखता है क्योंकि यह सामान्य खंड-खंड व्यापार-बंद को हटा देता है: छोटे खंड प्रश्नों से सटीक रूप से मेल खाते हैं, और बड़े माता-पिता मॉडल को सही उत्तर देने के लिए पर्याप्त संदर्भ देते हैं।

गहरा गोता

निश्चित आकार का टुकड़ा व्यापार बंद करने के लिए बाध्य करता है। छोटे-छोटे टुकड़े, जैसे कुछ वाक्य, तीक्ष्ण एम्बेडिंग उत्पन्न करते हैं: वेक्टर एक विचार का प्रतिनिधित्व करता है, इसलिए उस विचार के बारे में एक प्रश्न उससे निकटता से मेल खाता है। लेकिन मॉडल के अच्छे उत्तर देने के लिए दो-वाक्य वाले खंड में शायद ही कभी पर्याप्त संदर्भ होता है; यह परिभाषा को तीन पैराग्राफ पहले या अगले वाक्य में अपवाद को छोड़ सकता है। बड़े खंड उस संदर्भ को ले जाते हैं, लेकिन उनकी एम्बेडिंग कई विचारों को एक साथ धुंधला कर देती है, इसलिए पुनर्प्राप्ति कम सटीक हो जाती है और प्रासंगिक मार्ग को उस खंड द्वारा रेखांकित किया जा सकता है जो केवल विषय पर है। छोटी से बड़ी पुनर्प्राप्ति दो नौकरियों को विभाजित करती है। सिस्टम खोज के लिए छोटे बच्चों के हिस्सों को अनुक्रमित करता है, और प्रत्येक बच्चा बड़े माता-पिता के लिए एक संकेतक रखता है: एक अनुभाग, एक पृष्ठ, या संपूर्ण दस्तावेज़। पूछताछ के समय यह सबसे अच्छे बच्चों को ढूंढता है, फिर उनके माता-पिता को ढूंढता है और लौटा देता है। यदि कई बच्चे एक ही माता-पिता को साझा करते हैं, तो माता-पिता को एक बार भेजा जाता है, जो डुप्लिकेट को भी हटा देता है। LangChain का ParentDocumentRetriever इसे बच्चों के लिए एक वेक्टर स्टोर और माता-पिता के लिए एक अलग दस्तावेज़ स्टोर के साथ लागू करता है। LlamaIndex संबंधित पैटर्न प्रदान करता है: वाक्य-विंडो पुनर्प्राप्ति, जो एक मिलान वाक्य और पड़ोसी वाक्यों की एक निश्चित संख्या लौटाता है, और ऑटो-मर्जिंग पुनर्प्राप्ति, जो कई पुनर्प्राप्त पत्ते के टुकड़ों को उनके साझा मूल नोड के साथ बदल देता है जब उनमें से पर्याप्त मेल खाते हैं। यह दृष्टिकोण मैनुअल, अनुबंध, नीतियों और पाठ्यपुस्तकों जैसे संरचित दस्तावेजों पर निश्चित आकार के खंडन को मात देता है, जहां अर्थ आसपास के अनुभाग पर निर्भर करता है। यह कम मदद करता है जब दस्तावेज़ पहले से ही कम होते हैं, या जब माता-पिता इतने बड़े होते हैं कि उनमें से कुछ संदर्भ विंडो को ओवरफ्लो कर देते हैं या अप्रासंगिक पाठ में उत्तर को दफन कर देते हैं। एक आम ग़लतफ़हमी यह है कि यह केवल बड़े टुकड़ों का उपयोग है। ऐसा नहीं है: पुनर्प्राप्ति इकाई और पीढ़ी इकाई जानबूझकर अलग-अलग आकार की हैं, इसलिए आप संदर्भ के मॉडल को कम किए बिना सटीक मिलान बनाए रखते हैं।

सामरिक प्रभाव

लागत और बजट

वास्तुकला संबंधी निर्णय वर्षों तक प्रदर्शन और परिचालन लागत को संचालित करते हैं।

स्पष्ट निर्णय

तकनीकी शिक्षा टीमों को सही स्टैक चुनने में मदद करती है, न कि केवल नवीनतम स्टैक चुनने में।

गुणवत्ता नियंत्रण

बेहतर इंजीनियरिंग विकल्प उत्पादन में विश्वसनीयता की घटनाओं को कम करते हैं।

मूल दस्तावेज़ और छोटे से बड़े पुनर्प्राप्ति का भविष्य

छोटा-से-बड़ा एक चाल के बजाय एक डिफ़ॉल्ट बनता जा रहा है, और प्रमुख ढांचे पहले से ही कॉन्फ़िगरेशन विकल्पों के रूप में पदानुक्रमित या विंडो पुनर्प्राप्ति को उजागर करते हैं। बड़ी संदर्भ विंडो बड़े माता-पिता को भेजने के दंड को कम करती है, जिससे पैटर्न को अपनाना सस्ता हो जाता है। मूल सीमाओं को स्वचालित रूप से चुनने के बारे में खुले प्रश्न बने रहते हैं, उदाहरण के लिए शीर्षकों पर भरोसा करने के बजाय दस्तावेज़ लेआउट विश्लेषण या सीखे गए विभाजन का उपयोग करना। इसे पुनर्रैंकर्स और प्रासंगिक-एम्बेडिंग दृष्टिकोणों के साथ तेजी से जोड़ा जा रहा है जो अनुक्रमण के समय छोटे टुकड़ों को उनके परिवेश के बारे में जागरूकता देने का प्रयास करते हैं। सामान्य बेंचमार्क के बजाय अपने स्वयं के दस्तावेज़ों पर परीक्षण करना, बच्चे और माता-पिता के आकार को चुनने का विश्वसनीय तरीका है।

वास्तविक विश्व कार्यान्वयन

एक आंतरिक आईटी सहायता बॉट प्रत्येक समस्या निवारण चरण को एक अलग चाइल्ड चंक के रूप में अनुक्रमित करता है, लेकिन जब एक चरण मेल खाता है तो यह पूरी प्रक्रिया लौटाता है, इसलिए मॉडल उपयोगकर्ताओं को चरण 1 से 3 के बिना चरण 4 करने के लिए नहीं कहता है।

एक कानूनी अनुसंधान उपकरण समाप्ति नोटिस अवधि के बारे में एक एकल खंड से मेल खाता है, फिर मॉडल को पूर्ण अनुबंध अनुभाग से गुजरता है, जिसमें परिभाषाएँ और अपवाद शामिल होते हैं जो खंड का अर्थ बदल देते हैं।

एक विश्वविद्यालय पाठ्यक्रम सहायक व्याख्यान नोट्स से वाक्य-स्तरीय खंड खोजता है और आसपास का पृष्ठ लौटाता है, इसलिए किसी सूत्र के बारे में उत्तर में वे शर्तें भी शामिल होती हैं जिनके तहत यह लागू होता है।

एक बीमा दावा सहायक एक पॉलिसी दस्तावेज़ से कई छोटे मिलान प्राप्त करता है, उन्हें माता-पिता द्वारा समूहित करता है, और उस पॉलिसी अनुभाग को पांच ओवरलैपिंग टुकड़ों के बजाय एक बार भेजता है।

जोखिम और रेलिंग

  • एक बेंचमार्क को अनुकूलित करने से व्यापक सिस्टम कमजोरियों को छुपाया जा सकता है।

  • बुनियादी ढांचे और रखरखाव की लागत को अक्सर कम करके आंका जाता है।

  • जैसे-जैसे सिस्टम अधिक जटिल होते जाएंगे सुरक्षा और अवलोकन संबंधी अंतराल बढ़ सकते हैं।

कार्यान्वयन रोडमैप

  1. कार्यान्वयन से पहले विलंबता, गुणवत्ता और लागत लक्ष्य परिभाषित करें।

  2. यथार्थवादी लोड और डेटा स्थितियों के तहत बेंचमार्क।

  3. त्रुटियों, बहाव और उपयोगकर्ता प्रभाव के लिए उपकरण निगरानी।

  4. स्केलिंग से पहले रोलबैक और घटना प्रतिक्रिया पथ तैयार करें।

अन्वेषण करते रहें

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Parent Document and Small-to-Big Retrieval quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

प्रश्नोत्तरी प्रारंभ करें

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

अक्सर पूछे जाने वाले प्रश्नों

मूल दस्तावेज़ और छोटी-से-बड़ी पुनर्प्राप्ति क्या है?

मूल दस्तावेज़ पुनर्प्राप्ति, जिसे छोटी-से-बड़ी पुनर्प्राप्ति भी कहा जाता है, छोटे, सटीक पाठ खंडों पर खोज करता है लेकिन भाषा मॉडल को उस बड़े खंड या दस्तावेज़ को सौंप देता है जिससे प्रत्येक खंड आया है। यह मायने रखता है क्योंकि यह सामान्य खंड-खंड व्यापार-बंद को हटा देता है: छोटे खंड प्रश्नों से सटीक रूप से मेल खाते हैं, और बड़े माता-पिता मॉडल को सही उत्तर देने के लिए पर्याप्त संदर्भ देते हैं।

छोटी-से-बड़ी पुनर्प्राप्ति किस मुख्य व्यापार-बंद को संबोधित करती है?

छोटे हिस्से केंद्रित एम्बेडिंग देते हैं लेकिन बहुत कम संदर्भ देते हैं; बड़े हिस्से संदर्भ देते हैं लेकिन धुंधली एम्बेडिंग। छोटा-से-बड़ा, छोटा खोजता है और दोनों पाने के लिए बड़ा लौटाता है।

छोटे से बड़े सिस्टम में, क्वेरी के समय क्या एम्बेड किया जाता है और खोजा जाता है?

सटीक मिलान के लिए बच्चों को अनुक्रमित किया जाता है; बच्चे के मैच होने के बाद ही माता-पिता की ओर ध्यान दिया जाता है।

यदि तीन पुनर्प्राप्त चाइल्ड खंड सभी एक ही मूल अनुभाग से संबंधित हैं, तो सिस्टम को क्या करना चाहिए?

माता-पिता द्वारा समूहीकरण का मतलब है कि अनुभाग को एक बार शामिल किया गया है, जो टोकन बचाता है और डुप्लिकेट टुकड़े हटा देता है।

LangChain का ParentDocumentRetriever टेक्स्ट के दो स्तरों को कैसे संग्रहीत करता है?

बच्चों को खोज के लिए एक वेक्टर स्टोर में एम्बेड किया जाता है, जबकि पूर्ण माता-पिता एक दस्तावेज़ स्टोर में बैठते हैं और आईडी द्वारा प्राप्त किए जाते हैं।

वाक्य-विंडो पुनर्प्राप्ति क्या लौटाती है?

वाक्य-विंडो पुनर्प्राप्ति वाक्य स्तर पर मेल खाती है और फिर संदर्भ प्रदान करने के लिए आसपास के वाक्यों की विंडो तक विस्तारित होती है।