भाषा एआई गाइड

सघन मार्ग पुनर्प्राप्ति

डेंस पैसेज रिट्रीवल (डीपीआर) किसी प्रश्न और अनुच्छेद के अर्थ की तुलना संख्यात्मक वैक्टर के रूप में करके प्रासंगिक पाठ ढूंढता है, शब्दों से मेल नहीं खाता।

2 मिनट लालअंतिम बार अद्यतन किया गया

सिंहावलोकन

It matters because it can retrieve correct answers even when the query and the document share zero vocabulary.

गहरा गोता

फेसबुक एआई द्वारा 2020 में पेश किया गया डीपीआर, दो अलग-अलग बीईआरटी एनकोडर का उपयोग करता है: एक प्रश्न एनकोडर और एक पैसेज एनकोडर। प्रत्येक टेक्स्ट को एक निश्चित-लंबाई वाले सघन वेक्टर (अक्सर 768 आयाम) में बदल देता है। प्रासंगिकता एक प्रश्न वेक्टर और एक पैसेज वेक्टर के बीच का डॉट उत्पाद है, इसलिए पुनर्प्राप्ति पूर्व-गणना किए गए पैसेज एम्बेडिंग पर एक तेज़ निकटतम-पड़ोसी खोज बन जाती है। मॉडल को एक विरोधाभासी उद्देश्य के साथ प्रशिक्षित किया गया है: बीएम25 से निकाले गए इन-बैच नकारात्मक और हार्ड नकारात्मक का उपयोग करके, सही मार्ग के वेक्टर को प्रश्न के करीब खींचें और गलत को दूर धकेल दें। प्राकृतिक प्रश्नों जैसे ओपन-डोमेन क्यूए बेंचमार्क पर, डीपीआर ने लंबे समय से प्रभावी बीएम25 को बड़े अंतर से हराया, यह दर्शाता है कि सीखा हुआ सिमेंटिक मिलान सवालों के जवाब देने के लिए कीवर्ड खोज से बेहतर प्रदर्शन कर सकता है।

तकनीकी अंतर्दृष्टि

डीपीआर एक द्वि-एनकोडर है: यह क्वेरी और प्रत्येक मार्ग को स्वतंत्र रूप से एन्कोड करता है, इसलिए सभी मार्ग वैक्टर की एक बार गणना की जाती है और एक वेक्टर इंडेक्स (उदाहरण के लिए, FAISS) में संग्रहीत किया जाता है। क्वेरी के समय आप केवल प्रश्न को एन्कोड करते हैं, फिर अनुमानित निकटतम-पड़ोसी खोज चलाते हैं। प्रशिक्षण इन-बैच नकारात्मकताओं पर निर्भर करता है - उसी मिनी-बैच में अन्य मार्ग नकारात्मक उदाहरणों के रूप में लगभग मुफ्त में काम करते हैं, जो एक सकारात्मक जोड़ी को कुशलतापूर्वक कई विपरीत तुलनाएँ उत्पन्न करने देता है।

सामरिक प्रभाव

गति और पैमाना

भाषा वर्कफ़्लो निरंतरता से समझौता किए बिना तेज़ी से आगे बढ़ सकता है।

पहुंच और पहुंच

यह सभी भाषाओं और संचार शैलियों तक पहुंच का विस्तार करता है।

स्पष्ट निर्णय

टीमें निर्णय लेने में अधिक समय व्यतीत कर सकती हैं जबकि स्वचालन पुनरावृत्ति को संभालता है।

सघन मार्ग पुनर्प्राप्ति का भविष्य

सघन पुनर्प्राप्ति अब बड़े भाषा मॉडलों को पोषित करने वाली अधिकांश पुनर्प्राप्ति-संवर्धित पीढ़ी पाइपलाइनों को रेखांकित करती है। अनुसंधान हाइब्रिड सिस्टम की ओर बढ़ रहा है जो घने और शाब्दिक स्कोर को जोड़ता है, कोलबर्ट जैसे लेट-इंटरैक्शन मॉडल जो बेहतर मिलान के लिए प्रति-टोकन वैक्टर रखते हैं, और निर्देश-ट्यून किए गए एम्बेडिंग जो कई कार्यों के लिए अनुकूल होते हैं। सस्ते, बहुभाषी और लंबे-संदर्भ वाले एन्कोडर्स की अपेक्षा करें, साथ ही जनरेटर के साथ रिट्रीवर्स के सख्त सह-प्रशिक्षण की भी अपेक्षा करें।

वास्तविक विश्व कार्यान्वयन

ओपन-डोमेन प्रश्न उत्तर प्रणालियाँ जो एलएलएम द्वारा उत्तर लिखने से पहले विकिपीडिया के सहायक अंशों को खींच लेती हैं

एंटरप्राइज़ दस्तावेज़ खोज जहां कर्मचारी स्वाभाविक प्रश्न पूछते हैं और सटीक कीवर्ड के बिना भी प्रासंगिक पैराग्राफ प्राप्त करते हैं

ग्राहक-सहायता बॉट एक संक्षिप्त शिकायत से सही सहायता-केंद्र आलेख पुनर्प्राप्त कर रहे हैं

मतिभ्रम को कम करने के लिए पुनर्प्राप्ति-संवर्धित चैटबॉट एक निजी ज्ञान आधार में प्रतिक्रियाओं को आधार बनाते हैं

जोखिम और रेलिंग

मतिभ्रम वाले तथ्य चुपचाप रिपोर्ट में प्रवेश कर सकते हैं, प्रवाह का समर्थन कर सकते हैं, या अनुसंधान आउटपुट का समर्थन कर सकते हैं।

त्वरित संवेदनशीलता समान अनुरोधों में असंगत परिणाम पैदा कर सकती है।

यदि पहुंच नियंत्रण कमजोर हैं तो संवेदनशील पाठ डेटा उजागर हो सकता है।

कार्यान्वयन रोडमैप

1

रोलआउट से पहले आउटपुट स्वरूप, टोन और गुणवत्ता मानकों को परिभाषित करें।

2

जब भी सटीकता मायने रखती है तो विश्वसनीय स्रोतों के साथ जमीनी प्रतिक्रियाएँ।

3

उच्च जोखिम वाले आउटपुट के लिए एक मानव समीक्षा चेकपॉइंट रखें।

4

विफलता पैटर्न को ट्रैक करें और संकेतों या वर्कफ़्लो को नियमित रूप से पुनः प्रशिक्षित करें।

अन्वेषण करते रहें

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Dense Passage Retrieval quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

प्रश्नोत्तरी प्रारंभ करें

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

अगली गाइड

कोलबर्ट लेट इंटरेक्शन पुनर्प्राप्ति

अक्सर पूछे जाने वाले प्रश्नों

What is Dense Passage Retrieval?

डेंस पैसेज रिट्रीवल (डीपीआर) किसी प्रश्न और अनुच्छेद के अर्थ की तुलना संख्यात्मक वैक्टर के रूप में करके प्रासंगिक पाठ ढूंढता है, शब्दों से मेल नहीं खाता। यह मायने रखता है क्योंकि यह तब भी सही उत्तर प्राप्त कर सकता है जब क्वेरी और दस्तावेज़ में शून्य शब्दावली हो।

डेंस पैसेज रिट्रीवल के पीछे मूल विचार क्या है?

डीपीआर प्रश्नों और अनुच्छेदों दोनों को घने वैक्टर में मैप करता है और उनकी समानता (डॉट उत्पाद) द्वारा प्रासंगिकता को मापता है, शब्द ओवरलैप के बजाय अर्थ को कैप्चर करता है।

डीपीआर 'द्वि-एनकोडर' वास्तुकला का उपयोग करता है। इसका क्या मतलब है?

एक द्वि-एनकोडर में प्रश्नों और अनुच्छेदों के लिए स्वतंत्र एनकोडर होते हैं, इसलिए अनुच्छेद वैक्टर को समय से पहले पूर्व-गणना और अनुक्रमित किया जा सकता है।

डीपीआर में पैसेज वैक्टर की गणना पहले से क्यों की जा सकती है?

चूंकि पैसेज एनकोडर क्वेरी पर निर्भर नहीं होता है, इसलिए सभी पैसेज एम्बेडिंग को पूर्व-गणना और संग्रहीत किया जा सकता है, जिससे खोज समय पर केवल क्वेरी को एनकोड करने के लिए छोड़ दिया जाता है।

कौन सी प्रशिक्षण युक्ति डीपीआर को सस्ते में कई नकारात्मक उदाहरण उत्पन्न करने देती है?

इन-बैच नकारात्मक, किसी दिए गए प्रश्न के लिए मिनी-बैच में अन्य अंशों को नकारात्मक मानते हैं, जिससे कई विपरीत जोड़े कुशलतापूर्वक तैयार होते हैं।

डीपीआर की निकटतम-पड़ोसी खोज को तेजी से बड़े पैमाने पर बनाने के लिए आमतौर पर किस उपकरण का उपयोग किया जाता है?

FAISS जैसे वेक्टर इंडेक्स लाखों प्रीकंप्यूटेड पैसेज एम्बेडिंग पर तेजी से निकटतम-पड़ोसी खोज करते हैं।