भाषा एआई गाइड

BM25 और लेक्सिकल रिट्रीवल

BM25 क्लासिक कीवर्ड-आधारित रैंकिंग फ़ंक्शन है जो दस्तावेज़ों को क्वेरी शब्द कितनी बार दिखाई देता है, शब्द दुर्लभता और दस्तावेज़ की लंबाई के लिए समायोजित करके स्कोर करता है।

2 मिनट लालअंतिम बार अद्यतन किया गया

सिंहावलोकन

Decades old, it remains a remarkably strong and ubiquitous baseline for search.

गहरा गोता

बीएम25 (बेस्ट मैचिंग 25) 1990 के दशक के संभाव्य ओकापी ढांचे से एक बैग-ऑफ-वर्ड्स रैंकिंग फ़ंक्शन है। प्रत्येक क्वेरी शब्द के लिए यह तीन संकेतों को जोड़ता है: शब्द आवृत्ति (दस्तावेज़ में शब्द कितनी बार दिखाई देता है, पैरामीटर k1 द्वारा नियंत्रित घटते रिटर्न के साथ), उलटा दस्तावेज़ आवृत्ति (संग्रह में दुर्लभ शब्द अधिक गिने जाते हैं), और दस्तावेज़-लंबाई सामान्यीकरण (पैरामीटर बी, इतने लंबे दस्तावेज़ों को गलत तरीके से पसंद नहीं किया जाता है)। इन प्रति-अवधि अंकों का योग करें और आपको दस्तावेज़ की रैंक मिल जाएगी। इसे किसी प्रशिक्षण की आवश्यकता नहीं है और यह उल्टे अनुक्रमितों के माध्यम से बहुत तेजी से चलता है, यही कारण है कि एलेस्टिक्स खोज और ल्यूसीन जैसे खोज इंजन डिफ़ॉल्ट रूप से इसका उपयोग करते हैं। तंत्रिका पुनर्प्राप्ति में वृद्धि के बावजूद, BM25 अभी भी कई बेंचमार्क पर जीतता है या बराबरी पर है, विशेष रूप से दुर्लभ शब्दों, सटीक पहचानकर्ताओं और आउट-ऑफ-डोमेन प्रश्नों के लिए।

तकनीकी अंतर्दृष्टि

BM25 का टर्म-फ़्रीक्वेंसी घटक संतृप्त होता है: k1 पैरामीटर कैप करता है कि बार-बार दोहराए गए शब्द स्कोर को कितना बढ़ाते हैं, इसलिए 50 बार प्रदर्शित होने वाला शब्द एक बार से 50 गुना अधिक प्रासंगिक नहीं होता है। बी पैरामीटर कच्ची और लंबाई-सामान्यीकृत आवृत्ति को मिश्रित करता है। आईडीएफ 'द' जैसे सामान्य शब्दों को कम करता है और विशिष्ट शब्दों को पुरस्कृत करता है। क्योंकि यह एक उल्टे सूचकांक पर काम करता है जो प्रत्येक शब्द को उसकी दस्तावेज़ सूची में मैप करता है, स्कोरिंग केवल क्वेरी शब्दों वाले दस्तावेज़ों को छूता है, जिससे यह बेहद कुशल हो जाता है।

सामरिक प्रभाव

गति और पैमाना

भाषा वर्कफ़्लो निरंतरता से समझौता किए बिना तेज़ी से आगे बढ़ सकता है।

पहुंच और पहुंच

यह सभी भाषाओं और संचार शैलियों तक पहुंच का विस्तार करता है।

स्पष्ट निर्णय

टीमें निर्णय लेने में अधिक समय व्यतीत कर सकती हैं जबकि स्वचालन पुनरावृत्ति को संभालता है।

बीएम25 और लेक्सिकल रिट्रीवल का भविष्य

BM25 के गायब होने की संभावना नहीं है; इसके बजाय इसे हाइब्रिड पुनर्प्राप्ति में तंत्रिका तरीकों के साथ तेजी से जोड़ा जा रहा है, जहां शाब्दिक और सघन स्कोर जुड़े हुए हैं (अक्सर पारस्परिक रैंक संलयन के माध्यम से)। SPLADE जैसे सीखे हुए विरल मॉडल BM25-शैली विरलता को न्यूरल टर्म वेटिंग के साथ मिश्रित करते हैं, और BM25 अक्सर न्यूरल रीरैंकर्स से पहले पहले चरण के रिट्रीवर के रूप में कार्य करता है। इसकी गति, व्याख्याशीलता और शून्य प्रशिक्षण लागत उत्पादन खोज में एक स्थायी भूमिका की गारंटी देती है।

वास्तविक विश्व कार्यान्वयन

Elasticsearch, OpenSearch, और Apache Lucene/Solr में डिफ़ॉल्ट प्रासंगिकता रैंकिंग

प्रथम-चरण उम्मीदवार पुनर्प्राप्ति जो दो-चरणीय खोज में धीमी तंत्रिका पुनर्रैंकर को फ़ीड करती है

कोड और लॉग खोज जहां सटीक पहचानकर्ता और त्रुटि कोड सटीक रूप से मेल खाने चाहिए

डीपीआर जैसे घने पुनर्प्राप्तिकर्ताओं को प्रशिक्षित करने के लिए कठिन नकारात्मक उदाहरणों का खनन

जोखिम और रेलिंग

मतिभ्रम वाले तथ्य चुपचाप रिपोर्ट में प्रवेश कर सकते हैं, प्रवाह का समर्थन कर सकते हैं, या अनुसंधान आउटपुट का समर्थन कर सकते हैं।

त्वरित संवेदनशीलता समान अनुरोधों में असंगत परिणाम पैदा कर सकती है।

यदि पहुंच नियंत्रण कमजोर हैं तो संवेदनशील पाठ डेटा उजागर हो सकता है।

कार्यान्वयन रोडमैप

1

रोलआउट से पहले आउटपुट स्वरूप, टोन और गुणवत्ता मानकों को परिभाषित करें।

2

जब भी सटीकता मायने रखती है तो विश्वसनीय स्रोतों के साथ जमीनी प्रतिक्रियाएँ।

3

उच्च जोखिम वाले आउटपुट के लिए एक मानव समीक्षा चेकपॉइंट रखें।

4

विफलता पैटर्न को ट्रैक करें और संकेतों या वर्कफ़्लो को नियमित रूप से पुनः प्रशिक्षित करें।

अन्वेषण करते रहें

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the BM25 and Lexical Retrieval quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

प्रश्नोत्तरी प्रारंभ करें

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

अगली गाइड

कोलबर्ट लेट इंटरेक्शन पुनर्प्राप्ति

अक्सर पूछे जाने वाले प्रश्नों

What is BM25 and Lexical Retrieval?

BM25 क्लासिक कीवर्ड-आधारित रैंकिंग फ़ंक्शन है जो दस्तावेज़ों को क्वेरी शब्द कितनी बार दिखाई देता है, शब्द दुर्लभता और दस्तावेज़ की लंबाई के लिए समायोजित करके स्कोर करता है। दशकों पुराना, यह खोज के लिए उल्लेखनीय रूप से मजबूत और सर्वव्यापी आधार रेखा बनी हुई है।

दस्तावेज़ों को रैंक करने के लिए BM25 मुख्य रूप से क्या उपयोग करता है?

BM25 प्रासंगिकता स्कोर में टर्म फ़्रीक्वेंसी, व्युत्क्रम दस्तावेज़ फ़्रीक्वेंसी (टर्म दुर्लभता), और दस्तावेज़-लंबाई सामान्यीकरण को जोड़ती है।

बीएम25 में व्युत्क्रम दस्तावेज़ आवृत्ति (आईडीएफ) क्या भूमिका निभाती है?

आईडीएफ उन शब्दों को पुरस्कृत करता है जो संग्रह में दुर्लभ हैं और सामान्य शब्दों को कम करता है, क्योंकि दुर्लभ मिलान अधिक जानकारीपूर्ण होते हैं।

बीएम25 दस्तावेज़-लंबाई सामान्यीकरण (बी पैरामीटर) क्यों लागू करता है?

सामान्यीकरण के बिना, लंबे दस्तावेज़ अधिक अवधि मिलान जमा करेंगे; बी पैरामीटर लंबाई के लिए समायोजित होता है इसलिए तुलना उचित है।

कौन सी डेटा संरचना BM25 को बड़े पैमाने पर तेज़ बनाती है?

एक उलटा सूचकांक BM25 को केवल उन दस्तावेज़ों को स्कोर करने देता है जिनमें क्वेरी शब्द होते हैं, जिससे पुनर्प्राप्ति बहुत कुशल हो जाती है।