Nyelvi AI ÚTMUTATÓ

BM25 és Lexical Retrieval

A BM25 a klasszikus kulcsszó-alapú rangsoroló funkció, amely a lekérdezési kifejezések megjelenési gyakorisága alapján pontozza a dokumentumokat, a kifejezések ritkaságához és a dokumentum hosszához igazítva.

2 perc olvasásUtoljára frissítve

Áttekintés

Decades old, it remains a remarkably strong and ubiquitous baseline for search.

Mély merülés

A BM25 (Best Matching 25) egy szavakból álló rangsoroló függvény az 1990-es évek valószínűségi Okapi keretrendszeréből. Minden lekérdezési kifejezéshez három jelet kombinál: kifejezés gyakorisága (milyen gyakran jelenik meg a szó egy dokumentumban, a k1 paraméter által szabályozott csökkenő hozamokkal), inverz dokumentumgyakoriság (a gyűjteményben a ritkább szavak többet számítanak) és a dokumentum hosszának normalizálása (b paraméter, így a hosszú dokumentumok nem részesülnek méltánytalan előnyben). Adja össze ezeket a periódusonkénti pontszámokat, és megkapja a dokumentum rangját. Nem igényel képzést, és rendkívül gyorsan fut fordított indexeken keresztül, ezért az olyan keresőmotorok, mint az Elasticsearch és a Lucene alapértelmezés szerint használják. A neurális visszakeresés térnyerése ellenére a BM25 továbbra is nyer vagy döntetlen sok benchmarkon, különösen a ritka kifejezések, a pontos azonosítók és a domainen kívüli lekérdezések esetében.

Technikai betekintés

A BM25 kifejezés-gyakoriság komponense telítődik: a k1 paraméter korlátozza, hogy az ismétlődő szavak mennyivel növelik a pontszámot, így az 50-szer megjelenő kifejezés nem 50-szer relevánsabb, mint egyszer. A b paraméter keveri a nyers és a hossz-normalizált frekvenciát. Az IDF lecsökkenti az olyan gyakori szavakat, mint a „the”, és megjutalmazza a megkülönböztető szavakat. Mivel fordított indexen működik, amely minden szót leképez a dokumentumlistájára, a pontozás csak a lekérdezési kifejezéseket tartalmazó dokumentumokat érinti, így rendkívül hatékony.

Stratégiai hatás

Sebesség és méretarány

A nyelvi munkafolyamatok gyorsabban haladhatnak a következetesség feláldozása nélkül.

Hozzáférés és elérés

Kibővíti a hozzáférést a nyelvek és a kommunikációs stílusok között.

Tisztább döntések

A csapatok több időt tölthetnek az ítélkezéssel, míg az automatizálás kezeli az ismétlést.

A BM25 és a Lexical Retrieval jövője

A BM25 valószínűleg nem tűnik el; ehelyett egyre inkább a neurális módszerekkel párosul a hibrid visszakeresésben, ahol a lexikális és a sűrű pontszámok egyesülnek (gyakran reciprok rang-fúzió révén). Az olyan tanult ritka modellek, mint a SPLADE, a BM25-stílusú ritkaságot neurális terminussúlyozással vegyítik, és a BM25 gyakran első fokozatú retrieverként szolgál a neurális átrendezők előtt. Gyorsasága, értelmezhetősége és nulla képzési költsége garantálja a tartós szerepvállalást a gyártáskeresésben.

Valós megvalósítás

Alapértelmezett relevanciarangsor az Elasticsearch, az OpenSearch és az Apache Lucene/Solr szolgáltatásokban

Első fokozatú jelöltek lekérése, amely egy lassabb idegi átsorolót táplál a kétlépcsős keresés során

Kód- és naplókeresés, ahol a pontos azonosítóknak és hibakódoknak pontosan meg kell egyeznie

Kemény negatív példák bányászata a sűrű retrieverek, például a DPR képzésére

Kockázatok és védőkorlátok

A hallucinált tények csendben bekerülhetnek a jelentésekbe, a támogatási folyamatokba vagy a kutatási eredményekbe.

Az azonnali érzékenység inkonzisztens eredményeket eredményezhet a hasonló kérések között.

Ha a hozzáférés-szabályozás gyenge, az érzékeny szöveges adatok megjelenhetnek.

Végrehajtási ütemterv

1

A kiadás előtt határozza meg a kimeneti formátumot, hangszínt és minőségi szabványokat.

2

Földelje a válaszokat megbízható forrásokból, amikor a pontosság számít.

3

Tartson emberi ellenőrzési pontot a nagy tétű kimenetekhez.

4

Kövesse nyomon a meghibásodási mintákat, és rendszeresen tanítsa át az utasításokat vagy a munkafolyamatokat.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the BM25 and Lexical Retrieval quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Következő útmutató

ColBERT késői interakciós visszakeresés

Gyakran ismételt kérdések

What is BM25 and Lexical Retrieval?

A BM25 a klasszikus kulcsszó-alapú rangsoroló funkció, amely a lekérdezési kifejezések megjelenési gyakorisága alapján pontozza a dokumentumokat, a kifejezések ritkaságához és a dokumentum hosszához igazítva. Évtizedek óta továbbra is figyelemreméltóan erős és mindenütt jelen lévő kiindulási pont a kereséshez.

Mit használ a BM25 elsősorban a dokumentumok rangsorolására?

A BM25 egyesíti a kifejezések gyakoriságát, az inverz dokumentumgyakoriságot (termritkaság) és a dokumentumhosszúság normalizálását egy relevancia pontszámba.

Milyen szerepet játszik az inverz dokumentumfrekvencia (IDF) a BM25-ben?

Az IDF jutalmazza azokat a kifejezéseket, amelyek ritkák a gyűjteményben, és csökkenti a gyakori szavak súlyát, mivel a ritka egyezések informatívabbak.

Miért alkalmazza a BM25 dokumentumhossz-normálást (a b paramétert)?

Normalizálás nélkül a hosszabb dokumentumok több kifejezésegyezést halmoznának fel; a b paraméter a hosszhoz igazodik, így az összehasonlítások igazságosak.

Milyen adatstruktúra teszi gyorssá a BM25-öt?

Az invertált index lehetővé teszi, hogy a BM25 csak a lekérdezési kifejezéseket tartalmazó dokumentumokat pontozza, így a visszakeresés nagyon hatékony.