GHID AI limbaj

BM25 și Recuperare lexicală

BM25 este funcția clasică de clasare bazată pe cuvinte cheie care punctează documentele în funcție de frecvența cu care apar termenii de interogare, ajustați pentru raritatea termenilor și lungimea documentului.

2 minute de lecturăUltima actualizare

Prezentare generală

Decades old, it remains a remarkably strong and ubiquitous baseline for search.

Scufundare în profunzime

BM25 (Cea mai bună potrivire 25) este o funcție de clasificare a unui pachet de cuvinte din cadrul probabilistic Okapi din anii 1990. Pentru fiecare termen de interogare, acesta combină trei semnale: frecvența termenului (cât de des apare cuvântul într-un document, cu randamente descrescătoare controlate de un parametru k1), frecvența inversă a documentului (cuvintele mai rare din colecție contează mai mult) și normalizarea lungimii documentului (parametrul b, astfel încât documentele lungi să nu fie favorizate în mod nedrept). Însumați aceste scoruri pe termen și obțineți rangul documentului. Nu are nevoie de antrenament și rulează extraordinar de rapid prin intermediul indecșilor inversați, motiv pentru care motoarele de căutare precum Elasticsearch și Lucene îl folosesc implicit. În ciuda creșterii recuperării neuronale, BM25 încă câștigă sau se leagă în multe puncte de referință, în special pentru termeni rari, identificatori exacti și interogări în afara domeniului.

Perspectivă tehnică

Componenta termen-frecvență a BM25 se saturează: parametrul k1 limitează cât de mult cuvintele repetate sporesc un scor, astfel încât un termen care apare de 50 de ori nu este de 50 de ori mai relevant decât o dată. Parametrul b îmbină frecvența brută și frecvența normalizată pe lungime. IDF reduce în jos cuvintele comune precum „the” și le recompensează pe cele distinctive. Deoarece funcționează pe un index inversat care mapează fiecare cuvânt cu lista de documente, scorul atinge doar documentele care conțin termeni de interogare, ceea ce îl face extrem de eficient.

Impact strategic

Viteză și scară

Fluxurile de lucru lingvistice se pot deplasa mai rapid fără a sacrifica consistența.

Acces și acoperire

Extinde accesul în diferite limbi și stiluri de comunicare.

Decizii mai clare

Echipele pot petrece mai mult timp jucând în timp ce automatizarea se ocupă de repetiție.

Viitorul BM25 și regăsirea lexicală

Este puțin probabil ca BM25 să dispară; în schimb, este din ce în ce mai asociat cu metode neuronale în regăsirea hibridă, unde scorurile lexicale și dense sunt fuzionate (adesea prin fuziunea de rang reciproc). Modelele rare învățate, cum ar fi SPLADE, îmbină scăderea în stilul BM25 cu ponderarea termenilor neuronali, iar BM25 servește frecvent ca retriever de primă etapă înaintea rerankersului neuronal. Viteza, interpretabilitatea și costul de instruire zero garantează un rol de durată în căutarea producției.

Implementare în lumea reală

Clasamentul implicit al relevanței în Elasticsearch, OpenSearch și Apache Lucene/Solr

Primul stadiu de regăsire a candidatului care alimentează un reranker neuronal mai lent în căutarea în două etape

Căutare de coduri și jurnal, unde identificatorii exacti și codurile de eroare trebuie să se potrivească exact

Exploatarea exemplelor negative dure pentru a antrena retrieveri densi precum DPR

Riscuri și balustrade

Faptele halucinate pot intra în liniște în rapoarte, fluxuri de sprijin sau rezultate ale cercetării.

Sensibilitatea promptă poate crea rezultate inconsecvente pentru solicitări similare.

Datele text sensibile pot fi expuse dacă controalele de acces sunt slabe.

Foaia de parcurs de implementare

1

Definiți formatul de ieșire, tonul și standardele de calitate înainte de lansare.

2

Răspunsurile la sol cu ​​surse de încredere ori de câte ori acuratețea contează.

3

Păstrați un punct de control uman pentru rezultate cu mize mari.

4

Urmăriți tiparele de eșec și reantrenați în mod regulat solicitările sau fluxurile de lucru.

Continuați să explorați

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the BM25 and Lexical Retrieval quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Quiz Start

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Următorul ghid

ColBERT Recuperare tardivă a interacțiunii

Întrebări frecvente

What is BM25 and Lexical Retrieval?

BM25 este funcția clasică de clasare bazată pe cuvinte cheie care punctează documentele în funcție de frecvența cu care apar termenii de interogare, ajustați pentru raritatea termenilor și lungimea documentului. Vechi de decenii, rămâne o bază remarcabil de puternică și omniprezentă pentru căutare.

Ce folosește BM25 în principal pentru a clasifica documentele?

BM25 combină frecvența termenilor, frecvența inversă a documentului (raritatea termenului) și normalizarea lungimii documentului într-un scor de relevanță.

Ce rol joacă frecvența inversă a documentelor (IDF) în BM25?

IDF recompensează termenii care sunt rari în colecție și reduce cuvintele obișnuite, deoarece potrivirile rare sunt mai informative.

De ce aplică BM25 normalizarea lungimii documentului (parametrul b)?

Fără normalizare, documentele mai lungi ar acumula mai multe potriviri pe termen; parametrul b se ajustează pentru lungime, astfel încât comparațiile sunt corecte.

Ce structură de date face ca BM25 să fie rapid la scară?

Un index inversat permite BM25 să înscrie doar documentele care conțin termeni de interogare, făcând recuperarea foarte eficientă.