Språk AI GUIDE

BM25 og Lexical Retrieval

BM25 er den klassiske søkeordbaserte rangeringsfunksjonen som skårer dokumenter etter hvor ofte søketermer vises, justert for term sjeldenhet og dokumentlengde.

2 min lesingSist oppdatert

Oversikt

Decades old, it remains a remarkably strong and ubiquitous baseline for search.

Dypdykk

BM25 (Best Matching 25) er en bag-of-word-rangeringsfunksjon fra det sannsynlige Okapi-rammeverket på 1990-tallet. For hvert søketerm kombinerer det tre signaler: termfrekvens (hvor ofte ordet vises i et dokument, med avtagende avkastning kontrollert av en parameter k1), invers dokumentfrekvens (sjeldnere ord på tvers av samlingen teller mer), og dokumentlengdenormalisering (parameter b, slik at lange dokumenter ikke favoriseres urettferdig). Legg sammen disse poengsummene per termin, og du får dokumentets rangering. Den trenger ingen trening og kjører lynraskt via inverterte indekser, og derfor bruker søkemotorer som Elasticsearch og Lucene den som standard. Til tross for økningen av nevrale gjenfinning, vinner BM25 fortsatt eller knytter seg til mange benchmarks, spesielt for sjeldne termer, eksakte identifikatorer og forespørsler utenfor domenet.

Teknisk innsikt

BM25s term-frekvens-komponent metter: k1-parameteren begrenser hvor mye gjentatte ord øker en poengsum, så en term som vises 50 ganger er ikke 50 ganger mer relevant enn én gang. b-parameteren blander rå og lengdenormalisert frekvens. IDF vekter ned vanlige ord som "den" og belønner særegne ord. Fordi den opererer på en invertert indeks som kartlegger hvert ord til dokumentlisten, berører poengsummen kun dokumenter som inneholder søkeord, noe som gjør det ekstremt effektivt.

Strategisk innvirkning

Speed and scale

Språkarbeidsflyter kan bevege seg raskere uten å ofre konsistens.

Access and reach

Det utvider tilgangen på tvers av språk og kommunikasjonsstiler.

Tydeligere avgjørelser

Lag kan bruke mer tid på dømmekraft mens automatisering håndterer repetisjon.

Fremtiden til BM25 og leksikal henting

BM25 vil neppe forsvinne; i stedet blir det i økende grad sammenkoblet med nevrale metoder i hybrid gjenfinning, der leksikalske og tette skårer er smeltet sammen (ofte via gjensidig rangfusjon). Lærte sparsomme modeller som SPLADE blander sparsitet i BM25-stil med vekting av nevrale termer, og BM25 fungerer ofte som første trinns retriever før nevrale rerankere. Hastigheten, tolkbarheten og ingen treningskostnader garanterer en varig rolle i produksjonssøk.

Real-World Implementering

Standard relevansrangering i Elasticsearch, OpenSearch og Apache Lucene/Solr

Førstetrinns kandidatinnhenting som mater en langsommere nevrale reranker i to-trinns søk

Kode- og loggsøk der eksakte identifikatorer og feilkoder må samsvare nøyaktig

Gruve harde negative eksempler for å trene tette retrievere som DPR

Risikoer og rekkverk

Hallusinerte fakta kan stille inn rapporter, støttestrømmer eller forskningsresultater.

Umiddelbar følsomhet kan skape inkonsistente resultater på tvers av lignende forespørsler.

Sensitive tekstdata kan bli eksponert hvis tilgangskontrollene er svake.

Veikart for implementering

1

Definer utdataformat, tone og kvalitetsstandarder før utrulling.

2

Bakgrunnssvar med pålitelige kilder når nøyaktighet er viktig.

3

Hold et sjekkpunkt for menneskelig vurdering for utganger med høy innsats.

4

Spor feilmønstre og tren opp meldinger eller arbeidsflyter regelmessig.

Fortsett å utforske

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the BM25 and Lexical Retrieval quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Neste guide

ColBERT Late Interaction Retrieval

Ofte stilte spørsmål

What is BM25 and Lexical Retrieval?

BM25 er den klassiske søkeordbaserte rangeringsfunksjonen som skårer dokumenter etter hvor ofte søketermer vises, justert for term sjeldenhet og dokumentlengde. Flere tiår gammel er den fortsatt en bemerkelsesverdig sterk og allestedsnærværende baseline for søk.

Hva bruker BM25 primært for å rangere dokumenter?

BM25 kombinerer termfrekvens, invers dokumentfrekvens (termsjeldenhet) og dokumentlengdenormalisering til en relevansscore.

Hvilken rolle spiller invers dokumentfrekvens (IDF) i BM25?

IDF belønner termer som er sjeldne i samlingen, og reduserer vanlige ord, siden sjeldne treff er mer informative.

Hvorfor bruker BM25 dokumentlengdenormalisering (b-parameteren)?

Uten normalisering ville lengre dokumenter akkumulert flere terminmatcher; b-parameteren justerer for lengde slik at sammenligningene er rettferdige.

Hvilken datastruktur gjør BM25 rask i skala?

En invertert indeks lar BM25 score kun dokumentene som inneholder søketermer, noe som gjør gjenfinningen svært effektiv.