Taal AI-GIDS

BM25 en Lexicale retrieval

BM25 is de klassieke op trefwoorden gebaseerde rangschikkingsfunctie die documenten beoordeelt op basis van hoe vaak zoektermen voorkomen, aangepast voor de zeldzaamheid van de termen en de documentlengte.

2 min readLaatst bijgewerkt

Overzicht

Decades old, it remains a remarkably strong and ubiquitous baseline for search.

Diepe duik

BM25 (Best Matching 25) is een rangschikkingsfunctie voor een reeks woorden uit het probabilistische Okapi-raamwerk uit de jaren negentig. Voor elke zoekterm combineert het drie signalen: termfrequentie (hoe vaak het woord voorkomt in een document, met afnemende meeropbrengsten gecontroleerd door een parameter k1), inverse documentfrequentie (zeldzamere woorden in de collectie tellen meer) en normalisatie van de documentlengte (parameter b, dus lange documenten worden niet onterecht bevoordeeld). Tel deze scores per term bij elkaar op en je krijgt de rangorde van het document. Het heeft geen training nodig en werkt razendsnel via omgekeerde indexen. Daarom gebruiken zoekmachines als Elasticsearch en Lucene het standaard. Ondanks de opkomst van neurale retrieval wint BM25 nog steeds veel benchmarks, vooral voor zeldzame termen, exacte identificatiegegevens en zoekopdrachten buiten het domein.

Technisch inzicht

De termfrequentiecomponent van BM25 raakt verzadigd: de k1-parameter beperkt hoeveel herhaalde woorden een score verhogen, dus een term die 50 keer voorkomt is niet 50x relevanter dan één keer. De b-parameter combineert ruwe en lengte-genormaliseerde frequentie. IDF weegt gewone woorden als ‘de’ af en beloont onderscheidende woorden. Omdat het werkt met een omgekeerde index die elk woord aan de documentenlijst koppelt, heeft de score alleen betrekking op documenten die zoektermen bevatten, waardoor het uiterst efficiënt is.

Strategische impact

Speed and scale

Taalworkflows kunnen sneller verlopen zonder dat dit ten koste gaat van de consistentie.

Access and reach

Het breidt de toegang uit naar meerdere talen en communicatiestijlen.

Clearer decisions

Teams kunnen meer tijd besteden aan beoordeling, terwijl automatisering de herhaling afhandelt.

De toekomst van BM25 en lexicale retrieval

Het is onwaarschijnlijk dat BM25 zal verdwijnen; in plaats daarvan wordt het steeds vaker gecombineerd met neurale methoden bij hybride retrieval, waarbij lexicale en dichte scores worden samengevoegd (vaak via wederzijdse rangschikking). Geleerde spaarzame modellen zoals SPLADE combineren spaarzaamheid in BM25-stijl met neurale termweging, en BM25 dient vaak als de eerste fase van retriever vóór neurale rerankers. De snelheid, interpreteerbaarheid en nultrainingskosten garanderen een blijvende rol in het productieonderzoek.

Implementatie in de echte wereld

Standaard relevantierangschikking in Elasticsearch, OpenSearch en Apache Lucene/Solr

Het ophalen van kandidaten in de eerste fase die een langzamere neurale reranker voedt bij zoeken in twee fasen

Code- en logzoekopdracht waarbij exacte identificatiegegevens en foutcodes nauwkeurig moeten overeenkomen

Harde negatieve voorbeelden verzamelen om dichte retrievers zoals DPR te trainen

Risico's en vangrails

Gehallucineerde feiten kunnen stilletjes rapporten binnendringen, stromen ondersteunen of onderzoeksresultaten opleveren.

Gevoeligheid voor prompts kan inconsistente resultaten opleveren voor vergelijkbare verzoeken.

Gevoelige tekstgegevens kunnen openbaar worden gemaakt als de toegangscontroles zwak zijn.

Implementatie routekaart

1

Definieer het uitvoerformaat, de toon en de kwaliteitsnormen vóór de implementatie.

2

Grondreacties met vertrouwde bronnen wanneer nauwkeurigheid belangrijk is.

3

Houd een menselijk controlepunt bij voor resultaten met een hoge inzet.

4

Houd faalpatronen bij en train prompts of workflows regelmatig opnieuw.

Blijf verkennen

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the BM25 and Lexical Retrieval quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

ColBERT Late interactie-ophaalactie

Frequently asked questions

What is BM25 and Lexical Retrieval?

BM25 is de klassieke op trefwoorden gebaseerde rangschikkingsfunctie die documenten beoordeelt op basis van hoe vaak zoektermen voorkomen, aangepast voor de zeldzaamheid van de termen en de documentlengte. Het is tientallen jaren oud en blijft een opmerkelijk sterke en alomtegenwoordige basis voor zoeken.

Wat gebruikt BM25 voornamelijk om documenten te rangschikken?

BM25 combineert termfrequentie, inverse documentfrequentie (termzeldzaamheid) en normalisatie van de documentlengte tot een relevantiescore.

Welke rol speelt de inverse documentfrequentie (IDF) in BM25?

IDF beloont termen die in de collectie zeldzaam zijn en weegt veel voorkomende woorden af, omdat zeldzame overeenkomsten informatiever zijn.

Waarom past BM25 documentlengtenormalisatie toe (de b-parameter)?

Zonder normalisatie zouden langere documenten meer termmatches opleveren; de b-parameter wordt aangepast aan de lengte, zodat vergelijkingen eerlijk zijn.

Welke datastructuur maakt BM25 snel op schaal?

Dankzij een omgekeerde index kan BM25 alleen de documenten scoren die zoektermen bevatten, waardoor het ophalen zeer efficiënt wordt.