GUIDE IA du langage

BM25 et récupération lexicale

BM25 est la fonction de classement classique basée sur des mots clés qui classe les documents en fonction de la fréquence d'apparition des termes de requête, ajustés en fonction de la rareté des termes et de la longueur du document.

2 minutes de lectureDernière mise à jour

Aperçu

Decades old, it remains a remarkably strong and ubiquitous baseline for search.

Plongée profonde

BM25 (Best Matching 25) est une fonction de classement par sac de mots issue du cadre probabiliste Okapi des années 1990. Pour chaque terme de requête, il combine trois signaux : la fréquence du terme (la fréquence à laquelle le mot apparaît dans un document, avec des rendements décroissants contrôlés par un paramètre k1), la fréquence inverse du document (les mots les plus rares dans la collection comptent davantage) et la normalisation de la longueur du document (paramètre b, afin que les documents longs ne soient pas injustement favorisés). Additionnez ces scores par trimestre et vous obtenez le classement du document. Il ne nécessite aucune formation et s'exécute à une vitesse fulgurante via des index inversés, c'est pourquoi les moteurs de recherche comme Elasticsearch et Lucene l'utilisent par défaut. Malgré l'essor de la récupération neuronale, BM25 continue de gagner ou d'être à égalité dans de nombreux benchmarks, en particulier pour les termes rares, les identifiants exacts et les requêtes hors domaine.

Aperçu technique

La composante terme-fréquence du BM25 sature : le paramètre k1 limite la quantité de mots répétés qui améliorent un score, de sorte qu'un terme apparaissant 50 fois n'est pas 50 fois plus pertinent qu'une fois. Le paramètre b mélange la fréquence brute et la fréquence normalisée en longueur. La FID minimise les mots courants comme « le » et récompense les mots distinctifs. Parce qu'il fonctionne sur un index inversé mappant chaque mot à sa liste de documents, le scoring ne touche que les documents contenant des termes de requête, ce qui le rend extrêmement efficace.

Impact stratégique

Vitesse et échelle

Les flux de travail linguistiques peuvent évoluer plus rapidement sans sacrifier la cohérence.

Accès et portée

Il étend l’accès à toutes les langues et styles de communication.

Décisions plus claires

Les équipes peuvent consacrer plus de temps au jugement tandis que l’automatisation gère les répétitions.

L'avenir du BM25 et de la récupération lexicale

Il est peu probable que le BM25 disparaisse ; au lieu de cela, il est de plus en plus associé à des méthodes neuronales dans la récupération hybride, où les scores lexicaux et denses sont fusionnés (souvent via une fusion de rangs réciproques). Les modèles clairsemés appris comme SPLADE mélangent la parcimonie de style BM25 avec une pondération des termes neuronaux, et BM25 sert fréquemment de récupérateur de premier étage avant les reclassements neuronaux. Sa rapidité, son interprétabilité et son coût de formation nul garantissent un rôle durable dans la recherche de production.

Mise en œuvre dans le monde réel

Classement de pertinence par défaut dans Elasticsearch, OpenSearch et Apache Lucene/Solr

Récupération de candidats de première étape qui alimente un reclasseur neuronal plus lent dans une recherche en deux étapes

Recherche de codes et de journaux où les identifiants exacts et les codes d'erreur doivent correspondre précisément

Exploiter des exemples négatifs pour former des récupérateurs denses comme DPR

Risques et garde-fous

Les faits hallucinés peuvent discrètement entrer dans des rapports, des flux de support ou des résultats de recherche.

La sensibilité des invites peut créer des résultats incohérents pour des demandes similaires.

Les données textuelles sensibles peuvent être exposées si les contrôles d’accès sont faibles.

Feuille de route de mise en œuvre

1

Définissez le format de sortie, le ton et les normes de qualité avant le déploiement.

2

Établissez des réponses auprès de sources fiables chaque fois que la précision est importante.

3

Gardez un point de contrôle d’examen humain pour les résultats à enjeux élevés.

4

Suivez les modèles de défaillance et recyclez régulièrement les invites ou les flux de travail.

Continuez à explorer

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the BM25 and Lexical Retrieval quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Démarrer le quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Guide suivant

Récupération tardive des interactions ColBERT

Questions fréquemment posées

What is BM25 and Lexical Retrieval?

BM25 est la fonction de classement classique basée sur des mots clés qui classe les documents en fonction de la fréquence d'apparition des termes de requête, ajustés en fonction de la rareté des termes et de la longueur du document. Vieille de plusieurs décennies, elle reste une référence de recherche remarquablement solide et omniprésente.

Qu'est-ce que BM25 utilise principalement pour classer les documents ?

BM25 combine la fréquence des termes, la fréquence inverse des documents (rareté des termes) et la normalisation de la longueur des documents dans un score de pertinence.

Quel rôle joue la fréquence inverse des documents (IDF) dans BM25 ?

IDF récompense les termes rares dans la collection et minimise les mots courants, car les correspondances rares sont plus informatives.

Pourquoi BM25 applique-t-il la normalisation de la longueur du document (le paramètre b) ?

Sans normalisation, les documents plus longs accumuleraient davantage de correspondances de termes ; le paramètre b s'ajuste en fonction de la longueur afin que les comparaisons soient équitables.

Quelle structure de données rend le BM25 rapide à grande échelle ?

Un index inversé permet à BM25 de noter uniquement les documents contenant des termes de requête, ce qui rend la récupération très efficace.