Мова AI GUIDE

BM25 і лексичний пошук

BM25 — це класична функція ранжирування на основі ключових слів, яка оцінює документи за частотою появи термінів у запиті з урахуванням рідкості термінів і довжини документа.

2 хвилини читанняОстаннє оновлення

Огляд

Decades old, it remains a remarkably strong and ubiquitous baseline for search.

Глибоке занурення

BM25 (Best Matching 25) — це функція ранжирування сумки слів із імовірнісної системи Okapi 1990-х років. Для кожного терміну запиту він об’єднує три сигнали: частоту терміну (як часто слово з’являється в документі, із зменшенням результатів, що контролюється параметром k1), зворотну частоту документа (більш рідкісні слова в колекції вважаються більшими) і нормалізацію довжини документа (параметр b, тому довгі документи не мають несправедливої ​​переваги). Підсумуйте ці бали за семестр, і ви отримаєте рейтинг документа. Він не потребує навчання та працює надзвичайно швидко за допомогою інвертованих індексів, тому пошукові системи, такі як Elasticsearch і Lucene, використовують його за замовчуванням. Незважаючи на зростання нейронного пошуку, BM25 все ще перемагає або зрівняється з багатьма тестами, особливо для рідкісних термінів, точних ідентифікаторів і запитів поза доменом.

Технічне розуміння

Термін-частота компонента BM25 насичується: параметр k1 обмежує кількість повторюваних слів, які підвищують оцінку, тому термін, який з’являється 50 разів, не є в 50 разів релевантнішим, ніж один раз. Параметр b поєднує необроблену та нормалізовану за довжиною частоту. IDF зменшує вагу таких загальних слів, як «the», і винагороджує характерні. Оскільки він працює на основі перевернутого індексу, що відображає кожне слово у списку документів, підрахунок балів стосується лише документів, які містять терміни запиту, що робить його надзвичайно ефективним.

Стратегічний вплив

Швидкість і масштаб

Мовні робочі процеси можуть рухатися швидше без шкоди для узгодженості.

Доступ і охоплення

Це розширює доступ до різних мов і стилів спілкування.

Чіткіші рішення

Команди можуть витрачати більше часу на оцінювання, поки автоматизація справляється з повторенням.

Майбутнє BM25 і лексичного пошуку

BM25 навряд чи зникне; замість цього він все частіше поєднується з нейронними методами в гібридному пошуку, де лексичні та щільні бали зливаються (часто через взаємне злиття рангів). Вивчені розріджені моделі, такі як SPLADE, поєднують розрідженість у стилі BM25 із зважуванням нейронних термінів, і BM25 часто служить першим етапом відновлення перед нейронними реранжерами. Його швидкість, можливість інтерпретації та нульові витрати на навчання гарантують тривалу роль у виробничому пошуку.

Реалізація в реальному світі

Ранжування релевантності за замовчуванням у Elasticsearch, OpenSearch і Apache Lucene/Solr

Пошук кандидатів на першому етапі, який подає повільніший нейронний реранжер у двоетапному пошуку

Пошук коду та журналу, де точні ідентифікатори та коди помилок мають точно збігатися

Видобуток важких негативних прикладів для тренування щільних ретриверів, таких як DPR

Ризики та огорожі

Галюциновані факти можуть непомітно входити у звіти, допоміжні потоки або результати досліджень.

Делікатність підказок може створити суперечливі результати для подібних запитів.

Конфіденційні текстові дані можуть бути розкриті, якщо контроль доступу слабкий.

Дорожня карта впровадження

1

Визначте вихідний формат, тон і стандарти якості перед розгортанням.

2

Якщо точність має значення, зв’яжіться з надійними джерелами.

3

Тримайте контрольну точку перевірки людьми для отримання високих ставок.

4

Відстежуйте моделі збоїв і регулярно перенавчайте підказки або робочі процеси.

Продовжуйте досліджувати

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the BM25 and Lexical Retrieval quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Розпочати вікторину

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Наступний посібник

ColBERT Late Interaction Retrieval

Часті запитання

What is BM25 and Lexical Retrieval?

BM25 — це класична функція ранжирування на основі ключових слів, яка оцінює документи за частотою появи термінів у запиті з урахуванням рідкості термінів і довжини документа. Десятиліття тому він залишається надзвичайно надійною та повсюдною базою для пошуку.

Що в основному використовує BM25 для ранжирування документів?

BM25 поєднує частоту термінів, зворотну частоту документів (рідкість термінів) і нормалізацію довжини документа в бал релевантності.

Яку роль відіграє інверсна частота документа (IDF) у BM25?

IDF винагороджує терміни, які є рідкісними в колекції, і зменшує вагу звичайних слів, оскільки рідкісні збіги є більш інформативними.

Чому BM25 застосовує нормалізацію довжини документа (параметр b)?

Без нормалізації довші документи накопичували б більше збігів термінів; параметр b регулює довжину, тому порівняння є справедливими.

Яка структура даних робить BM25 швидким у масштабі?

Інвертований індекс дозволяє BM25 оцінювати лише документи, які містять умови запиту, що робить пошук дуже ефективним.