Език AI РЪКОВОДСТВО

BM25 и лексикално извличане

BM25 е класическата функция за класиране, базирана на ключови думи, която оценява документите според това колко често се появяват термините на заявката, коригирани за рядкост на термините и дължина на документа.

2 min readПоследна актуализация

Преглед

Decades old, it remains a remarkably strong and ubiquitous baseline for search.

Дълбоко гмуркане

BM25 (Best Matching 25) е функция за класиране на пакет от думи от вероятностната рамка на Okapi от 90-те години. За всеки термин на заявка той комбинира три сигнала: честота на термина (колко често думата се появява в документ, с намаляващи резултати, контролирани от параметър k1), обратна честота на документа (по-редките думи в колекцията се броят повече) и нормализиране на дължината на документа (параметър b, така че дългите документи не са несправедливо предпочитани). Сумирайте тези резултати за семестър и ще получите ранга на документа. Не се нуждае от обучение и работи светкавично бързо чрез обърнати индекси, поради което търсачки като Elasticsearch и Lucene го използват по подразбиране. Въпреки нарастването на невронното извличане, BM25 все още печели или се изравнява по много показатели, особено за редки термини, точни идентификатори и заявки извън домейн.

Техническа информация

Компонентът термин-честота на BM25 се насища: параметърът k1 ограничава колко повтарящи се думи повишават резултата, така че термин, който се появява 50 пъти, не е 50 пъти по-уместен от веднъж. Параметърът b смесва необработена и нормализирана по дължина честота. IDF намалява често срещаните думи като „the“ и награждава отличителните. Тъй като работи с обърнат индекс, преобразуващ всяка дума в своя списък с документи, точкуването докосва само документи, съдържащи термини на заявка, което го прави изключително ефективно.

Стратегическо въздействие

Speed and scale

Езиковите работни процеси могат да се движат по-бързо, без да се жертва последователността.

Access and reach

Той разширява достъпа между езици и стилове на комуникация.

Clearer decisions

Екипите могат да отделят повече време за преценка, докато автоматизацията се справя с повторението.

Бъдещето на BM25 и лексикалното извличане

BM25 е малко вероятно да изчезне; вместо това все повече се съчетава с невронни методи при хибридно извличане, където лексикалните и плътните резултати се сливат (често чрез реципрочно рангово сливане). Научените редки модели като SPLADE съчетават рядкост в стила на BM25 с претегляне на невронни термини и BM25 често служи като ретривър на първи етап преди невронни препозиционери. Неговата скорост, интерпретируемост и нулеви разходи за обучение гарантират трайна роля в търсенето на продукция.

Внедряване в реалния свят

Класиране по уместност по подразбиране в Elasticsearch, OpenSearch и Apache Lucene/Solr

Първоетапно извличане на кандидати, което захранва по-бавен невронен прекласатор при двуетапно търсене

Търсене на кодове и регистрационни файлове, където точните идентификатори и кодовете на грешки трябва да съвпадат точно

Копаене на твърди отрицателни примери за обучение на плътни ретривъри като DPR

Рискове и предпазни огради

Халюцинираните факти могат тихо да влязат в отчети, потоци за поддръжка или резултати от изследвания.

Бързата чувствителност може да създаде противоречиви резултати при подобни заявки.

Чувствителните текстови данни могат да бъдат разкрити, ако контролите за достъп са слаби.

Пътна карта за изпълнение

1

Определете изходен формат, тон и стандарти за качество преди внедряване.

2

Наземни отговори с доверени източници винаги, когато точността има значение.

3

Поддържайте контролна точка за човешки преглед за изходи с високи залози.

4

Проследявайте моделите на неуспехи и редовно обучавайте подкани или работни потоци.

Продължете да изследвате

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the BM25 and Lexical Retrieval quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

ColBERT Late Interaction Retrieval

Frequently asked questions

What is BM25 and Lexical Retrieval?

BM25 е класическата функция за класиране, базирана на ключови думи, която оценява документите според това колко често се появяват термините на заявката, коригирани за рядкост на термините и дължина на документа. На десетилетия, той остава забележително силна и повсеместна основа за търсене.

Какво основно използва BM25 за класиране на документи?

BM25 съчетава честотата на термина, обратната честота на документа (рядкост на термина) и нормализацията на дължината на документа в оценка за уместност.

Каква роля играе обратната документна честота (IDF) в BM25?

IDF награждава термини, които са редки в колекцията, и намалява теглото на често срещаните думи, тъй като редките съвпадения са по-информативни.

Защо BM25 прилага нормализиране на дължината на документа (параметър b)?

Без нормализация по-дългите документи биха натрупали повече съвпадения на термини; параметърът b коригира дължината, така че сравненията са справедливи.

Каква структура на данните прави BM25 бърз в мащаб?

Обърнатият индекс позволява на BM25 да оценява само документите, които съдържат термини на заявка, което прави извличането много ефективно.