РУКОВОДСТВО ПО ЯЗЫКУ ИИ

BM25 и лексический поиск

BM25 — это классическая функция ранжирования на основе ключевых слов, которая оценивает документы по частоте появления терминов запроса с поправкой на редкость термина и длину документа.

2 минуты чтенияПоследнее обновление

Обзор

Спустя десятилетия он остается чрезвычайно прочной и повсеместной основой для поиска.

Глубокое погружение

BM25 (25 лучших совпадений) — это функция ранжирования набора слов из вероятностной системы Окапи 1990-х годов. Для каждого термина запроса он объединяет три сигнала: частота термина (как часто слово появляется в документе, с убывающей отдачей, контролируемой параметром k1), обратная частота документов (более редкие слова в коллекции учитываются больше) и нормализация длины документа (параметр b, поэтому длинные документы не имеют несправедливого предпочтения). Суммируйте эти баллы за каждый термин, и вы получите рейтинг документа. Он не требует обучения и работает невероятно быстро с помощью инвертированных индексов, поэтому поисковые системы, такие как Elasticsearch и Lucene, используют его по умолчанию. Несмотря на рост популярности нейронного поиска, BM25 по-прежнему выигрывает или имеет равные результаты во многих тестах, особенно для редких терминов, точных идентификаторов и запросов из домена.

Техническая информация

Компонент частоты терминов BM25 насыщает: параметр k1 ограничивает, насколько повторяющиеся слова повышают оценку, поэтому термин, появляющийся 50 раз, не является в 50 раз более релевантным, чем один раз. Параметр b объединяет необработанную и нормализованную по длине частоту. ЦАХАЛ снижает вес таких обычных слов, как «the», и вознаграждает отличительные. Поскольку он работает на основе инвертированного индекса, сопоставляющего каждое слово со списком документов, оценка затрагивает только документы, содержащие термины запроса, что делает его чрезвычайно эффективным.

Стратегическое воздействие

Скорость и масштаб

Языковые рабочие процессы могут развиваться быстрее, не жертвуя при этом согласованностью.

Доступ и охват

Это расширяет доступ к различным языкам и стилям общения.

Более четкие решения

Команды могут тратить больше времени на принятие решений, в то время как автоматизация занимается повторением.

Будущее BM25 и лексического поиска

БМ25 вряд ли исчезнет; вместо этого он все чаще сочетается с нейронными методами в гибридном поиске, где лексические и плотные оценки объединяются (часто посредством взаимного слияния рангов). Обученные разреженные модели, такие как SPLADE, сочетают в себе разреженность в стиле BM25 с нейронным взвешиванием терминов, а BM25 часто служит средством извлечения первого этапа перед нейронным переранжированием. Его скорость, интерпретируемость и нулевая стоимость обучения гарантируют его постоянную роль в поиске продукции.

Реальная реализация

Рейтинг релевантности по умолчанию в Elasticsearch, OpenSearch и Apache Lucene/Solr

Поиск кандидатов на первом этапе, который обеспечивает более медленный нейронный механизм изменения ранжирования в двухэтапном поиске.

Поиск по коду и журналу, где точные идентификаторы и коды ошибок должны точно совпадать.

Извлечение жестких отрицательных примеров для обучения плотных ретриверов, таких как DPR.

Риски и ограничения

Галлюцинированные факты могут незаметно войти в отчеты, потоки поддержки или результаты исследований.

Незамедлительная чувствительность может привести к противоречивым результатам по схожим запросам.

Конфиденциальные текстовые данные могут быть раскрыты, если контроль доступа слабый.

Дорожная карта реализации

1

Перед развертыванием определите выходной формат, тон и стандарты качества.

2

Наземные ответы с помощью надежных источников, когда точность имеет значение.

3

Обеспечьте контрольную точку человеческого контроля для получения важных результатов.

4

Отслеживайте закономерности сбоев и регулярно обновляйте подсказки или рабочие процессы.

Продолжайте исследовать

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the BM25 and Lexical Retrieval quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Начать тест

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Следующее руководство

ColBERT – извлечение позднего взаимодействия

Часто задаваемые вопросы

Что такое BM25 и лексический поиск?

BM25 — это классическая функция ранжирования на основе ключевых слов, которая оценивает документы по частоте появления терминов запроса с поправкой на редкость термина и длину документа. Спустя десятилетия он остается чрезвычайно прочной и повсеместной основой для поиска.

Что в первую очередь использует BM25 для ранжирования документов?

BM25 объединяет частоту терминов, обратную частоту документов (редкость терминов) и нормализацию длины документа в показатель релевантности.

Какую роль в BM25 играет обратная частота документов (IDF)?

IDF поощряет термины, которые встречаются редко в коллекции, и снижает вес общих слов, поскольку редкие совпадения более информативны.

Почему BM25 применяет нормализацию длины документа (параметр b)?

Без нормализации в более длинных документах будет накапливаться больше совпадений терминов; параметр b регулирует длину, поэтому сравнения являются справедливыми.

Какая структура данных делает BM25 быстрым в масштабировании?

Инвертированный индекс позволяет BM25 оценивать только те документы, которые содержат термины запроса, что делает поиск очень эффективным.