Техническое РУКОВОДСТВО

Переписывание запросов и извлечение нескольких запросов

Переписывание запроса и извлечение нескольких запросов — это методы RAG, которые преобразуют вопрос пользователя перед поиском, перефразируя его, разбивая на подвопросы или генерируя несколько вариантов и объединяя их результаты.

  • 3 минуты чтения
  • Последнее обновление
На этой странице3 минуты чтения
  1. Обзор
  2. Глубокое погружение
  3. Стратегическое воздействие
  4. Будущее переписывания запросов и многозапросного поиска
  5. Реальная реализация
  6. Риски и ограничения
  7. Дорожная карта реализации
  8. Продолжайте исследовать
  9. Часто задаваемые вопросы

Обзор

Они имеют значение, поскольку пользователи часто задают расплывчатые, разговорные или состоящие из нескольких частей вопросы, формулировка которых не соответствует документам, а более точный запрос может выявить релевантные отрывки, которые можно было бы пропустить при простом буквальном поиске.

Глубокое погружение

Качество поиска во многом зависит от запроса. Пользователи пишут короткие, двусмысленные или разговорные вопросы, а документы используют собственную лексику. Преобразование запросов закрывает этот пробел до того, как начнется поиск. Самая простая форма — рерайтинг: LLM превращает сообщение пользователя в более понятный поисковый запрос. Это важно в многоходовом чате, где такие вопросы, как «а в 2023 году?» ничего не значат без истории, поэтому система сжимает разговор в отдельный запрос. Декомпозиция разбивает сложный вопрос на подвопросы, которые можно извлечь отдельно, что полезно для сравнений или вопросов с несколькими переходами. Подсказка «шаг назад», описанная исследователями Google DeepMind в 2023 году, сначала задает более общий вопрос, чтобы выявить основные принципы. Многозапросный поиск генерирует несколько вариантов вопроса, выполняет поиск по каждому из них и объединяет результаты. LangChain популяризировал это с помощью MultiQueryRetriever. RAG-Fusion объединяет несколько запросов с помощью взаимного объединения рангов (RRF) — метода, описанного Кормаком, Кларком и Бютчером в 2009 году, который оценивает каждый документ путем суммирования 1/(k + ранг) по спискам результатов. Документы, занимающие первые места в нескольких списках, поднимаются на вершину без необходимости сравнивать исходные оценки. Связанный с ним метод HyDE (Hypothetical Document Embeddings, Gao et al., 2022) предполагает, что модель записывает гипотетический ответ и встраивает его вместо вопроса, поскольку текст в форме ответа часто располагается ближе к реальным отрывкам ответа в пространстве встраивания. Заблуждения: больше запросов не всегда лучше. Каждый вариант увеличивает задержку и стоимость, а плохо сгенерированные варианты могут отклоняться от намерений пользователя, привлекая нерелевантные документы. Переписывание также может устранить важные ограничения, такие как даты или названия продуктов. Прежде чем предпринимать эти шаги, измерьте качество запоминания и ответов на реальные вопросы.

Стратегическое воздействие

Стоимость и бюджет

Архитектурные решения влияют на производительность и эксплуатационные расходы на протяжении многих лет.

Более четкие решения

Техническое образование помогает командам выбрать правильный стек, а не только самый новый.

Контроль качества

Лучший инженерный выбор снижает вероятность возникновения проблем с надежностью на производстве.

Будущее переписывания запросов и многозапросного поиска

По мере распространения агентного RAG преобразование запросов все чаще осуществляется моделью, решающей, что искать, и повторяющейся, когда результаты кажутся слабыми, а не фиксированным шагом переписывания. Это делает лежащие в основе идеи, разложение, варианты и слияние более важными, даже если они становятся менее заметными. Улучшения во внедрении моделей и гибридном поиске уменьшают некоторые словарные несоответствия, но не устраняют необходимости уточнять двусмысленные или разговорные вопросы. Ожидайте, что команды будут использовать эти методы выборочно, когда запрос выглядит сложным или первоначальный поиск является слабым, чтобы сбалансировать качество и стоимость.

Реальная реализация

В чат-ассистенте появляется сообщение «А как насчет сотрудников, работающих неполный рабочий день?» перезаписывается в отдельный запрос, например «политика отпуска по уходу за ребенком для сотрудников, работающих неполный рабочий день», с использованием предыдущего разговора.

Вопрос о сравнении цен двух поставщиков облачных услуг разбивается на отдельные поиски для каждого поставщика, а перед ответом результаты объединяются.

Бот службы поддержки генерирует четыре фразы «мое приложение продолжает выходить из системы», включая технические термины, такие как истечение срока сеанса и обновление токена, и объединяет результаты с помощью взаимного объединения рангов.

Ассистент-исследователь использует пошаговую подсказку, чтобы сначала найти общий принцип, лежащий в основе узкого вопроса, а затем извлекает конкретные детали, придавая модели как предысторию, так и специфику.

Риски и ограничения

  • Оптимизация одного теста может скрыть более широкие недостатки системы.

  • Затраты на инфраструктуру и техническое обслуживание часто недооцениваются.

  • Пробелы в безопасности и наблюдаемости могут увеличиваться по мере усложнения систем.

Дорожная карта реализации

  1. Определите целевые показатели задержки, качества и стоимости перед внедрением.

  2. Тестирование при реалистичной нагрузке и условиях данных.

  3. Мониторинг прибора на наличие ошибок, дрейфа и влияния пользователя.

  4. Перед масштабированием подготовьте пути отката и реагирования на инциденты.

Продолжайте исследовать

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Query Rewriting and Multi-Query Retrieval quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Начать тест

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Часто задаваемые вопросы

Что такое переписывание запросов и многозапросное извлечение?

Переписывание запроса и извлечение нескольких запросов — это методы RAG, которые преобразуют вопрос пользователя перед поиском, перефразируя его, разбивая на подвопросы или генерируя несколько вариантов и объединяя их результаты. Они имеют значение, поскольку пользователи часто задают расплывчатые, разговорные или состоящие из нескольких частей вопросы, формулировка которых не соответствует документам, а более точный запрос может выявить релевантные отрывки, которые можно было бы пропустить при простом буквальном поиске.

Почему переписывание запросов особенно важно в многоходовом чате?

Продолжение типа «а в 2023 году?» нуждается в истории разговоров, чтобы стать полезным автономным запросом.

Какой метод разбивает вопрос сравнения на отдельные поиски для каждого сравниваемого элемента?

Декомпозиция разбивает сложные вопросы или вопросы, состоящие из нескольких частей, на подвопросы, извлекаемые отдельно.

Что делает подсказка «шаг назад»?

Подсказка «шаг назад», разработанная исследователями Google DeepMind, позволяет получить общую информацию, а не конкретику.

Как рассчитывается оценка документа при взаимном слиянии рангов?

RRF суммирует 1/(k + ранг) по каждому списку, содержащему документ, вознаграждая документы, имеющие высокий рейтинг в нескольких списках.

Почему RRF удобен для объединения векторного поиска и результатов BM25?

Поскольку RRF использует только ранговые позиции, он может объединять списки, исходные баллы которых несопоставимы.