ДалееСледующее руководство
Внимание к множественным запросам
Языковой ИИ
Техническое РУКОВОДСТВО
Переписывание запроса и извлечение нескольких запросов — это методы RAG, которые преобразуют вопрос пользователя перед поиском, перефразируя его, разбивая на подвопросы или генерируя несколько вариантов и объединяя их результаты.
Они имеют значение, поскольку пользователи часто задают расплывчатые, разговорные или состоящие из нескольких частей вопросы, формулировка которых не соответствует документам, а более точный запрос может выявить релевантные отрывки, которые можно было бы пропустить при простом буквальном поиске.
Качество поиска во многом зависит от запроса. Пользователи пишут короткие, двусмысленные или разговорные вопросы, а документы используют собственную лексику. Преобразование запросов закрывает этот пробел до того, как начнется поиск. Самая простая форма — рерайтинг: LLM превращает сообщение пользователя в более понятный поисковый запрос. Это важно в многоходовом чате, где такие вопросы, как «а в 2023 году?» ничего не значат без истории, поэтому система сжимает разговор в отдельный запрос. Декомпозиция разбивает сложный вопрос на подвопросы, которые можно извлечь отдельно, что полезно для сравнений или вопросов с несколькими переходами. Подсказка «шаг назад», описанная исследователями Google DeepMind в 2023 году, сначала задает более общий вопрос, чтобы выявить основные принципы. Многозапросный поиск генерирует несколько вариантов вопроса, выполняет поиск по каждому из них и объединяет результаты. LangChain популяризировал это с помощью MultiQueryRetriever. RAG-Fusion объединяет несколько запросов с помощью взаимного объединения рангов (RRF) — метода, описанного Кормаком, Кларком и Бютчером в 2009 году, который оценивает каждый документ путем суммирования 1/(k + ранг) по спискам результатов. Документы, занимающие первые места в нескольких списках, поднимаются на вершину без необходимости сравнивать исходные оценки. Связанный с ним метод HyDE (Hypothetical Document Embeddings, Gao et al., 2022) предполагает, что модель записывает гипотетический ответ и встраивает его вместо вопроса, поскольку текст в форме ответа часто располагается ближе к реальным отрывкам ответа в пространстве встраивания. Заблуждения: больше запросов не всегда лучше. Каждый вариант увеличивает задержку и стоимость, а плохо сгенерированные варианты могут отклоняться от намерений пользователя, привлекая нерелевантные документы. Переписывание также может устранить важные ограничения, такие как даты или названия продуктов. Прежде чем предпринимать эти шаги, измерьте качество запоминания и ответов на реальные вопросы.
Архитектурные решения влияют на производительность и эксплуатационные расходы на протяжении многих лет.
Техническое образование помогает командам выбрать правильный стек, а не только самый новый.
Лучший инженерный выбор снижает вероятность возникновения проблем с надежностью на производстве.
По мере распространения агентного RAG преобразование запросов все чаще осуществляется моделью, решающей, что искать, и повторяющейся, когда результаты кажутся слабыми, а не фиксированным шагом переписывания. Это делает лежащие в основе идеи, разложение, варианты и слияние более важными, даже если они становятся менее заметными. Улучшения во внедрении моделей и гибридном поиске уменьшают некоторые словарные несоответствия, но не устраняют необходимости уточнять двусмысленные или разговорные вопросы. Ожидайте, что команды будут использовать эти методы выборочно, когда запрос выглядит сложным или первоначальный поиск является слабым, чтобы сбалансировать качество и стоимость.
В чат-ассистенте появляется сообщение «А как насчет сотрудников, работающих неполный рабочий день?» перезаписывается в отдельный запрос, например «политика отпуска по уходу за ребенком для сотрудников, работающих неполный рабочий день», с использованием предыдущего разговора.
Вопрос о сравнении цен двух поставщиков облачных услуг разбивается на отдельные поиски для каждого поставщика, а перед ответом результаты объединяются.
Бот службы поддержки генерирует четыре фразы «мое приложение продолжает выходить из системы», включая технические термины, такие как истечение срока сеанса и обновление токена, и объединяет результаты с помощью взаимного объединения рангов.
Ассистент-исследователь использует пошаговую подсказку, чтобы сначала найти общий принцип, лежащий в основе узкого вопроса, а затем извлекает конкретные детали, придавая модели как предысторию, так и специфику.
Оптимизация одного теста может скрыть более широкие недостатки системы.
Затраты на инфраструктуру и техническое обслуживание часто недооцениваются.
Пробелы в безопасности и наблюдаемости могут увеличиваться по мере усложнения систем.
Определите целевые показатели задержки, качества и стоимости перед внедрением.
Тестирование при реалистичной нагрузке и условиях данных.
Мониторинг прибора на наличие ошибок, дрейфа и влияния пользователя.
Перед масштабированием подготовьте пути отката и реагирования на инциденты.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Переписывание запроса и извлечение нескольких запросов — это методы RAG, которые преобразуют вопрос пользователя перед поиском, перефразируя его, разбивая на подвопросы или генерируя несколько вариантов и объединяя их результаты. Они имеют значение, поскольку пользователи часто задают расплывчатые, разговорные или состоящие из нескольких частей вопросы, формулировка которых не соответствует документам, а более точный запрос может выявить релевантные отрывки, которые можно было бы пропустить при простом буквальном поиске.
Продолжение типа «а в 2023 году?» нуждается в истории разговоров, чтобы стать полезным автономным запросом.
Декомпозиция разбивает сложные вопросы или вопросы, состоящие из нескольких частей, на подвопросы, извлекаемые отдельно.
Подсказка «шаг назад», разработанная исследователями Google DeepMind, позволяет получить общую информацию, а не конкретику.
RRF суммирует 1/(k + ранг) по каждому списку, содержащему документ, вознаграждая документы, имеющие высокий рейтинг в нескольких списках.
Поскольку RRF использует только ранговые позиции, он может объединять списки, исходные баллы которых несопоставимы.
Продолжайте учиться
Другие руководства, выбранные по этой теме
ДалееСледующее руководство
Внимание к множественным запросам
Языковой ИИ