СледваСледващо ръководство
Внимание за множество заявки
Езиков AI
Техническо РЪКОВОДСТВО
Пренаписването на заявка и извличането на множество заявки са RAG техники, които трансформират въпроса на потребителя преди търсене, като го перифразират, разделят на подвъпроси или генерират няколко варианта и обединяват техните резултати.
Те имат значение, защото потребителите често задават неясни, разговорни или съставени от няколко части въпроси, чиято формулировка не съответства на документите, а по-добрата заявка може да изведе на повърхността релевантни пасажи, които би пропуснало едно буквално търсене.
Качеството на извличане зависи до голяма степен от заявката. Потребителите пишат кратки, двусмислени или разговорни въпроси, докато документите използват свой собствен речник. Трансформацията на заявката затваря тази празнина, преди търсенето да се случи. Най-простата форма е пренаписването: LLM превръща съобщението на потребителя в по-ясна заявка за търсене. Това е от съществено значение в многоходовия чат, където последващи действия като „и през 2023 г.?“ означават нищо без история, така че системата кондензира разговора в самостоятелна заявка. Декомпозицията разделя сложен въпрос на подвъпроси, които могат да бъдат извлечени поотделно, полезни за сравнения или въпроси с няколко прехода. Подканянето за стъпка назад, описано от изследователи на Google DeepMind през 2023 г., задава първо по-общ въпрос, за да извлече основните принципи. Извличането на множество заявки генерира няколко варианта на въпроса, извършва търсене за всеки и обединява резултатите. LangChain популяризира това със своя MultiQueryRetriever. RAG-Fusion комбинира множество заявки с взаимно сливане на ранг (RRF), метод, описан от Кормак, Кларк и Бютчър през 2009 г., който оценява всеки документ чрез сумиране на 1/(k + ранг) в списъците с резултати. Документите, които се появяват високо в няколко списъка, се издигат до върха, без да се нуждаят от сравними необработени резултати. Свързана техника, HyDE (Hypothetical Document Embeddings, Gao и колеги, 2022 г.), кара модела да напише хипотетичен отговор и да го вгради вместо въпроса, тъй като текст с форма на отговор често се намира по-близо до пасажи с истински отговори в пространството за вграждане. Погрешни схващания: повече заявки не винаги са по-добри. Всеки вариант добавя забавяне и разходи, а лошо генерираните варианти могат да се отклонят от намерението на потребителя, като изтеглят неподходящи документи. Пренаписването може също така да премахне важни ограничения като дати или имена на продукти. Измерете припомнянето и качеството на отговорите на реални въпроси, преди да приемете тези стъпки.
Архитектурните решения стимулират производителността и оперативните разходи в продължение на години.
Техническото образование помага на екипите да изберат правилния стек, а не само най-новия.
По-добрият инженерен избор намалява инцидентите, свързани с надеждността в производството.
С разпространението на агентния RAG преобразуването на заявката се управлява все повече от модела, който решава какво да търси, повтаряйки, когато резултатите изглеждат слаби, вместо от фиксирана стъпка на пренаписване. Това прави основните идеи, разлагането, вариантите и сливането по-важни, дори когато стават по-малко видими. Подобренията в моделите за вграждане и хибридното търсене намаляват известно несъответствие в речника, но не премахват необходимостта от изясняване на двусмислени или разговорни въпроси. Очаквайте екипите да използват тези техники избирателно, задействани, когато дадена заявка изглежда сложна или първоначалното извличане е слабо, за да балансират качество и цена.
В асистент за чат, последващият отговор „какво ще кажете за персонала на непълно работно време?“ се пренаписва в самостоятелна заявка като „политика за родителски отпуск за служители на непълно работно време“, използвайки предишния разговор.
Въпрос, сравняващ ценообразуването на двама облачни доставчици, се разлага на отделни търсения за всеки доставчик и резултатите се комбинират, преди да се отговори.
Бот за поддръжка генерира четири израза на „приложението ми продължава да ме отписва“, включително технически термини като изтичане на сесията и опресняване на токена, и обединява резултатите с реципрочно сливане на ранг.
Научен сътрудник използва подкана за стъпка назад, за да търси първо общия принцип зад тесен въпрос, след което извлича конкретни подробности, като дава на модела както предистория, така и специфики.
Оптимизирането на един бенчмарк може да скрие по-широки системни слабости.
Разходите за инфраструктура и поддръжка често се подценяват.
Пропуските в сигурността и видимостта могат да нарастват, когато системите стават по-сложни.
Определете целите за латентност, качество и разходи преди внедряването.
Бенчмарк при реалистични условия на натоварване и данни.
Мониторинг на инструмента за грешки, отклонение и въздействие върху потребителя.
Подгответе пътеките за връщане назад и реакция на инцидент преди мащабиране.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Пренаписването на заявка и извличането на множество заявки са RAG техники, които трансформират въпроса на потребителя преди търсене, като го перифразират, разделят на подвъпроси или генерират няколко варианта и обединяват техните резултати. Те имат значение, защото потребителите често задават неясни, разговорни или съставени от няколко части въпроси, чиято формулировка не съответства на документите, а по-добрата заявка може да изведе на повърхността релевантни пасажи, които би пропуснало едно буквално търсене.
Продължение като "и през 2023 г.?" се нуждае от хронология на разговорите, за да се превърне в полезна самостоятелна заявка.
Декомпозицията разделя сложни въпроси или въпроси от няколко части на подвъпроси, извлечени отделно.
Подсказването стъпка назад от изследователите на Google DeepMind извлича общ фон преди специфики.
RRF сумира 1/(k + ранг) за всеки списък, съдържащ документа, като възнаграждава документите, класирани високо в няколко списъка.
Тъй като RRF използва само ранг позиции, той може да комбинира списъци, чиито необработени резултати не са сравними.
Продължавай да учиш
Още ръководства, избрани за тази тема
СледваСледващо ръководство
Внимание за множество заявки
Езиков AI