PRZEWODNIK techniczny

Przepisywanie zapytań i pobieranie wielu zapytań

Przepisywanie zapytań i wyszukiwanie wielu zapytań to techniki RAG, które przekształcają pytanie użytkownika przed wyszukiwaniem, formułując je, dzieląc na pytania podrzędne lub generując kilka wariantów i łącząc ich wyniki.

  • 3 minuty czytania
  • Ostatnia aktualizacja
Na tej stronie3 minuty czytania
  1. Przegląd
  2. Głębokie nurkowanie
  3. Wpływ strategiczny
  4. Przyszłość przepisywania zapytań i odzyskiwania wielu zapytań
  5. Implementacja w świecie rzeczywistym
  6. Zagrożenia i poręcze
  7. Plan wdrożenia
  8. Odkrywaj dalej
  9. Często zadawane pytania

Przegląd

Mają one znaczenie, ponieważ użytkownicy często zadają niejasne, konwersacyjne lub wieloczęściowe pytania, których sformułowanie nie odpowiada dokumentom, a lepsze zapytanie może wskazać odpowiednie fragmenty, które przeoczyłoby się w pojedynczym dosłownym wyszukiwaniu.

Głębokie nurkowanie

Jakość pobierania zależy w dużej mierze od zapytania. Użytkownicy piszą krótkie, niejednoznaczne lub konwersacyjne pytania, podczas gdy w dokumentach używa się własnego słownictwa. Transformacja zapytania zamyka tę lukę przed rozpoczęciem wyszukiwania. Najprostszą formą jest przepisanie: LLM zamienia wiadomość użytkownika w jaśniejsze zapytanie. Jest to niezbędne na czacie wieloobrotowym, w którym pojawiają się pytania typu „i w 2023 r.?” nic nie znaczą bez historii, więc system skondensuje rozmowę w osobne zapytanie. Dekompozycja dzieli złożone pytanie na pytania podrzędne, które można wyszukać osobno, co jest przydatne przy porównaniach lub pytaniach typu multi-hop. Podpowiadanie o cofnięciu się, opisane przez badaczy Google DeepMind w 2023 r., zadaje najpierw bardziej ogólne pytanie w celu odzyskania zasad tła. Pobieranie wielu zapytań generuje kilka wariantów pytania, uruchamia wyszukiwanie każdego z nich i łączy wyniki. LangChain spopularyzował to dzięki MultiQueryRetriever. RAG-Fusion łączy wiele zapytań za pomocą wzajemnej fuzji rang (RRF), metody opisanej przez Cormacka, Clarke'a i Buettchera w 2009 r., która ocenia każdy dokument poprzez zsumowanie 1/(k + ranga) z list wyników. Dokumenty, które pojawiają się wysoko na kilku listach, trafiają na sam szczyt bez konieczności uzyskiwania porównywalnych surowych wyników. Powiązana technika, HyDE (Hypothetical Document Embeddings, Gao i współpracownicy, 2022), polega na tym, że model zapisuje hipotetyczną odpowiedź i osadza ją zamiast pytania, ponieważ tekst w kształcie odpowiedzi często znajduje się bliżej prawdziwych fragmentów odpowiedzi w przestrzeni osadzania. Błędne przekonania: więcej zapytań nie zawsze jest lepszych. Każdy wariant zwiększa opóźnienia i koszty, a źle wygenerowane warianty mogą odbiegać od zamierzeń użytkownika, przyciągając nieistotne dokumenty. Przepisanie może również spowodować usunięcie ważnych ograniczeń, takich jak daty lub nazwy produktów. Przed podjęciem tych kroków zmierz zapamiętywanie i jakość odpowiedzi na prawdziwe pytania.

Wpływ strategiczny

Koszt i budżet

Decyzje dotyczące architektury wpływają na wydajność i koszty operacyjne przez lata.

Jaśniejsze decyzje

Edukacja techniczna pomaga zespołom wybrać odpowiedni stos, a nie tylko najnowszy.

Kontrola jakości

Lepsze wybory inżynieryjne zmniejszają liczbę incydentów związanych z niezawodnością w produkcji.

Przyszłość przepisywania zapytań i odzyskiwania wielu zapytań

W miarę rozprzestrzeniania się agentycznego RAG transformacja zapytań jest w coraz większym stopniu obsługiwana przez model decydujący, czego szukać i iterujący, gdy wyniki wyglądają słabo, a nie przez ustalony etap przepisywania. To sprawia, że ​​podstawowe idee, rozkład, warianty i fuzja stają się ważniejsze, nawet jeśli stają się mniej widoczne. Ulepszenia w zakresie osadzania modeli i wyszukiwania hybrydowego zmniejszają pewne niedopasowania słownictwa, ale nie eliminują potrzeby wyjaśniania niejednoznacznych lub konwersacyjnych pytań. Oczekuj, że zespoły będą używać tych technik selektywnie, uruchamianych, gdy zapytanie wygląda na złożone lub początkowe pobieranie jest słabe, aby zrównoważyć jakość i koszty.

Implementacja w świecie rzeczywistym

W asystencie czatu kontynuacja „a co z pracownikami zatrudnionymi w niepełnym wymiarze godzin?” zostaje przepisane na samodzielne zapytanie, takie jak „Zasady urlopów rodzicielskich dla pracowników zatrudnionych w niepełnym wymiarze godzin”, wykorzystując wcześniejszą rozmowę.

Pytanie porównujące ceny dwóch dostawców usług w chmurze jest rozkładane na osobne wyszukiwania dla każdego dostawcy, a wyniki są łączone przed udzieleniem odpowiedzi.

Bot wsparcia generuje cztery wyrażenia „moja aplikacja ciągle mnie wylogowuje”, w tym terminy techniczne, takie jak wygaśnięcie sesji i odświeżenie tokena, i łączy wyniki z wzajemną fuzją rang.

Asystent badawczy korzysta z podpowiedzi cofania się, aby najpierw wyszukać ogólną zasadę kryjącą się za wąskim pytaniem, a następnie wyszukać szczegółowe szczegóły, podając modelowi zarówno tło, jak i specyfikę.

Zagrożenia i poręcze

  • Optymalizacja jednego testu porównawczego może ukryć szersze słabości systemu.

  • Koszty infrastruktury i utrzymania są często niedoszacowane.

  • W miarę jak systemy stają się coraz bardziej złożone, luki w bezpieczeństwie i obserwowalności mogą się zwiększać.

Plan wdrożenia

  1. Przed wdrożeniem zdefiniuj docelowe opóźnienia, jakość i koszty.

  2. Test porównawczy w realistycznych warunkach obciążenia i danych.

  3. Monitorowanie przyrządu pod kątem błędów, dryftu i wpływu użytkownika.

  4. Przed skalowaniem przygotuj ścieżki wycofywania zmian i reakcji na incydenty.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Query Rewriting and Multi-Query Retrieval quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Często zadawane pytania

Co to jest przepisywanie zapytań i pobieranie wielu zapytań?

Przepisywanie zapytań i wyszukiwanie wielu zapytań to techniki RAG, które przekształcają pytanie użytkownika przed wyszukiwaniem, formułując je, dzieląc na pytania podrzędne lub generując kilka wariantów i łącząc ich wyniki. Mają one znaczenie, ponieważ użytkownicy często zadają niejasne, konwersacyjne lub wieloczęściowe pytania, których sformułowanie nie odpowiada dokumentom, a lepsze zapytanie może wskazać odpowiednie fragmenty, które przeoczyłoby się w pojedynczym dosłownym wyszukiwaniu.

Dlaczego przepisywanie zapytań jest szczególnie ważne na czacie wieloturowym?

Kontynuacja typu „i w 2023 r.” potrzebuje historii konwersacji, aby stać się użytecznym samodzielnym zapytaniem.

Która technika dzieli pytanie porównawcze na osobne wyszukiwania dla każdego porównywanego elementu?

Dekompozycja dzieli złożone lub wieloczęściowe pytania na pytania podrzędne pobierane oddzielnie.

Do czego służy monit o krok wstecz?

Podpowiadanie o cofnięciu się, od badaczy Google DeepMind, pobiera ogólne tło przed szczegółami.

W jaki sposób obliczana jest ocena dokumentu w przypadku wzajemnego łączenia rang?

RRF sumuje 1/(k + pozycja) dla każdej listy zawierającej dokument, nagradzając dokumenty zajmujące wysokie pozycje na kilku listach.

Dlaczego RRF jest wygodny do łączenia wyszukiwania wektorowego i wyników BM25?

Ponieważ RRF wykorzystuje tylko pozycje rankingowe, może łączyć listy, których surowe wyniki nie są porównywalne.