Technischer Leitfaden

Umschreiben von Abfragen und Abrufen mehrerer Abfragen

Das Umschreiben von Abfragen und das Abrufen mehrerer Abfragen sind RAG-Techniken, die die Frage des Benutzers vor der Suche transformieren, indem sie sie umformulieren, in Unterfragen aufteilen oder mehrere Varianten generieren und ihre Ergebnisse zusammenführen.

  • 3 Minuten gelesen
  • Zuletzt aktualisiert
Auf dieser Seite3 Minuten gelesen
  1. Übersicht
  2. Tiefer Einblick
  3. Strategische Auswirkungen
  4. Die Zukunft des Umschreibens von Abfragen und des Abrufens mehrerer Abfragen
  5. Reale Umsetzung
  6. Risiken und Leitplanken
  7. Implementierungs-Roadmap
  8. Entdecken Sie weiter
  9. Häufig gestellte Fragen

Übersicht

Sie sind wichtig, weil Benutzer häufig vage, konversationelle oder mehrteilige Fragen stellen, deren Wortlaut nicht mit den Dokumenten übereinstimmt, und eine bessere Abfrage relevante Passagen aufdecken kann, die bei einer einzelnen wörtlichen Suche übersehen würden.

Tiefer Einblick

Die Abrufqualität hängt stark von der Abfrage ab. Benutzer schreiben kurze, mehrdeutige oder konversationelle Fragen, während Dokumente ihr eigenes Vokabular verwenden. Die Abfragetransformation schließt diese Lücke, bevor die Suche durchgeführt wird. Die einfachste Form ist das Umschreiben: Ein LLM verwandelt die Nachricht des Benutzers in eine klarere Suchanfrage. Dies ist im Multi-Turn-Chat von entscheidender Bedeutung, wo Folgefragen wie „Und im Jahr 2023?“ erfolgen. ohne Verlauf nichts bedeuten, daher fasst das System die Konversation zu einer eigenständigen Abfrage zusammen. Durch die Zerlegung wird eine komplexe Frage in Unterfragen aufgeteilt, die separat abgerufen werden können, was für Vergleiche oder Multi-Hop-Fragen nützlich ist. Die von Google DeepMind-Forschern im Jahr 2023 beschriebene Rückschritt-Eingabeaufforderung stellt zunächst eine allgemeinere Frage, um Hintergrundprinzipien abzurufen. Beim Abrufen mehrerer Abfragen werden mehrere Varianten der Frage generiert, für jede eine Suche durchgeführt und die Ergebnisse zusammengeführt. LangChain hat dies mit seinem MultiQueryRetriever bekannt gemacht. RAG-Fusion kombiniert mehrere Abfragen mit Reciprocal Rank Fusion (RRF), einer 2009 von Cormack, Clarke und Buettcher beschriebenen Methode, die jedes Dokument durch Summieren von 1/(k + Rang) über Ergebnislisten hinweg bewertet. Dokumente, die in mehreren Listen weit oben erscheinen, gelangen an die Spitze, ohne dass vergleichbare Rohwerte erforderlich sind. Bei einer verwandten Technik, HyDE (Hypothetical Document Embeddings, Gao und Kollegen, 2022), schreibt das Modell eine hypothetische Antwort und bettet diese anstelle der Frage ein, da ein antwortförmiger Text im Einbettungsraum oft näher an echten Antwortpassagen liegt. Missverständnisse: Mehr Abfragen sind nicht immer besser. Jede Variante erhöht die Latenz und die Kosten, und schlecht generierte Varianten können von der Absicht des Benutzers abweichen und irrelevante Dokumente einziehen. Durch das Umschreiben können auch wichtige Einschränkungen wie Datumsangaben oder Produktnamen wegfallen. Messen Sie die Erinnerungs- und Antwortqualität anhand realer Fragen, bevor Sie diese Schritte unternehmen.

Strategische Auswirkungen

Kosten und Budget

Architekturentscheidungen beeinflussen über Jahre hinweg die Leistung und die Betriebskosten.

Klarere Entscheidungen

Technische Schulungen helfen Teams dabei, den richtigen Stack auszuwählen, nicht nur den neuesten.

Qualitätskontrolle

Bessere technische Entscheidungen reduzieren Zuverlässigkeitsvorfälle in der Produktion.

Die Zukunft des Umschreibens von Abfragen und des Abrufens mehrerer Abfragen

Mit der Verbreitung des Agenten-RAG wird die Abfragetransformation zunehmend dadurch gehandhabt, dass das Modell entscheidet, wonach gesucht werden soll, und iteriert, wenn die Ergebnisse schwach erscheinen, und nicht durch einen festen Umschreibungsschritt. Dadurch werden die zugrunde liegenden Ideen, Zerlegung, Varianten und Verschmelzung wichtiger, auch wenn sie weniger sichtbar werden. Verbesserungen bei der Einbettung von Modellen und der Hybridsuche reduzieren einige Vokabularkonflikte, beseitigen aber nicht die Notwendigkeit, mehrdeutige oder konversationsbezogene Fragen zu klären. Erwarten Sie von den Teams, dass sie diese Techniken selektiv einsetzen und dann ausgelöst werden, wenn eine Abfrage komplex erscheint oder der anfängliche Abruf schwach ist, um Qualität und Kosten in Einklang zu bringen.

Reale Umsetzung

In einem Chat-Assistenten wird die Nachfrage „Was ist mit Teilzeitkräften?“ angezeigt. wird unter Verwendung der früheren Konversation in eine eigenständige Abfrage wie „Elternurlaubsregelung für Teilzeitbeschäftigte“ umgeschrieben.

Eine Frage zum Vergleich der Preise zweier Cloud-Anbieter wird in separate Suchanfragen für jeden Anbieter zerlegt und die Ergebnisse vor der Beantwortung kombiniert.

Ein Support-Bot generiert vier Formulierungen von „Meine App meldet mich ständig ab“, einschließlich technischer Begriffe wie Sitzungsablauf und Token-Aktualisierung, und führt die Ergebnisse durch gegenseitige Rangverschmelzung zusammen.

Ein wissenschaftlicher Mitarbeiter verwendet die Step-Back-Eingabeaufforderung, um zunächst nach dem allgemeinen Prinzip hinter einer engen Frage zu suchen und dann spezifische Details abzurufen, um dem Modell sowohl Hintergrund als auch Besonderheiten zu geben.

Risiken und Leitplanken

  • Die Optimierung eines Benchmarks kann umfassendere Systemschwächen verbergen.

  • Infrastruktur- und Wartungskosten werden oft unterschätzt.

  • Sicherheits- und Beobachtbarkeitslücken können größer werden, wenn die Systeme komplexer werden.

Implementierungs-Roadmap

  1. Definieren Sie vor der Implementierung Latenz-, Qualitäts- und Kostenziele.

  2. Benchmark unter realistischen Last- und Datenbedingungen.

  3. Instrumentenüberwachung auf Fehler, Drift und Benutzereinflüsse.

  4. Bereiten Sie vor der Skalierung Rollback- und Incident-Response-Pfade vor.

Entdecken Sie weiter

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Query Rewriting and Multi-Query Retrieval quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Quiz starten

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Häufig gestellte Fragen

Was ist das Umschreiben von Abfragen und das Abrufen mehrerer Abfragen?

Das Umschreiben von Abfragen und das Abrufen mehrerer Abfragen sind RAG-Techniken, die die Frage des Benutzers vor der Suche transformieren, indem sie sie umformulieren, in Unterfragen aufteilen oder mehrere Varianten generieren und ihre Ergebnisse zusammenführen. Sie sind wichtig, weil Benutzer häufig vage, konversationelle oder mehrteilige Fragen stellen, deren Wortlaut nicht mit den Dokumenten übereinstimmt, und eine bessere Abfrage relevante Passagen aufdecken kann, die bei einer einzelnen wörtlichen Suche übersehen würden.

Warum ist das Umschreiben von Abfragen im Multi-Turn-Chat besonders wichtig?

Ein Follow-up wie „Und im Jahr 2023?“ benötigt den Konversationsverlauf, um eine nützliche eigenständige Abfrage zu werden.

Welche Technik unterteilt eine Vergleichsfrage in separate Suchvorgänge für jedes verglichene Element?

Bei der Zerlegung werden komplexe oder mehrteilige Fragen in separat abgerufene Unterfragen unterteilt.

Was bewirkt die Rückschrittaufforderung?

Die Rückschritt-Eingabeaufforderung von Google DeepMind-Forschern ruft allgemeine Hintergrundinformationen vor Einzelheiten ab.

Wie wird bei der reziproken Rangfusion die Punktzahl eines Dokuments berechnet?

RRF summiert 1/(k + Rang) über jede Liste, die das Dokument enthält, und belohnt Dokumente, die in mehreren Listen einen hohen Rang haben.

Warum eignet sich RRF zum Zusammenführen von Vektorsuchen und BM25-Ergebnissen?

Da RRF nur Rangpositionen verwendet, kann es Listen kombinieren, deren Rohwerte nicht vergleichbar sind.