Als nächstesNächster Leitfaden
Aufmerksamkeit bei mehreren Abfragen
Sprach-KI
Technischer Leitfaden
Das Umschreiben von Abfragen und das Abrufen mehrerer Abfragen sind RAG-Techniken, die die Frage des Benutzers vor der Suche transformieren, indem sie sie umformulieren, in Unterfragen aufteilen oder mehrere Varianten generieren und ihre Ergebnisse zusammenführen.
Sie sind wichtig, weil Benutzer häufig vage, konversationelle oder mehrteilige Fragen stellen, deren Wortlaut nicht mit den Dokumenten übereinstimmt, und eine bessere Abfrage relevante Passagen aufdecken kann, die bei einer einzelnen wörtlichen Suche übersehen würden.
Die Abrufqualität hängt stark von der Abfrage ab. Benutzer schreiben kurze, mehrdeutige oder konversationelle Fragen, während Dokumente ihr eigenes Vokabular verwenden. Die Abfragetransformation schließt diese Lücke, bevor die Suche durchgeführt wird. Die einfachste Form ist das Umschreiben: Ein LLM verwandelt die Nachricht des Benutzers in eine klarere Suchanfrage. Dies ist im Multi-Turn-Chat von entscheidender Bedeutung, wo Folgefragen wie „Und im Jahr 2023?“ erfolgen. ohne Verlauf nichts bedeuten, daher fasst das System die Konversation zu einer eigenständigen Abfrage zusammen. Durch die Zerlegung wird eine komplexe Frage in Unterfragen aufgeteilt, die separat abgerufen werden können, was für Vergleiche oder Multi-Hop-Fragen nützlich ist. Die von Google DeepMind-Forschern im Jahr 2023 beschriebene Rückschritt-Eingabeaufforderung stellt zunächst eine allgemeinere Frage, um Hintergrundprinzipien abzurufen. Beim Abrufen mehrerer Abfragen werden mehrere Varianten der Frage generiert, für jede eine Suche durchgeführt und die Ergebnisse zusammengeführt. LangChain hat dies mit seinem MultiQueryRetriever bekannt gemacht. RAG-Fusion kombiniert mehrere Abfragen mit Reciprocal Rank Fusion (RRF), einer 2009 von Cormack, Clarke und Buettcher beschriebenen Methode, die jedes Dokument durch Summieren von 1/(k + Rang) über Ergebnislisten hinweg bewertet. Dokumente, die in mehreren Listen weit oben erscheinen, gelangen an die Spitze, ohne dass vergleichbare Rohwerte erforderlich sind. Bei einer verwandten Technik, HyDE (Hypothetical Document Embeddings, Gao und Kollegen, 2022), schreibt das Modell eine hypothetische Antwort und bettet diese anstelle der Frage ein, da ein antwortförmiger Text im Einbettungsraum oft näher an echten Antwortpassagen liegt. Missverständnisse: Mehr Abfragen sind nicht immer besser. Jede Variante erhöht die Latenz und die Kosten, und schlecht generierte Varianten können von der Absicht des Benutzers abweichen und irrelevante Dokumente einziehen. Durch das Umschreiben können auch wichtige Einschränkungen wie Datumsangaben oder Produktnamen wegfallen. Messen Sie die Erinnerungs- und Antwortqualität anhand realer Fragen, bevor Sie diese Schritte unternehmen.
Architekturentscheidungen beeinflussen über Jahre hinweg die Leistung und die Betriebskosten.
Technische Schulungen helfen Teams dabei, den richtigen Stack auszuwählen, nicht nur den neuesten.
Bessere technische Entscheidungen reduzieren Zuverlässigkeitsvorfälle in der Produktion.
Mit der Verbreitung des Agenten-RAG wird die Abfragetransformation zunehmend dadurch gehandhabt, dass das Modell entscheidet, wonach gesucht werden soll, und iteriert, wenn die Ergebnisse schwach erscheinen, und nicht durch einen festen Umschreibungsschritt. Dadurch werden die zugrunde liegenden Ideen, Zerlegung, Varianten und Verschmelzung wichtiger, auch wenn sie weniger sichtbar werden. Verbesserungen bei der Einbettung von Modellen und der Hybridsuche reduzieren einige Vokabularkonflikte, beseitigen aber nicht die Notwendigkeit, mehrdeutige oder konversationsbezogene Fragen zu klären. Erwarten Sie von den Teams, dass sie diese Techniken selektiv einsetzen und dann ausgelöst werden, wenn eine Abfrage komplex erscheint oder der anfängliche Abruf schwach ist, um Qualität und Kosten in Einklang zu bringen.
In einem Chat-Assistenten wird die Nachfrage „Was ist mit Teilzeitkräften?“ angezeigt. wird unter Verwendung der früheren Konversation in eine eigenständige Abfrage wie „Elternurlaubsregelung für Teilzeitbeschäftigte“ umgeschrieben.
Eine Frage zum Vergleich der Preise zweier Cloud-Anbieter wird in separate Suchanfragen für jeden Anbieter zerlegt und die Ergebnisse vor der Beantwortung kombiniert.
Ein Support-Bot generiert vier Formulierungen von „Meine App meldet mich ständig ab“, einschließlich technischer Begriffe wie Sitzungsablauf und Token-Aktualisierung, und führt die Ergebnisse durch gegenseitige Rangverschmelzung zusammen.
Ein wissenschaftlicher Mitarbeiter verwendet die Step-Back-Eingabeaufforderung, um zunächst nach dem allgemeinen Prinzip hinter einer engen Frage zu suchen und dann spezifische Details abzurufen, um dem Modell sowohl Hintergrund als auch Besonderheiten zu geben.
Die Optimierung eines Benchmarks kann umfassendere Systemschwächen verbergen.
Infrastruktur- und Wartungskosten werden oft unterschätzt.
Sicherheits- und Beobachtbarkeitslücken können größer werden, wenn die Systeme komplexer werden.
Definieren Sie vor der Implementierung Latenz-, Qualitäts- und Kostenziele.
Benchmark unter realistischen Last- und Datenbedingungen.
Instrumentenüberwachung auf Fehler, Drift und Benutzereinflüsse.
Bereiten Sie vor der Skalierung Rollback- und Incident-Response-Pfade vor.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Das Umschreiben von Abfragen und das Abrufen mehrerer Abfragen sind RAG-Techniken, die die Frage des Benutzers vor der Suche transformieren, indem sie sie umformulieren, in Unterfragen aufteilen oder mehrere Varianten generieren und ihre Ergebnisse zusammenführen. Sie sind wichtig, weil Benutzer häufig vage, konversationelle oder mehrteilige Fragen stellen, deren Wortlaut nicht mit den Dokumenten übereinstimmt, und eine bessere Abfrage relevante Passagen aufdecken kann, die bei einer einzelnen wörtlichen Suche übersehen würden.
Ein Follow-up wie „Und im Jahr 2023?“ benötigt den Konversationsverlauf, um eine nützliche eigenständige Abfrage zu werden.
Bei der Zerlegung werden komplexe oder mehrteilige Fragen in separat abgerufene Unterfragen unterteilt.
Die Rückschritt-Eingabeaufforderung von Google DeepMind-Forschern ruft allgemeine Hintergrundinformationen vor Einzelheiten ab.
RRF summiert 1/(k + Rang) über jede Liste, die das Dokument enthält, und belohnt Dokumente, die in mehreren Listen einen hohen Rang haben.
Da RRF nur Rangpositionen verwendet, kann es Listen kombinieren, deren Rohwerte nicht vergleichbar sind.
Lerne weiter
Weitere Leitfäden zu diesem Thema ausgewählt
Als nächstesNächster Leitfaden
Aufmerksamkeit bei mehreren Abfragen
Sprach-KI